标签

LLM Inference

这一主题下的全部文章。

用统一的 KV cache 支撑机器人的多任务推理

OxyGen 将 KV cache 作为跨任务、跨控制周期共享的同一份资源,让 Mixture-of-Transformers VLA 在不损失动作频率的前提下并发生成语言,在 RTX 4090 与 Jetson AGX Thor 上端到端加速最高 3.7×。