用统一的 KV cache 支撑机器人的多任务推理
OxyGen 将 KV cache 作为跨任务、跨控制周期共享的同一份资源,让 Mixture-of-Transformers VLA 在不损失动作频率的前提下并发生成语言,在 RTX 4090 与 Jetson AGX Thor 上端到端加速最高 3.7×。
标签
这一主题下的全部文章。
OxyGen 将 KV cache 作为跨任务、跨控制周期共享的同一份资源,让 Mixture-of-Transformers VLA 在不损失动作频率的前提下并发生成语言,在 RTX 4090 与 Jetson AGX Thor 上端到端加速最高 3.7×。
通过量化、采样器调优、kernel 优化与 rollout 拓扑设计,在 24 GB GPU 上加速 NVIDIA 的 16B Cosmos 3 机器人策略:从单请求推理到 1,200 个 episode 的全量评测。
近期 VLA 正从离散控制走向连续控制,也从单系统架构转向双系统架构。