用统一的 KV cache 支撑机器人的多任务推理
OxyGen 将 KV cache 作为跨任务、跨控制周期共享的同一份资源,让 Mixture-of-Transformers VLA 在不损失动作频率的前提下并发生成语言,在 RTX 4090 与 Jetson AGX Thor 上端到端加速最高 3.7×。
标签
这一主题下的全部文章。
OxyGen 将 KV cache 作为跨任务、跨控制周期共享的同一份资源,让 Mixture-of-Transformers VLA 在不损失动作频率的前提下并发生成语言,在 RTX 4090 与 Jetson AGX Thor 上端到端加速最高 3.7×。
Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。
介绍端侧大语言模型部署面临的内存、计算效率与隐私挑战,以及模型压缩和推理优化方法。