在 RTX 4090 上部署并加速 Cosmos 3 机器人策略
通过量化、采样器调优、kernel 优化与 rollout 拓扑设计,在 24 GB GPU 上加速 NVIDIA 的 16B Cosmos 3 机器人策略:从单请求推理到 1,200 个 episode 的全量评测。
博士生, 清华大学智能产业研究院
我目前就读于清华大学智能产业研究院(AIR),博士五年级,研究端侧智能(博士阶段工作概述)与具身智能。近期主要探索 VLA、WAM 等具身基础模型的高效部署,以及自进化物理智能。
ArXiv preprint, 2026
ACM MobiSys 2026Best Paper Award Runner-Up, Results Reproduced @AE
ArXiv preprint, 2024Survey & Position, “Efficiency” Section Lead
通过量化、采样器调优、kernel 优化与 rollout 拓扑设计,在 24 GB GPU 上加速 NVIDIA 的 16B Cosmos 3 机器人策略:从单请求推理到 1,200 个 episode 的全量评测。
Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。
分析 vLLM 对 GPTQv2 格式支持的局限,以及低比特非对称量化推理所需的 CUDA 内核改动。