用向量查表真正加速低比特 LLM 的并行推理
Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。
博士生, 清华大学智能产业研究院
我目前就读于清华大学智能产业研究院(AIR),博士四年级,研究方向为面向端侧智能的高效推理系统(博士阶段工作概述)。 目前,我主要关注具身智能的模型系统协同设计,尤其是 VLA 的训练与部署。
ArXiv preprint, 2026
ACM MobiSys 2026Best Paper Award Runner-Up, Results Reproduced @AE
ArXiv preprint, 2024Survey & Position, “Efficiency” Section Lead
Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。
分析 vLLM 对 GPTQv2 格式支持的局限,以及低比特非对称量化推理所需的 CUDA 内核改动。
近期 VLA 正从离散控制走向连续控制,也从单系统架构转向双系统架构。