标签: Quantization

用向量查表真正加速低比特 LLM 的并行推理

Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。

增强 vLLM 对 GPTQv2 格式的支持:分析与实现

分析 vLLM 对 GPTQv2 格式支持的局限,以及低比特非对称量化推理所需的 CUDA 内核改动。