博客

用向量查表真正加速低比特 LLM 的并行推理

Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。

增强 vLLM 对 GPTQv2 格式的支持:分析与实现

分析 vLLM 对 GPTQv2 格式支持的局限,以及低比特非对称量化推理所需的 CUDA 内核改动。

视觉—语言—动作(VLA)模型:近期进展综述

近期 VLA 正从离散控制走向连续控制,也从单系统架构转向双系统架构。

Dario Amodei 博客阅读笔记

阅读 Dario Amodei 关于强大 AI、可解释性与 AI 政策文章的笔记。

Android 智能手机配置速查表

面向开发工作的 Android 智能手机配置实用检查清单。

Android 手机上 Termux 配置速查表

将 Termux 配置为 Android 开发环境的实用检查清单。

Pi 设备配置速查表

适用于 Raspberry Pi 及类似单板计算机的实用配置清单。

"口袋里的 GPT",离我们还有多远?

唠一唠端侧大模型部署那些事。