在 RTX 4090 上部署并加速 Cosmos 3 机器人策略
通过量化、采样器调优、kernel 优化与 rollout 拓扑设计,在 24 GB GPU 上加速 NVIDIA 的 16B Cosmos 3 机器人策略:从单请求推理到 1,200 个 episode 的全量评测。
通过量化、采样器调优、kernel 优化与 rollout 拓扑设计,在 24 GB GPU 上加速 NVIDIA 的 16B Cosmos 3 机器人策略:从单请求推理到 1,200 个 episode 的全量评测。
Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。
分析 vLLM 对 GPTQv2 格式支持的局限,以及低比特非对称量化推理所需的 CUDA 内核改动。
近期 VLA 正从离散控制走向连续控制,也从单系统架构转向双系统架构。
阅读 Dario Amodei 关于强大 AI、可解释性与 AI 政策文章的笔记。
面向开发工作的 Android 智能手机配置实用检查清单。
将 Termux 配置为 Android 开发环境的实用检查清单。
适用于 Raspberry Pi 及类似单板计算机的实用配置清单。
介绍端侧大语言模型部署面临的内存、计算效率与隐私挑战,以及模型压缩和推理优化方法。