李翔宇

李翔宇

博士生, 清华大学智能产业研究院

我目前就读于清华大学智能产业研究院(AIR),博士五年级,研究端侧智能博士阶段工作概述)与具身智能。近期主要探索 VLA、WAM 等具身基础模型的高效部署,以及自进化物理智能。

最新动态

更多

代表论文

更多

OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism

Xiangyu Li, Huaizhi Tang, Xin Ding, Weijun Wang, Ting Cao, Yunxin Liu

ArXiv preprint, 2026

Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices

Xiangyu Li*, Chengyu Yin*, Weijun Wang, Jianyu Wei, Ting Cao, Yunxin Liu

ACM MobiSys 2026Best Paper Award Runner-Up, Results Reproduced @AE

FlexNN: Efficient and Adaptive DNN Inference on Memory-Constrained Edge DevicesCitations: 73

Xiangyu Li, Yuanchun Li, Yuanzhe Li, Ting Cao, Yunxin Liu

ACM MobiCom 2024Results Replicated @AE

Personal LLM Agents: Insights and Survey about the Capability, Efficiency and SecurityCitations: 464

Yuanchun Li, Hao Wen, Weijun Wang, Xiangyu Li, Yizhen Yuan, Guohong Liu, Jiacheng Liu, Wenxing Xu, Xiang Wang, Yi Sun, Rui Kong, Yile Wang, Hanfei Geng, Jian Luan, Xuefeng Jin, Zilong Ye, Guanjing Xiong, Fan Zhang, Xiang Li, Mengwei Xu, Zhijun Li, Peng Li, Yang Liu, Ya-Qin Zhang, Yunxin Liu

ArXiv preprint, 2024Survey & Position, “Efficiency” Section Lead

近期文章

更多

在 RTX 4090 上部署并加速 Cosmos 3 机器人策略

通过量化、采样器调优、kernel 优化与 rollout 拓扑设计,在 24 GB GPU 上加速 NVIDIA 的 16B Cosmos 3 机器人策略:从单请求推理到 1,200 个 episode 的全量评测。

用向量查表真正加速低比特 LLM 的并行推理

Vec-LUT 将重复的标量查表转化为连续的向量读取,在 x86 和 ARM CPU 上将并行三值 LLM 推理加速至多 4.2 倍。

增强 vLLM 对 GPTQv2 格式的支持:分析与实现

分析 vLLM 对 GPTQv2 格式支持的局限,以及低比特非对称量化推理所需的 CUDA 内核改动。