开放合作 · 寻找新机会

把大模型推得更快、跑得更省

我是一名 AI Infra 工程师,方向是推理部署与加速:从 CUDA kernel 到请求调度,从单卡显存管理到 serving,让 LLM 有更高吞吐、更低时延和更可控成本。

/ about

关于我

01

我专注于让推理跑得更快这一件事。日常工作横跨推理引擎内部机制、显存与 KV Cache 管理、批处理调度,以及把这些优化稳定地落到生产部署里。

我喜欢深入到系统的底层去理解性能瓶颈,而不是把引擎当黑盒。为此我用 C++ 从零写了 minitensor,复刻 vLLM 的核心思路,以此把 PagedAttention、continuous batching 这些机制吃透。

这里展示我的项目、开源工作、技术栈与技术博客。

/ projects

项目

02
源码阅读

vLLM / LLM Serving 的源码阅读与小规模压测

聚焦 scheduler、PagedAttention、block table、KV Cache 分配与 continuous batching。

  • 区分 prefill / decode 的计算与显存特征。
  • 观察 TTFT、TPOT、吞吐和显存碎片的取舍。
vLLM Scheduler Prefix Caching
/ stack

技术栈

03

LLM Inference

KV Cache PagedAttention Scheduler TTFT / TPOT

CUDA / GPU

CUDA C/C++ Matmul Attention Nsight

Model Basics

PyTorch Transformer CNN 评估

Engineering

Python C/C++ Linux Throughput
/ blog

技术博客

04
加载中...
/ contact

联系

05
GitHub github.com/Xiaoda11

© xiaoda / 潇达 · AI Infra Engineer LLM Inference · CUDA Kernel · Serving Systems 青ICP备2026001100号 青公网安备63022202000027号