LLM Inference · AI Infra

把大模型推得更快、跑得更省

专注于AI Infra / LLM Inference,围绕大模型推理调度、KV Cache、CUDA、FlashAttention 与 Serving System 进行工程实践和性能分析。

/ about

关于我

01

我专注于LLM 推理系统与 GPU 性能优化,近期主要围绕 vLLM Scheduler、KV Cache、MRv2 和 CUDA 执行路径进行源码分析与工程实验。

在 vLLM v0.26 / MRv2 上实现了 step-level Scheduler Trace,将调度决策、KV block 变化与模型执行输入关联起来,并通过可控 workload 复现 full-ISL reservation 下的队首阻塞问题,进一步分析不同调度策略在 TTFT、吞吐、公平性与抢占之间的 trade-off。

目前正在将 Trace 基础设施迁移到 vLLM v0.28,已完成部分 Scheduler 热路径适配、事件语义兼容与 CPU 侧回归验证,真实 GPU / Scheduler 环境验证仍在进行中。

同时,我通过 minitensor 实现 KV Cache、PagedAttention、Continuous Batching、Prefix Cache 与 CUDA Kernel 等核心机制,用于加深对推理引擎底层实现的理解。

这里记录我的工程项目、性能实验与技术文章。

/ projects

项目

02
vLLM Engineering

vLLM Scheduler Trace 与调度实验

v0.26 已完成实验验证 · v0.28 正在迁移

基于 vLLM v0.26 / MRv2 实现 step-level Trace,将 Scheduler 调度决策、KV block 变化与模型执行输入关联起来;使用 CPU / NumPy 元数据和后台 JSONL writer,避免 tracing 引入 GPU 数据回读与额外同步,并通过跨层 token 数不变量校验事件语义一致性。

在 full-ISL reservation 场景下构造可控 workload,复现 waiting queue 队首阻塞问题,并实验 bypass / revocable backfill 类调度策略,分析短请求 TTFT、长请求延迟、吞吐、公平性与抢占之间的 trade-off。

当前正在将 Trace infrastructure 迁移到 vLLM v0.28,已完成部分 Scheduler 热路径适配、事件语义兼容和 CPU 侧回归验证,GPU 与真实 Scheduler 环境验证尚未完成。

33.25s → 0.182s 目标短请求 TTFT
-10.6% Jain 公平性
+3 抢占次数
vLLM 0.26 Scheduler MRv2 KV Cache GPU Profiling
CUDA / Systems

minitensor · 最小化 LLM 推理引擎

用于理解和验证 LLM 推理引擎底层机制的实验型系统实现。

从底层实现 KV Cache、PagedAttention / block table、Continuous Batching、Prefix Cache、reference counting / COW、FP8 PagedKVCache,以及 LayerNorm、Softmax、Matmul 等基础算子,并结合 CUDA Kernel 与性能分析,理解现代 LLM Serving Engine 中的内存管理、批处理和执行机制。

CUDA C++ KV Cache PagedAttention Continuous Batching
/ stack

技术栈

03

推理系统

vLLM Scheduler MRv2 KV Cache PagedAttention Continuous Batching

CUDA / GPU

CUDA C++ Attention Matmul GPU Memory

性能分析

Nsight Compute PyTorch Profiler Benchmarking Tracing

工程

Python C++ Linux Git
/ blog

技术博客

全部文章 → 04
加载中...
/ contact

联系

05

对 LLM Inference、AI Infra、推理优化相关机会开放。

GitHub github.com/Xiaoda11

© xiaoda / 潇达 · AI Infra Engineer LLM Inference · CUDA Kernel · Serving Systems 青ICP备2026001100号 青公网安备63022202000027号