vLLM Scheduler Trace 与调度实验
v0.26 已完成实验验证 · v0.28 正在迁移
基于 vLLM v0.26 / MRv2 实现 step-level Trace,将 Scheduler 调度决策、KV block 变化与模型执行输入关联起来;使用 CPU / NumPy 元数据和后台 JSONL writer,避免 tracing 引入 GPU 数据回读与额外同步,并通过跨层 token 数不变量校验事件语义一致性。
在 full-ISL reservation 场景下构造可控 workload,复现 waiting queue 队首阻塞问题,并实验 bypass / revocable backfill 类调度策略,分析短请求 TTFT、长请求延迟、吞吐、公平性与抢占之间的 trade-off。
当前正在将 Trace infrastructure 迁移到 vLLM v0.28,已完成部分 Scheduler 热路径适配、事件语义兼容和 CPU 侧回归验证,GPU 与真实 Scheduler 环境验证尚未完成。