Skip to content

ADR 0003: Baseline 数字 (官方 + 本地对照)

日期: 2026-07-01 状态: Accepted Owner: 队长 recoletas 关联: ADR 0013 (规则解读), HANDOVER.md, docs/weekly/progress.md

官方提交结果 (2026-07-01, Accepted)

档位 官方 tok/s SLA 扣分 精度扣分
4-8K 12.95 0.0 0.0
8-16K 10.03 0.0 0.0
16-32K 5.75 0.0 0.0
  • 最终得分: 59.9119, 排名 56/76
  • SLA: TTFT P99 / TPOT P99 双 0 扣分 — baseline 路径安全, 不要在剩余 14 天里动到熔断边界

本地 bench 对照

  • 本地 4-8K = 13.797 tok/s (start_vllm_bench.sh + 全部优化 env/flag + 共享盘 IO)
  • 官方 4-8K = 12.95 tok/s
  • 差 ~6% — 来自评测平台环境抖动 (无 runai_streamer / 无 vllm_cache_root 持久化 / DCU 状态差异)
  • 结论: bench 命令路径 ≈ 评测平台路径, 启动侧不需要大改

历史数字 (不可比对, 仅参考)

来源 4-8K tok/s 说明
2026-06-22 历史 12.16 不同容器 + 不同 DTK, 走 content array (VLM) 路径
2026-06-30 dev command 中间值 10.166 text path + 无优化 env, 已废弃
2026-06-30 本地 bench (启动优化后) 13.797 当前可比基线
2026-07-01 官方提交 12.95 评测平台最终

12.16 / 10.166 与 13.797 / 12.95 不可直接比对, content path + 环境差异都 > 优化带来的差.

决策

  • 官方 baseline = 12.95 / 10.03 / 5.75, 后续所有优化项的"提升 %" 都相对这三个数字算
  • 本地 bench 4-8K 13.797 作为内部开发参考基线 (验证 bench 命令路径正确性), 不作为评分基准
  • 不要再回头对齐 12.16 / 10.166, 浪费时间

后续优化约束 (来自本 baseline)

  • SLA=0 + 精度=0 是当前优势, 任何优化先 4-8K smoke 再推广
  • bench 命令路径已对标评测平台, 不再做大启动侧调整
  • 14 天窗口, 优先低风险路径 (block_size sweep → INT8 KV smoke)