大模型速度测试报告

Run ID: 20260917-083754 | 时间: 2026-09-17T08:37:54.907884 | 用例: 9 | 重复: 3次
模型: Qwen3.6-35B-A3B-heretic-NVFP4 | 平台: linux
总用例数
9
SLO 达标率
91.7%
44 / 48 个请求达标
断言通过率
91.7%
评测通过用例
6
评测未过用例
2
执行失败
1
总耗时
84.23s

🎯 SLO 达标率(goodput)

达标率
91.7%
44 / 48 个请求
执行失败
0
留在分母里,不算达标
无法判定
0
缺 TTFT/E2E,不算达标
未达标
4
违反任一约束即算
一个请求算「好」= 同时满足全部三条约束(SLO 是联合条件,不是分别打分再平均)。分母是本次运行发出的全部请求,不是「成功的请求」——把失败请求排除在分母外,会让达标率系统性偏乐观。
ITL 口径:GenAI-Perf(机器名 genai-perf,(E2E-TTFT)/(completion_tokens-1),不含 TTFT)。LLMPerf 用的是含 TTFT 的口径,同一份数据两者能差 70% 以上,所以口径必须写明,否则数字不可比。
生成不足 2 个 token 的请求没有「token 间隔」可言,ITL 约束对其不适用也不判负(本次 11 条)。
约束阈值违反次数占全部请求
TTFT≤ 2000 ms48.3%
ITL≤ 60 ms00.0%
E2E≤ 30000 ms00.0%
一个请求可同时违反多项,故各行之和 ≥ 未达标数(4)。

逐用例达标率

用例请求数达标率执行失败ITL 不适用无法判定
纯文本生成基准3100.0% (3/3)000
简单工具调用延迟3100.0% (3/3)000
文件读取+分析3100.0% (3/3)000
并行工具调用3100.0% (3/3)030
长上下文处理12100.0% (12/12)000
复杂推理任务9100.0% (9/9)000
多轮对话累积3100.0% (3/3)000
Claude Code 长上下文注入1266.7% (8/12)080

评测断言

「执行状态」只说明用例跑完没抛异常;「评测结论」才是断言是否全过——此前二者混为一谈,未做任何正确性判定。
用例评测结论断言通过通过率
纯文本生成基准未过3/475.0%
简单工具调用延迟通过3/3100.0%
文件读取+分析通过3/3100.0%
并行工具调用通过2/2100.0%
长上下文处理未过2/366.7%
复杂推理任务通过3/3100.0%
多轮对话累积通过2/2100.0%
Claude Code 长上下文注入通过4/4100.0%

未通过的断言(2)

用例断言说明
纯文本生成基准greedy 采样下输出可复现出现 3 种不同输出,内核/精度路径可能不确定
长上下文处理prefill 耗时随上下文递增上下文 2000→4000 时 212.3→159.3(回退超 15.0%)

长上下文处理 · 分档明细

档位字段 context_tokens_target(上下文 token);用例级中位数取最慢档,档间差异是设计差异、不是抖动——所以各档的 CV / 稳定性才是抖动指标。
逐档达标率连起来就是这条曲线要回答的问题:从哪一档开始掉出 SLO(口径与阈值见下面的「SLO 达标率」一节)。
跨档混合中位数为 291.88 ms,不对应任何真实工况,仅列此备查。
档位n中位 E2E(ms)CVP95(ms)达标率稳定性prefill tok/s中位 prompt tok
5003261.260.5%N/A (n=3<20)100.0% (3/3)稳5245.76650
10003268.1818.9%N/A (n=3<20)100.0% (3/3)抖9657.671277
20003347.5710.7%N/A (n=3<20)100.0% (3/3)一般12008.612550
40003293.331.6%N/A (n=3<20)100.0% (3/3)抖31861.845077

复杂推理任务 · 分档明细

档位字段 reasoning_level(推理档位);用例级中位数取最慢档,档间差异是设计差异、不是抖动——所以各档的 CV / 稳定性才是抖动指标。
逐档达标率连起来就是这条曲线要回答的问题:从哪一档开始掉出 SLO(口径与阈值见下面的「SLO 达标率」一节)。
跨档混合中位数为 2295.83 ms,不对应任何真实工况,仅列此备查。
档位n中位 E2E(ms)CVP95(ms)达标率稳定性prefill tok/s中位 prompt tok
中等推理32295.836.3%N/A (n=3<20)100.0% (3/3)稳179.222
复杂推理34330.487.1%N/A (n=3<20)100.0% (3/3)稳216.1929
简单问答3973.542.9%N/A (n=3<20)100.0% (3/3)稳111.2515

多轮对话累积 · 逐步明细(上下文累积)

这是累积增长的序列(字段 round),不是同一工况的重复测量——中位数/P95 在增长曲线上没有意义,故不计算,只看逐轮变化。首轮到末轮增长 8.5%。
步骤n中位 E2E(ms)CVP95(ms)达标率稳定性prefill tok/s中位 prompt tok
111343.76N/AN/A (n=1<20)100.0% (1/1)单次261.0135
211359.89N/AN/A (n=1<20)100.0% (1/1)单次1561.49188
311458.18N/AN/A (n=1<20)100.0% (1/1)单次2587.81338

Claude Code 长上下文注入 · 分档明细

档位字段 context_tokens_target(上下文 token);用例级中位数取最慢档,档间差异是设计差异、不是抖动——所以各档的 CV / 稳定性才是抖动指标。
逐档达标率连起来就是这条曲线要回答的问题:从哪一档开始掉出 SLO(口径与阈值见下面的「SLO 达标率」一节)。
跨档混合中位数为 820.01 ms,不对应任何真实工况,仅列此备查。
档位n中位 E2E(ms)CVP95(ms)达标率稳定性prefill tok/s中位 prompt tok
320003341.71104.6%N/A (n=3<20)66.7% (2/3)抖93265.1326577
640003478.75101.8%N/A (n=3<20)66.7% (2/3)抖125742.6853277
960003589.7599.4%N/A (n=3<20)66.7% (2/3)抖138981.2679977
12800031067.1387.3%N/A (n=3<20)66.7% (2/3)抖100098.87106677

Claude Code 长上下文注入 · 口径说明

输出 token 固定为 8,重点看 prefill 与首 token,不看长输出 decode;测试档位 [32000, 64000, 96000, 128000]。

性能分析

性能对比柱状图

横轴为各历史运行(每次运行一根柱子),纵轴为该运行所有用例平均延迟的均值;橙色柱为当前正在查看的运行。
口径标记 measure_version = cases_v6_prompt_token_capture,只对比同口径的运行。另有 7 次旧口径运行未纳入对比(数字仍保留在 data/results/)。

本次运行各用例延迟对比

平均延迟取各次重复的均值,中位延迟取中位数—— 重复次数少时二者差距本身就是抖动信号,故并列显示;判断稳定性看中位数与标准差。

P95 延迟对比

本次运行各用例样本量均不足 20,未计算 P95/P99。
n < 20 时最近秩的「P95」在数学上恒等于最大值(第 ceil(0.95n) 个样本就是最后一个),显示出来只会让人误以为有 95 分位的信息量。需要 P95 请提高 BENCH_REPEATS(≥ 20)后重跑。

详细数据

用例名称难度评测结论断言执行状态 中位延迟 (ms)平均延迟 (ms)平均 Prefill (ms)平均 Prefill tok/s TTFT (ms)Decode tok/sITL (ms)标准差P95 (ms)达标率
纯文本生成基准简单未过3/4passed1516.31443.45121.05272.66121.0588.5911.29182.34N/A (n=3<20)100.0% (3/3)
简单工具调用延迟简单通过3/3passed254.02249.51120.63527.85120.63107.339.3215.91N/A (n=3<20)100.0% (3/3)
文件读取+分析中等通过3/3passed3449.033444.8134.381404.1134.3890.3811.0696.62N/A (n=3<20)100.0% (3/3)
并行工具调用中等通过2/2passed851.66841.31N/AN/A231.569.8814.3140.73N/A (n=3<20)100.0% (3/3)
长上下文处理耗时未过2/3passed347.57
最慢档 2000(4 档 × 3 次)
N/A185.6413085.79185.64102.619.75N/AN/A (n=12<20)100.0% (12/12)
复杂推理任务耗时通过3/3passed4330.48
最慢档 复杂推理(3 档 × 3 次)
N/A129.54170.64129.5491.6610.91N/AN/A (n=9<20)100.0% (9/9)
多轮对话累积耗时通过2/2passed1458.18
末轮 3(单次测量)
N/A128.371470.1128.3794.6910.56N/AN/A (n=3<20)100.0% (3/3)
Claude Code 长上下文注入耗时通过4/4passed1067.13
最慢档 128000(4 档 × 3 次)
N/A1870.6883849.381888.031326.20.75N/AN/A (n=12<20)66.7% (8/12)

环境信息

模型Qwen3.6-35B-A3B-heretic-NVFP4
模型IDvllm:qwen36-35b-a3b-heretic-nvfp4
后端openai (本地 8080)
运行平台linux
容器1cat-qwen36-35b-a3b-heretic-nvfp4-server
镜像1cat-vllm
镜像 digestsha256:7b19a9f733dec2bb17acfa5604624a438af0600fadc12a13eb81a180ec127cb9
端口8080
类型vllm
托管容器True
启动时间2026-09-15 13:16:02
运行ID20260917-083754
测试时间2026-09-17T08:37:54.907884

启动参数

容器命令[vllm serve /models/Qwen3.6-35B-A3B-heretic-NVFP4 --served-model-name Qwen3.6-35B-A3B-heretic-NVFP4 --trust-remote-code --enable-auto-tool-choice --tool-call-parser qwen3_xml --tensor-parallel-size 4 --attention-backend FLASH_ATTN_V100 --kv-cache-dtype fp8_e5m2 --enable-prefix-caching --max-model-len 262144 --max-num-seqs 8 --gpu-memory-utilization 0.78]