EXPERIMENT 001 / INFERENCE
快多少,
值得付出什么?
把吞吐、长尾延迟和资源预算放在一起看。先筛选能满足约束的配置,再比较成本。
正在加载演示数据…
02 / 观察取舍
吞吐与延迟预算
绿色:满足约束 · 灰色:超出预算| 配置 | batch / 并发 | P50 / P95 ms | 工作项/秒 | 显存 GB | $/百万工作项 | 状态 |
|---|
费用 = GPU 小时总费用 ÷(成功工作项/秒 × 3600)× 1,000,000。未含闲置、CPU、网络、存储与重试;没有价格时不估算。量化配置还需要单独验证质量。
03 / 换成真实实验
一张表,连接测试与交付。
演示展示了大 batch 增加吞吐,也可能超出延迟预算。这里所有数值都是合成示例,不代表任何型号的实测性能。
- 固定负载记录模型、输入、精度、GPU、软件版本与测试范围。
- 采集数据用你的服务压测;仓库也提供 CUDA 矩阵乘采样脚本。
- 核对后交付导入 CSV,检查质量和失败率,再给出有条件的建议。