YK / LAB

EXPERIMENT 001 / INFERENCE

快多少,
值得付出什么?

把吞吐、长尾延迟和资源预算放在一起看。先筛选能满足约束的配置,再比较成本。

下载 CSV 模板

正在加载演示数据…

02 / 观察取舍

吞吐与延迟预算

绿色:满足约束 · 灰色:超出预算
配置明细与满负载 GPU 费用估算
配置 batch / 并发 P50 / P95 ms 工作项/秒 显存 GB $/百万工作项 状态

费用 = GPU 小时总费用 ÷(成功工作项/秒 × 3600)× 1,000,000。未含闲置、CPU、网络、存储与重试;没有价格时不估算。量化配置还需要单独验证质量。

03 / 换成真实实验

一张表,连接测试与交付。

演示展示了大 batch 增加吞吐,也可能超出延迟预算。这里所有数值都是合成示例,不代表任何型号的实测性能。

  1. 固定负载记录模型、输入、精度、GPU、软件版本与测试范围。
  2. 采集数据用你的服务压测;仓库也提供 CUDA 矩阵乘采样脚本。
  3. 核对后交付导入 CSV,检查质量和失败率,再给出有条件的建议。