返回案例列表
医疗 / AI 推理
某省级医疗影像 AI 公司
面向全国医院提供 CT/MRI 辅助诊断服务,对并发和延迟敏感
87ms
P99 延迟
4.2x
日均处理量
99.95%
可用性
项目概况
集群规模 H100 × 32 推理集群
技术栈 vLLM + TensorRT + Triton
运行时长 7×24 小时在线
关键亮点 99.95% 可用性 + 弹性自动扩缩容
关键指标
项目核心数据全景
P99 延迟
87ms
-79%
日均处理量
4.2x
+320%
可用性
99.95%
推理集群
H100×32
弹性扩缩
24h
单次推理
50ms
客户证言
客户证言
医院影像有明显的波峰波谷,上午 9-11 点和下午 2-4 点是高峰。ZaiCloud 的 TensorRT 优化和 AutoScaler 把 P99 压到 87ms,资源反而比之前买得少。
陈思远
CTO · 某省级医疗影像 AI 公司
P99 87ms 弹性扩缩容 4.2x 日均
技术架构
从应用到基础设施的四层方案
L4
应用层
CT/MRI 辅助诊断 DICOM 接入 模型集成
面向医院的 CT/MRI 辅助诊断服务,标准 DICOM 协议接入
L3
调度层
TensorRT 优化 Triton 推理服务 Continuous Batching
TensorRT 模型优化 + Triton 推理服务 + 批处理提升吞吐
L2
算力层
H100 × 32 推理 AutoScaler 弹性
H100 推理集群,根据 QPS 自动扩缩容
L1
基础设施层
弹性监控 主动告警 灰度发布
AutoScaler 实时监控 + 主动告警 + 灰度发布
顶层为应用层,底层为基础设施层
挑战
项目要解决的核心难题
医疗影像 AI 服务对延迟要求极高,P99 延迟必须低于 100ms。同时医院影像检查有明显的波峰波谷——上午 9-11 点和下午 2-4 点是高峰期,需要快速扩缩容。
解决方案
ZaiCloud 的核心策略
- 1
ZaiCloud 的推理服务方案:
- 2
TensorRT 优化将单次推理延迟降至 50ms 以下;
- 3
vLLM 的 Continuous Batching 提升吞吐量;
实施过程
从集群规划到正式生产的关键里程碑
- Day 1-3
模型优化与 TensorRT 转换
- Day 4-7
推理服务部署
- Week 2
AutoScaler 配置与压测
- Week 3
正式上线与监控
业务影响
P99 延迟从 420ms 降至 87ms,日均处理量提升 4.2 倍
延迟优化
TensorRT 优化将单次推理降至 50ms 以内,P99 降至 87ms
87ms
容量提升
AutoScaler 弹性扩缩容,日均处理量提升 4.2 倍
4.2x
高可用
7×24 在线服务,可用性 99.95%
99.95%