Skip to main content
返回案例列表
医疗 / AI 推理

某省级医疗影像 AI 公司

面向全国医院提供 CT/MRI 辅助诊断服务,对并发和延迟敏感

87ms
P99 延迟
4.2x
日均处理量
99.95%
可用性

项目概况

集群规模 H100 × 32 推理集群
技术栈 vLLM + TensorRT + Triton
运行时长 7×24 小时在线
关键亮点 99.95% 可用性 + 弹性自动扩缩容

关键指标

项目核心数据全景

P99 延迟
87ms
-79%
日均处理量
4.2x
+320%
可用性
99.95%
推理集群
H100×32
弹性扩缩
24h
单次推理
50ms
客户证言

客户证言

医院影像有明显的波峰波谷,上午 9-11 点和下午 2-4 点是高峰。ZaiCloud 的 TensorRT 优化和 AutoScaler 把 P99 压到 87ms,资源反而比之前买得少。
陈思远
CTO · 某省级医疗影像 AI 公司
P99 87ms 弹性扩缩容 4.2x 日均

技术架构

从应用到基础设施的四层方案

L4
应用层
CT/MRI 辅助诊断 DICOM 接入 模型集成
面向医院的 CT/MRI 辅助诊断服务,标准 DICOM 协议接入
L3
调度层
TensorRT 优化 Triton 推理服务 Continuous Batching
TensorRT 模型优化 + Triton 推理服务 + 批处理提升吞吐
L2
算力层
H100 × 32 推理 AutoScaler 弹性
H100 推理集群,根据 QPS 自动扩缩容
L1
基础设施层
弹性监控 主动告警 灰度发布
AutoScaler 实时监控 + 主动告警 + 灰度发布
顶层为应用层,底层为基础设施层

挑战

项目要解决的核心难题

医疗影像 AI 服务对延迟要求极高,P99 延迟必须低于 100ms。同时医院影像检查有明显的波峰波谷——上午 9-11 点和下午 2-4 点是高峰期,需要快速扩缩容。

解决方案

ZaiCloud 的核心策略

  1. 1

    ZaiCloud 的推理服务方案:

  2. 2

    TensorRT 优化将单次推理延迟降至 50ms 以下;

  3. 3

    vLLM 的 Continuous Batching 提升吞吐量;

实施过程

从集群规划到正式生产的关键里程碑

  1. Day 1-3

    模型优化与 TensorRT 转换

  2. Day 4-7

    推理服务部署

  3. Week 2

    AutoScaler 配置与压测

  4. Week 3

    正式上线与监控

业务影响

P99 延迟从 420ms 降至 87ms,日均处理量提升 4.2 倍

延迟优化

TensorRT 优化将单次推理降至 50ms 以内,P99 降至 87ms

87ms

容量提升

AutoScaler 弹性扩缩容,日均处理量提升 4.2 倍

4.2x

高可用

7×24 在线服务,可用性 99.95%

99.95%

有类似需求?

联系我们的专家,获取定制化智算解决方案