客户案例|深信服基于 Kubernetes、Volcano 与 HAMi 构建企业级 AI 算力平台
深信服是中国领先的企业级云计算与网络安全厂商。面对 AI 应用的快速增长,深信服为内部研发团队与企业客户构建统一 AI 算力平台,支撑 AI Coding、数字员工、智能客服与销售 Agent 等场景——GPU 利用率提升 3 倍以上,单卡承载 8 个以上模型,外部模型调用成本从每月 40 万元降至 20 万元。
客户概览
深信服是中国领先的企业级云计算与网络安全厂商。随着 AI 应用快速增长,深信服正在为内部研发团队与企业客户构建统一 AI 算力平台,支撑 AI Coding、数字员工、智能客服、销售 Agent 等场景。平台以 AI 算力网关承载路由、治理与安全检查,底层以 Kubernetes、Volcano 与 HAMi 构建共享 GPU 底座,让 Kubernetes 成为统一的 AI 资源控制面。
面向内部研发团队与企业客户的统一 AI 算力平台
覆盖 AI Coding、数字员工、智能客服、销售 Agent 等生产场景
AI 算力网关负责路由与治理,Kubernetes + Volcano + HAMi 构建算力底座
深信服科技
中国领先的企业级云计算与网络安全厂商。其云 AI 团队构建的统一 AI 算力平台,支撑 2000+ 研发工程师的日常使用并服务企业客户。
案例信息
本案例源自 CNCF 官方 Case Study: CNCF Case Study
挑战:规模化下的 GPU 利用率、隔离与调度
平台持续扩张的过程中,GPU 利用率、资源隔离与调度效率成为关键瓶颈——平台需要同时服务大量 AI 负载与研发团队。
GPU 利用率不足
传统模式下,推理服务独占整张 GPU。大量负载只用其中一小部分显存与算力却占住整卡,造成严重的资源碎片化——GPU 扩容速度甚至超过了业务本身的增长速度。
多租户环境下的资源治理复杂
平台同时承载 AI Coding、数字员工、智能客服、销售 Agent 与企业知识助手等负载,GPU 需求差异巨大——有的需要长驻显存,有的呈现明显的峰谷特征——统一资源池管理与公平分配成为关键问题。
推理与批处理负载共存
平台同时运行在线推理、批量推理、分布式训练与 Agent 工作流,原生 Kubernetes GPU 调度无法满足这些复杂 AI 负载的需求。
解决方案:Kubernetes + Volcano + HAMi
Kubernetes 为 AI 平台提供了统一的控制面,但原生 GPU 调度只能以整卡为单位分配资源,难以满足推理服务、多租户与异构 GPU 环境的需求。深信服引入 Volcano 解决高级调度问题,引入 HAMi 解决 GPU 资源虚拟化问题,构建生产级共享 GPU 平台。
“HAMi 的 Kubernetes 原生集成意味着零迁移成本,透明的设备虚拟化让负载无需任何改造即可运行。”
HAMi:vGPU 共享与隔离
深信服选择 HAMi 的核心原因:细粒度 GPU 共享与强隔离、跨多代异构 GPU 的统一资源抽象,以及 Kubernetes 领域最活跃的开源 vGPU 生态之一。通过 vGPU 切分,大模型占据单卡大部分资源(例如 70%),剩余切片承载多个小模型,吸收原本闲置的算力。
GPU 共享:显存粒度低至 256MB、算力粒度低至 1%,多个 Pod 在强隔离下共享同一张 GPU
异构 GPU 支持:统一资源抽象,跨多代 GPU 保持一致的调度体验
开源生态:Kubernetes 领域最活跃的开源 vGPU 项目之一,持续与 Volcano 队列和 vLLM 集成
Volcano + HAMi:协同调度
仅靠 GPU 共享不足以支撑生产环境。Volcano 与 HAMi 结合,实现设备资源与作业调度的统一管理:Volcano 决定负载何时、在哪里运行,HAMi 决定 GPU 资源如何共享与分配。
设备状态维护
GPU 健康监测、故障自动隔离、资源自动回收。
资源声明治理
自动补全资源字段、统一配额计算、提前拒绝无效请求。
调度事务隔离
将资源试算与实际占用解耦,确保状态一致性。
Gang 与 LWS 支持
Volcano 编排作业、HAMi 分配 GPU,整组任务一同调度。
落地成效
借助 HAMi vGPU 切分与 Volcano 协同调度,平台消除了资源碎片化、显著降低模型调用成本并在压力下保持稳定——同时支撑 2000+ 研发团队的日常使用。
GPU 利用率
3×+
共享 GPU 池消除碎片化,同样硬件承载更多负载
单卡模型密度
8×+
原本需要 3 张卡的负载现在 1–2 张即可承载
外部调用成本
-50%
智能路由让月调用成本从 40 万元降至 20 万元
故障恢复
<10 分钟
从约 1 小时大幅缩短;3 倍峰值流量下成功率保持 95%+
改造前后对比
共享 GPU 平台建设前后的关键指标对比。
| 指标 | 改造前 | 改造后 |
|---|---|---|
| GPU 利用率 | 基线 | 提升 3 倍以上 |
| 单卡模型数 | 1 | 8+ |
| 外部模型调用成本 | 40 万元/月 | 20 万元/月 |
| 模型故障恢复时间 | 约 1 小时 | 10 分钟以内 |
| 3 倍峰值流量成功率 | 不稳定 | 95%+ |
| 支撑研发团队规模 | 有限 | 2000+ 工程师 |
经验总结
GPU 共享比加卡更重要:大多数推理负载无法用满整张 GPU,优先做 GPU 共享——ROI 更高、见效更快。
调度与资源虚拟化解耦:HAMi 负责资源抽象,Volcano 负责调度策略,解耦之后两层各自独立演进。
Kubernetes 正在成为 AI 资源控制面:AI 基础设施沿云原生路径演进,无需引入新的管理范式即可获得企业级 GPU 管理能力。
展望未来,深信服将持续与 HAMi 社区合作:参与 HAMi DRA 生态、通过统一抽象扩展昇腾等异构 GPU 支持,并将生产级调度策略回馈 Volcano 与 HAMi 社区。
让 Kubernetes 成为统一的 AI 资源控制面
深信服的实践给出了企业 AI 基础设施的一条路径:在网关层治理模型使用,在虚拟化层共享 GPU,用 Volcano 完成作业调度——全部构建在 Kubernetes 之上,让每一张 GPU 为 2000+ 工程师的团队发挥全部价值。