实验 11: 使用 HAMi DRA 共享 GPU 运行 KServe 推理服务
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
在 GPU 集群上安装 HAMi,并使用 GPU 切分资源调度 SGLang 推理服务。
安装 HAMi v2.10.0,并验证按 Pod 创建 MIG、混合规格、选择性回收、重启恢复和多 GPU 溢出。
安装 HAMi 2.10.0 与昇腾设备插件,验证模板匹配、多 Pod 共卡、容量耗尽、整卡互斥和 Ascend 310P3 上的监控指标。
在昇腾 310P3 节点上安装 HAMi DRA 0.2.3 与 Ascend DRA Driver,观察 webhook 如何把 huawei.com/Ascend310P 请求转换成 ResourceClaim,并验证双 Pod NPU 共享、显存配额隔离与调度器容量记账。
用 nvml-mock 模拟 8 张 A100 GPU 验证 HAMi 调度能力,无需真实 GPU。