实验 11: 使用 HAMi DRA 共享 GPU 运行 KServe 推理服务
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
在昇腾 310P3 节点上安装 HAMi DRA 0.2.3 与 Ascend DRA Driver,观察 webhook 如何把 huawei.com/Ascend310P 请求转换成 ResourceClaim,并验证双 Pod NPU 共享、显存配额隔离与调度器容量记账。
通过 Kubernetes 原生 Dynamic Resource Allocation 实现同样效果(实验性)。
在 Pod 进入调度器之前,按 vGPU 数量、显存和算力执行配额准入。