实验 11: 使用 HAMi DRA 共享 GPU 运行 KServe 推理服务
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
部署 KServe Standard vLLM 服务,并通过 HAMi 原生 DRA Claim 让两个 Predictor 副本共享一张 NVIDIA GPU。
构建固定版本的 HAMi,并验证按 Pod 创建 MIG、混合规格、选择性回收、重启恢复和跨 GPU 调度。
用 nvml-mock 模拟 8 张 A100 GPU 验证 HAMi 调度能力,无需真实 GPU。