2026年8月26日,Kubernetes发布v1.37迭代,主题命名为"Garhwal"(印度北阿坎德邦喜马拉雅地区)。新版共带来67项增强,其中16项升级至Stable、23项进入Beta、27项进入Alpha,另有1项废除调整。在云原生全面拥抱AI推理的背景下,AI工作负载调度与GPU细粒度管理成为本版本当之无愧的主线。

DRA Slice:一块GPU分给多个Pod

v1.37最受关注的特性是动态资源分配(DRA)的进一步细化。DRA Slice正式走向GA,允许将一块物理GPU切分成多个逻辑分片,分别分配给不同Pod。这一能力对AI推理场景意义重大——典型的推理栈往往需要"模型服务+sidercar"或"prefill Pod+decode Pod"的组合,此前一块GPU只能服务一个Pod,利用率受限;DRA Slice让同一个GPU可以承载多个协同工作负载,显著提升算力利用密度。

设备污点与容忍:设备级隔离

配合细粒度调度的还有DRA设备污点与容忍(device taints and tolerations)能力,它允许在设备级别实现隔离——类似节点污点模型,但下沉到GPU等单个设备维度。这意味着调度粒度从"以节点为单位"细化到"以设备为单位",GPU这种高价值异构资源可以获得更精细的分配与隔离策略,避免故障设备影响运行中的Pod。

内存与运行时稳定性增强

稳定性方面,v1.37强化了内存管理——Pod内存超限后由系统发送SIGKILL信号,并在cgroup v2下新增跨容器汇总的Pod级内存使用量指标container_memory_usage_bytes{scope="pods"},让运维可以更准确地观测整个推理Pod的聚合内存占用。此外,Kubelet支持自动探测容器运行时的健康状态,Kube-proxy新增eBPF-only模式,kube-apiserver引入CPU节流控制,从控制平面到数据平面的稳定性和性能都有提升。

迁移与部署建议

对于正在承载AI推理的企业,建议在升级后优先评估DRA Slice对现有多副本推理工作负载的收益,将GPU利用率的提升纳入成本模型;同时结合设备污点容忍配置故障隔离策略。对于尚未使用DRA的团队,v1.34起DRA已毕业,v1.37的成熟度使其具备在生产规模稳定落地的条件,是切入AI工作负载精细化调度的合适窗口。

觉得有帮助?

联系我们,获取更多技术解决方案

免费咨询