2026年6月,Kubernetes项目如期发布了v1.36版本,这是云原生领域年度最受关注的版本更新之一。在AI大模型驱动的技术浪潮下,v1.36版本将AI工作负载支持作为核心主题,带来了70项功能增强和改进。其中,AI资源调度框架、动态设备分配和拓扑感知调度等关键特性正式进入GA阶段,标志着Kubernetes从通用容器编排平台向AI基础设施平台的战略转型。
AI资源调度框架正式GA
v1.36最引人注目的特性是AI资源调度框架的正式GA。该框架引入了对GPU、TPU、NPU等加速设备的原生调度支持,Kubernetes调度器能够理解不同类型的AI加速器的性能特征和资源需求,做出最优的调度决策。在之前的版本中,GPU调度主要依赖Device Plugin机制的简单扩展,调度器无法感知GPU的型号差异、显存容量和互联拓扑等关键信息。
新的调度框架引入了资源拓扑感知机制。调度器在选择节点时不仅考虑CPU和内存的剩余量,还会考虑GPU之间的互联关系,优先将需要高速通信的AI任务调度到同一GPU组或NVLink域内的节点上。根据社区基准测试数据,拓扑感知调度可以将大型语言模型的训练吞吐量提升15%到20%。
动态设备分配与资源弹性
动态设备分配是AI资源调度框架的另一个重要组件。v1.36引入了MIG(Multi-Instance GPU)支持的增强,允许Pod在运行期间动态申请和释放GPU实例。这对于推理服务场景非常有价值:当请求量增加时,服务可以动态扩展GPU资源;当请求量下降时,释放的GPU资源可以被其他任务复用。
In-place Pod Vertical Scaling从Beta升级为GA,允许Pod在不重启的情况下调整CPU和内存的请求量和限制。Pod Lifecycle Sleep和Wake特性进入Beta阶段,允许将暂时不活跃的Pod转入睡眠状态,释放其占用的计算资源,同时保留Pod的配置和状态信息。
存储与网络层面的AI优化
v1.36引入了存储拓扑感知调度,调度器在选择数据卷的挂载节点时会考虑存储系统的网络拓扑,优先将计算任务调度到距离数据最近的节点上。网络层面,v1.36对CNI插件接口进行了扩展,支持基于网段的网络QoS策略,通过为训练任务的流量分配专用网络资源池,避免与其他业务流量的竞争。
结构化日志和可观测性方面,v1.36全面提升了AI工作负载的监控能力。新增的GPU资源使用指标可以通过Prometheus直接采集,包括GPU利用率、显存使用量、温度和功耗等信息。与Kepler项目的集成使得集群级别的能效分析成为可能。
安全性与合规性增强
v1.36在安全性方面也做了大量工作。Pod Security Standards的默认策略从Baseline升级为Restricted,对容器运行时的安全配置提出了更高的要求。对于AI训练集群中常用的共享GPU场景,v1.36引入了设备级别的资源隔离和访问控制机制,确保不同租户的AI任务在共享GPU资源时不会相互干扰。
对云原生生态的影响
Kubernetes v1.36的发布标志着云原生基础设施进入了一个新阶段。AI工作负载的原生支持使得Kubernetes不再仅仅是微服务的编排平台,而是成为AI基础设施的核心底座。对于企业的平台工程团队来说,这意味着需要重新评估现有的集群架构和资源管理策略,以适应AI工作负载带来的新需求。对于开发者来说,掌握Kubernetes上的AI工作负载调度将成为一项关键技能。
总体而言,v1.36是Kubernetes发展历程中的一个重要里程碑。它不仅回应了AI时代对基础设施的新需求,也为云原生技术的未来发展指明了方向。随着AI工作负载在Kubernetes上的部署日益普及,我们可以期待看到更多针对AI场景优化的开源项目和最佳实践涌现。