NodeWright:让Kubernetes节点集群管理更简单
NVIDIA发布开源项目NodeWright,作为Kubernetes原生的主机操作系统包管理器,可在不中断工作负载的前提下,对GPU节点集群进行声明式配置与滚动更新。它支持渐进式部署策略、内置验证机制,并与NVIDIA...
NVIDIA发布开源项目NodeWright,作为Kubernetes原生的主机操作系统包管理器,可在不中断工作负载的前提下,对GPU节点集群进行声明式配置与滚动更新。它支持渐进式部署策略、内置验证机制,并与NVIDIA...
NVIDIA发布开源Kubernetes控制器NVCRE,可在AI工作负载上线前通过真实分布式任务验证GPU集群就绪性,自动定位故障节点,支持自适应故障隔离与NCCL、NeMo等多类测试。
云与AI基础设施中大量闲置的"僵尸工作负载"持续消耗资源与预算,IDCA估算美国云使用量中约13%属此类浪费,GPU时代因成本更高使问题更为突出,业界正通过FinOps、可观测性工具及Kubernetes演进加以应对。
NVIDIA FLARE通过分离持久化联邦服务与作业执行层,使不同站点可分别采用Docker、Kubernetes或Slurm运行联邦学习任务,并通过Study机制实现多研究的数据与资源隔离。
现代AI平台需要跨多集群、多云环境传递用户身份,而非依赖单点SSO。文章介绍了一种中心化身份网关模式:由统一身份网关负责会话创建与生命周期管理,各区域网关通过共享验证接口确认会话并注入可信身份信息。NVIDIA采用该方案...
Kubernetes 1.37正式发布,代号Garhwal,是2026年第二个主要版本。本次更新重点面向AI与机器学习场景,引入原生Gang调度支持分布式训练任务的全量或零量Pod部署,HPA缩容至零功能升至Beta,可...
在2026年布拉格SUSECON大会上,欧洲开源巨头SUSE宣布与英伟达合作推出SUSE AI Factory,这是一款经过预验证的一站式AI平台。该平台基于SUSE Rancher Prime和SLES构建,集成英伟达...
本文探讨了云原生环境中 AI/ML 负载激增带来的变革,强调借助 Kubernetes 等新型工具实现规模、敏捷和便携优势,并以 Pizza Hut 案例说明云原生开发如何驱动业务升级。
谷歌云(Google Cloud)今天宣布升级旗下 Kubernetes 引擎的容量,以应对更大规模的模型,Kubernetes 引擎的容量将从目前支持 15000 个节点集群升级到支持 65000 个节点集群。
IBM在宣布收购专注于Kubernetes环境成本管理的初创公司Kubecost的计划后,该公司正在扩展其云财务运营能力。
我们向ChatGPT更具体地询问有关使用 Kubernetes 的建议。它提供了一份在生产中使用Kubernetes的12项最佳实践清单,其中大部分都是正确且相关的。但当被要求将该列表扩展到50项最佳实践时,我们很快就发...
Red Hat OpenStack平台现已更新为Red Hat OpenStack Services on OpenShift。
Costaisa 帮助 Asepeyo 将各项应用程序和服务迁移至 Rancher 平台,为 Kubernetes 编排做好了准备。团队选用 SUSE Linux Enterprise High Availability...
全球本地、云和SaaS环境智能数据服务领域的公认领导者Commvault宣布扩展面向Kubernetes工作负载的保护,包括跨其整个产品组合的全自动化管理、复制、迁移和安全增强。
一项针对DevOps专业人士的调查发现,94%的人在过去一年里至少经历过一次Kubernetes安全事件,59%的人认为安全问题是他们在使用Kubernetes以及容器时最大的担忧。