面向Neocloud时代的机柜级AI基础设施架构

前言
生成式AI与Agentic AI应用持续发展,加上日益增长的AI训练与推理工作负载,对计算吞吐量、内存、网络与存储能力提出了前所未有的要求。因此,AI基础设施已无法再以独立服务器为核心进行设计。随着专业化Neocloud服务提供商兴起,产业进一步向机柜级架构发展,将计算、网络与散热管理整合于同一架构中,以实现高效且高度适应性的AI计算能力。
构建机柜级AI的基础
成功的机柜级架构始于高性能且具备高度适应性的服务器节点。随着AI工作负载持续向更高计算强度发展,服务器必须具备高密度计算能力、高速数据吞吐量、稳定的连接能力,以及灵活的扩展能力,以支持广泛且多样化的应用需求。这些能力将决定单一节点能否有效整合至更大型的AI基础设施环境,并进一步实现整体规模的扩展。
AEWIN提供完整的服务器产品组合,涵盖AI服务器、全闪存存储服务器、高可用性服务器及通用型服务器,支持AMD EPYC 9006系列服务器处理器与Intel Xeon 6处理器等主流服务器CPU。通过支持多种加速器、EDSFF NVMe存储、高吞吐量NIC、加密加速卡及高速内存,AEWIN服务器平台能够满足AI计算、数据处理、存储及基础设施等多种工作负载需求。
AEWIN服务器以快速部署与定制化配置为设计核心,使Neocloud服务提供商与AI基础设施运营商能够根据特定工作负载需求,灵活配置每个服务器节点。从高计算强度的AI应用,到支撑整个AI基础设施栈的网络与存储资源,AEWIN提供高度适应性与定制化服务,帮助扩展计算容量,同时在性能、系统配置与总拥有成本之间实现最佳平衡。
通过先进液冷方案提升计算密度
计算密度的提升必然带来更高的功耗密度,使散热管理成为机柜级AI部署中的关键考量。随着CPU与GPU的功耗需求持续提升,传统风冷方案在扩展性,以及维持系统性能、能源效率与机柜密度方面,正面临日益严峻的挑战。液冷技术则提供了有效的解决方案,帮助高密度AI系统应对不断增加的散热需求。
AEWIN与旗下子公司Arivor合作,通过先进散热技术支持高功耗AI计算环境。Arivor的双相直接液冷(2P DLC)方案能够高效带走高功耗组件产生的热量,帮助搭载高TDP CPU与GPU的服务器应对高负载散热需求,同时实现更高的计算密度。在机柜层级,机柜内置冷却液分配单元可智能分配冷却液至各部署系统,进一步提升整体效率并降低 PUE。
高密度服务器结合先进2P DLC方案,为Neocloud基础设施建立灵活且可靠的基础。具备丰富I/O与高速PCIe扩展能力的服务器,可支持日益高性能的加速器与外围组件;同时,机柜级散热基础设施能够应对持续提升的功耗密度与散热需求。通过两者的技术整合,AEWIN得以提供更具适应性的高密度AI基础设施构建与扩展方案。
总结
随着AI工作负载日益复杂且要求不断提升,产业正从优化单一服务器,逐步迈向机柜级基础设施的整体设计。AEWIN与旗下子公司Arivor通过可扩展服务器与先进2P DLC液冷方案,为Neocloud服务提供商及AI基础设施运营商提供灵活的基础,帮助部署与扩展新一代高密度AI计算环境,同时降低总拥有成本。

