云开体育单卡可靠性并不就是集群可用性-开云官网登录入口 www.kaiyun.com

开云官网登录入口 www.kaiyun.com
资讯
栏目分类
开云官网登录入口 www.kaiyun.com
资讯
娱乐
新闻
旅游
汽车
电影
云开体育单卡可靠性并不就是集群可用性-开云官网登录入口 www.kaiyun.com
发布日期:2026-07-23 08:29    点击次数:70

7月的上海,2026宇宙东谈主工智能大会(WAIC 2026)定期而至。在国产高性能通用GPU企业沐曦股份的展台,八组醒目着蓝色灯带的玄色机柜组成的“算力墙”成为现场被围不雅最久的展品。

这是沐曦本届大会厚爱发布的新一代AI超节点居品曦景S600——面向大模子考试、推理及智算中心开采打造的系统级算力居品。

而沐曦在WAIC 2026上叙述的故事不啻于此。在展台的另一侧,沐曦集结了十大顶流开源社区,特意竖立了“开源工坊”展示全栈适配恶果;而在“万象利用”展示区胪列着机器东谈主、智能座舱、卫星什物,布局跨度从大地蔓延向天外。

一家GPU公司为何要“四面出击”,谜底大要指向吞并个底层逻辑:通用性。

软硬件迭代周期的权臣各别,决定了算力基础门径的中枢竞争力,并不局限于某一场景下的峰值性能,而在于对快速演进的模子架构的赓续适配才智。

“今天沐曦所具备的技能才智、技能蓄积透顶不错笼罩云霄所有的居品线。”沐曦股份研发副总裁黄向军在WAIC期曲折受《国外金融报》记者等媒体采访时作了一个无为比方,“就像药房开了之后,我把柄居品界说往里边持什么药。技能底座跟才智都照旧在了,配方仅仅居品界说的问题”。

超节点成为“必答题”

华为Atlas 950 SuperPoD、中兴Matrix超节点、新华三UniPoD S80000超节点、阿里云发布灵骏真武M890超节点……在WAIC 2026上,多款国产超节点居品集结亮相证实,这已不是单个厂商的“独行”,而是国产算力对将来趋势的共鸣。

“超节点不是在职何场景下都起作用的。淌若单个8卡机能够处置揣测打算任务,那么就不需要超节点。只好碰到比拟大的模子尺寸时,才需要超节点。”关于超节点的适用范畴,黄向军在受访时给出明晰的界定。

这也平直点明了驱动超节点出生的逻辑,跟着大模子参数限制从千亿走向万亿级别、MoE(夹杂巨匠)架组成为主流,传统GPU就业器在互联效能、算力密度、部署复杂度等方面濒临多重挑战。

黄向军进一步从MoE架构的通讯特色阐释称,不管考试如故推理,巨匠间All-to-All通讯要求延迟越低越好,这意味着需要把更多GPU以更高带宽连成一个合座。而当原有的8卡机难以承载这一需求,把多台8卡机拼在一皆后,机间互联又退化为新的堵点——客不雅上催生了对“一个缜密互联合座”的需求。

沐曦选定将64卡算作限制锚点,原因之一在于这是面前模子尺寸与趋势下需求欢叫的节点规格。曦景S600恰是基于这一判断应时而生——单机柜内64张GPU高速全互连,并扶助活泼膨大至万卡乃至十万卡级别的集群,为大限制智算中心开采需求提供系统级复古。

蔡淑敏/摄

S600的“零线缆”解围

当算力集群走向万卡甚而几万卡,故障率便成为了尤为困难的筹商要素,集群赓续褂讪职责的时辰将平直决定通盘系统的灵验算力上限。

“曩昔一段时辰里,就沐曦自己来讲,咱们在单个GPU上或者8卡内,故障率照旧阻挡到了至极低的景况。客不雅来讲,咱们关于故障率的阻挡,跟英伟达应该是在一条水平线上。”黄向军暗示。

然则,在构建大限制算力集群时,单卡可靠性并不就是集群可用性。

黄向军也提到,当把多台8卡机组成集群时,光模块、网卡、磁盘等部件问题频出,散热遐想亦然要道,高温开动条款下更容易出故障。因此,超节点的褂讪性、可靠性已成为通盘系统遐想中至极困难的一环。

让曦景S600已毕技能分野的要道,在于其联结口头的翻新。据先容,该居品接纳OEX架构遐想,通过正交联结器与两级交换拓扑,已毕GPU之间低时延、高带宽通讯,灵验耕种漫衍式考试效能,能够更好餍足MoE稀薄模子、万亿参数大模子等复杂AI任务对集群通讯才智的要求。

更具打破性的是其“零线缆”遐想决策——“曦景S600翻新接纳“三0遐想”,即揣测打算节点0线缆、交换节点0线缆以及揣测打算节点与交换节点之间0线缆。这一系统遐想大幅减少传统机柜复杂布线带来的信号损耗和故障风险,进一步耕种系统可靠性和历久褂讪开动才智。

同期,居品接纳解耦模块化遐想,揣测打算、交换、电源及液冷等要道模块均扶助快速部署和珍贵,电源与液冷管路扶助盲插热插拔,即使单节点发生故障,也不会影响通盘集群开动,权臣缩短数据中心运维资本。

不作念“某大厂的专属GPU”

硬件才智的打破以外,沐曦在本届WAIC要点开释了另一个信号:绽放。

“咱们不会独处依附某一个大厂,不是某一个大厂底下标签很重的专属GPU供应商。”黄向军在采访中明确,沐曦的生态定位是通用专科基础门径提供商,居品能够适配不同客户,不会把产能押在单一大客户身上。

这一绽放逻辑相同联络其超节点战术。沐曦选定与OEM合作伙伴集中打造整机居品,“咱们以为绽放能促进更好的翻新,幸免单一供应商;各平缓各自的生态位上去翻新,组合在一皆酿成通盘凹凸游中最有竞争力的居品。”黄向军认为,垂直整合在研发和效能层面具有上风,但从供应角度看巧合是最优解。

谢世博展台,为集结展示其揣测打算生态绽放旅途和恶果,沐曦特意竖立了“开源工坊”展区,集结了九源集中体、龙蜥操作系统、木兰开源社区、模力方舟、vLLM、SGLang、Red Hat、CNCF、蜜瓜智能、PyTorch基金会等十大顶流开源社区,串联起一条笼罩操作系统、云原生、推理加快、模子就业、集群内核全层级软件栈的齐全AI Infra开源合作链路,集结展示了沐曦股份在AI框架、算子库及多种开源模子方面的适配恶果。

据官方数据,自2025年2月开源以来,现在MXMACA开源社区照旧聚集跳动50万技能开采者用户。

而在科学揣测打算领域,沐曦照旧已毕从“兼容开源”走向“孝顺开源”。沐曦深度参与GROMACS社区,其摆脱能微扰GPU加快代码已合入开源干线,成为国内首家对该中枢模块作出困难代码孝顺的企业。产业利用层面,沐曦股份联袂鸿之微、深度旨趣、唯信科技、大湾区国创中心等产学研伙伴,在新动力材料研发、工业冷却液分子筛选和AI短临稳定预告等场景酿成落地恶果,以自主算力赋能翻新提速。

“死磕”GPU通用性

本体上,沐曦股份的绽放理念相同在其产业布局上得以体现。

除了进口处最空洞标曦景S600,相同眩惑不雅众驻足的还有沐曦展区胪列的卫星什物,这是沐曦“1+6+X”产业生态中的一环,直不雅地展示了国产GPU向空天算力场景蔓延的布局。而在“万象利用”展区,沐曦集结展示了其高性能GPU算力平台在金融、医疗、动力、教科研、交通、大娱乐六大中枢赛谈的赋能落地恶果。

行业内更情切沐曦在具身智能地方的落子——这是本年WAIC的另一大焦点,亦然沐曦面前要点布局的一大地方。

此前,沐曦与“东谈主形机器东谈主第一股”优必选树立结伙公司布局具身智能,被外界认为是向端侧蔓延的困难信号。关于与优必选的合作,在这次WAIC上,沐曦股份高等副总裁孙国梁在受访时强调,沐曦秉持着一贯的通用绽放气派,树立结伙公司并不代表芯片独家供应给某一家企业,而是但愿从教训的具身智能企业取得数据、场景、使用习尚与客户需求的浩繁输入,加快SoC合座遐想。结伙以外,沐曦仍保持开源、绽放、生态共赢,沸腾集中各家机器东谈主企业,在平台、数据、考试和宇宙模子等方面伸开宽泛合作。

而关于布局端侧AI算力居品这一选定,黄向军在受访时提到,沐曦照旧具备了打造高性能云边端一体芯片的才智,“我需要的是稳健的场景判断。结伙公司的脚色是界说居品规格,而沐曦在云霄打造的整套软件生态链价值将会助力端侧居品加快走向教训”。

事实上,端侧AI的载体形态远未不休,行业内尚未酿成长入的共鸣,而这种不笃信性刚巧阐扬了沐曦为何弥远宝石GPU通用性——端侧形态摇身一变,底层不变的是Token驱动,各别在于算力限制。

“通用的含义是,一方面要能复古今天已有的多种模子,另一方面是要能扶助将来可能出现的新的模子。”黄向军指出,GPU教唆集粒度有余细,才能通过编译器适配现存乃至将来出现的模子,英伟达三五年前的芯片于今仍能跑最新模子,恰是通用性的体现。

而通用性的前提,是软硬件解耦——模子架构和算法迭代速率远超硬件,淌若芯片专为某一场景或模子定向优化,一朝端侧形态发生变化,前期的弘大钞票参预将很有可能化为泡沫。黄向军在采访中坦言:“软件翻新节拍以周为单元,芯片从界说到量产两年能作念完照旧至极快。淌若芯片莫得通用性,将是一个难受。”