摩尔线程夸娥智算中心解决方案扩展至万卡规模

摩尔线程夸娥智算中心解决方案扩展至万卡规模
2024年07月03日 08:45 动点科技

动点科技获悉,7月3日,摩尔线程宣布其AI旗舰产品夸娥(KUAE)智算集群解决方案从当前的千卡级别大幅扩展至万卡规模。

在集群计算性能方面,全新一代夸娥智算集群实现单集群规模超万卡,浮点运算能力达到10Exa-Flops,大幅提升单集群计算性能,能够为万亿参数级别大模型训练提供坚实算力基础。在集群稳定性方面,摩尔线程夸娥万卡集群平均无故障运行时间超过15天,最长可实现大模型稳定训练30天以上,周均训练有效率在99%以上。

MFU是评估大模型训练效率的通用指标,可以直接反应端到端的集群训练效率。夸娥万卡集群在系统软件、框架、算法等层面一系列优化,实现大模型的高效率训练,MFU最高可达到60%。

夸娥万卡集群是一个通用加速计算平台,计算能力为通用场景设计,可加速LLM、MoE、多模态、Mamba等不同架构、不同模态的大模型。同时,基于高效易用的MUSA编程语言、完整兼容CUDA能力和自动化迁移工具Musify,加速新模型“Day0”级迁移,实现生态适配“Instant On”,助力客户业务快速上线。

此外,摩尔线程联合中国移动通讯集团青海有限公司、中国联通青海公司、北京德道信科集团、中国能源建设股份有限公司总承包公司、桂林华崛大数据科技有限公司(排名不分先后)分别就三个万卡集群项目进行了战略签约,多方聚力共同构建国产GPU集群。

财经自媒体联盟更多自媒体作者

新浪首页 语音播报 相关新闻 返回顶部