余承东说到做到,华为openPangu-2.0-Pro模型及技术报告开源上线

openPangu-2.0-Pro 是基于昇腾 NPU 训练的大规模混合专家(MoE)语言模型,参数规模约 505B,每 token 激活参数规模约 18B,模型支持 512k 上下文长度,训练数据总量约 34T tokens。后训练阶段完成快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一。 Attention 架构:沿用高效 MLA,并采用 DSA+SWA 独立分层混合架构,层配比为 1:2;SWA 层负责局部窗口建模,DSA 层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。拓扑架构:将传统残差连接升级为 4 支流 mHC 架构,提升表征多样性与泛化能力。自投机模块:采用 3 头 MTP 架构,一次额外预测 3 个 token,显著提升模型的推理速度。Muon 优化器:训练中采用 Muon 优化器,获得更快的收敛速度。 在今年 6 月的华为开发者大会 HDC 2026 主题演讲中,华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东宣布,openPangu 2.0 计划从 6 月 30 日起陆续开源 7 大组件,包括新增开源的预训练代码、后训练代码、训练算子。 对于 openPangu-2.0-Pro 总参数仅 505B,余承东曾解释称,算力大量支持了国内的其他企业需求,自己留的数量还是非常有限的;此外,AI 算力成本非常高,华为更聚焦时延和吞吐率的提升。

本页 /?shenghuo/

查看更多内容 更多最新文章 相关栏目

热议频道

热议频道:本文聚合热议相关资讯版本说明会写清知识点修订了什么,而不只是“体验优化”。音频可后台播放,图文可细读,双形态互补。天文地理健康科技都有覆盖,单篇不长,信息密度却够用。科学叙述尽量接得住更多人的生活,而不是只写给同温层。若你也怕“不懂”,不妨从一条条小问题开始。

关键词:热议,免费网站WWW/大全百度搜索华为手机,免费网站WWW/大全百度搜索华为手机