当前位置:首页 > 科技  > 手机

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练

来源: 责编: 时间:2025-04-16 07:19:20 161观看
导读 密集模型的推理能力也能和DeepSeek-R1掰手腕了?华为利用纯昇腾集群训练出的盘古Ultra,在数学竞赛、编程等推理任务当中,和R1打得有来有回。关键是模型参数量只有135B,整个训练过程零英伟达含量,而且没有出现损失

密集模型的推理能力也能和DeepSeek-R1掰手腕了?mhj28资讯网——每日最新资讯28at.com

华为利用纯昇腾集群训练出的盘古Ultra,在数学竞赛、编程等推理任务当中,和R1打得有来有回。mhj28资讯网——每日最新资讯28at.com

关键是模型参数量只有135B,整个训练过程零英伟达含量,而且没有出现损失尖峰。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

通过改进的模型架构和系统优化策略,盘古Ultra拥有优异的性能表现和52%以上的算力利用率。mhj28资讯网——每日最新资讯28at.com

并且有网友表示,训练过程中没有出现损失尖峰这一特征,似乎此前从未实现。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

135B密集模型比肩DeepSeek-R1mhj28资讯网——每日最新资讯28at.com

作为一个参数量135B密集模型,盘古Ultra达到了同尺度密集模型的优表现,甚至可以与DeepSeek-R1等参数量更大的MoE模型竞争。mhj28资讯网——每日最新资讯28at.com

在预训练阶段模型的评测中,盘古Ultra在绝大部分英文基准任务和全部中文任务上取得了佳性能,优于Llama 405B、DeepSeek-V3等baseline模型。mhj28资讯网——每日最新资讯28at.com

尤其在MMLU、TriviaQA、GSM8K等具有挑战性的数据集上,盘古Ultra展现出了卓越的语言理解和推理能力。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

经过指令调优后,盘古Ultra的性能进一步提升,尤其在AIME 2024、MATH-500等数学推理任务和LiveCodeBench等编程竞赛题上达到了SOTA水平。mhj28资讯网——每日最新资讯28at.com

综合来看,盘古Ultra超越了包括GPT-4o、Mistral-Large 2等强大模型,与DeepSeek-R1等MoE模型竞争激烈。mhj28资讯网——每日最新资讯28at.com

同时,盘古Ultra在Arena Hard、MMLU-pro等涵盖通用语言理解和推理的评测中也表现优异。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

那么,为了实现这样的效果,盘古Ultra采用了哪些关键技术呢?mhj28资讯网——每日最新资讯28at.com

“三明治”层归一化架构mhj28资讯网——每日最新资讯28at.com

如前文所述,盘古Ultra是一款135B参数量的密集模型,使用了94层的网络结构。mhj28资讯网——每日最新资讯28at.com

盘古Ultra采用了分组查询注意力(GQA)机制,包含96个查询头(query head)和8个键值头(key-value head)。mhj28资讯网——每日最新资讯28at.com

为了解决训练超深网络面临的不稳定性和收敛困难等问题,盘古Ultra在模型架构上做出了两个关键改进——深度缩放的Sandwich-Norm层归一化和TinyInit参数初始化策略。mhj28资讯网——每日最新资讯28at.com

传统的Transformer通常使用Pre-LN层归一化,但在深度模型中,Pre-LN容易导致每个子层输出尺度的波动,引发训练不稳定。mhj28资讯网——每日最新资讯28at.com

盘古Ultra使用的Sandwich-Norm层归一化,则是在残差连接前对每个子层的输出做归一化,并根据网络深度对初始化值进行缩放,从而有效消除了训练过程中的loss尖峰,使训练过程更加平稳。mhj28资讯网——每日最新资讯28at.com

用更容易理解的话说,传统方法仅在每个子层的输入进行归一化,但这种方法针对输出也进行了归一化,形成了Pre-Norm + 子层 + Post-Norm的“三明治”结构。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

但是,仅仅使用Sandwich-Norm还不足以完全消除深度模型训练中的不稳定性——随着网络层数的增加,每一层的输出尺度仍然可能出现累积性的漂移。mhj28资讯网——每日最新资讯28at.com

为此,盘古Ultra在Sandwich-Norm的基础上,进一步引入了深度缩放机制,对Post-Norm中的放缩参数γ进行了深度相关的初始化。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

至于整个模型的初始化,传统的初始化通常采用的Xavier初始化方法仅考虑模型宽度,而盘古Ultra采用的TinyInit同时依据模型深度和宽度来缩放初始化权重的标准差。mhj28资讯网——每日最新资讯28at.com

这种初始化方式有助于在前向传播和反向传播过程中,维持各层梯度的方差在一个合理的范围内,避免了梯度消失或爆炸问题,使得训练过程更加稳定,同时也加速了收敛。mhj28资讯网——每日最新资讯28at.com

实验表明,TinyInit在深度模型训练中取得了更好的收敛速度和下游任务性能;同时针对embedding层,保持权重的标准差接近1也能提升训练稳定性。mhj28资讯网——每日最新资讯28at.com

另外,盘古团队也针对Tokenizer进行了优化,通过在通用中英文、代码、数学等不同领域分别进行词频统计,再合并去重,终得到了一个兼顾领域覆盖和编码效率的153376个token的平衡词表。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

8192张昇腾NPU训练集群mhj28资讯网——每日最新资讯28at.com

盘古Ultra的整个训练流程主要分为三个阶段——预训练、长上下文扩展和指令调优。mhj28资讯网——每日最新资讯28at.com

其中预训练又可以分为三个子阶段:mhj28资讯网——每日最新资讯28at.com

通用阶段:侧重建立语言理解和知识储备,使用了大量中英文通用语料,覆盖网页、书籍、百科等多个来源;mhj28资讯网——每日最新资讯28at.com

推理阶段:引入更多高质量的数学和代码数据,以增强模型的推理能力。同时还使用instruction数据来帮助模型学习执行任务;mhj28资讯网——每日最新资讯28at.com

退火阶段:帮助模型巩固知识和推理能力,并强化指令遵循能力。大量使用问答对和人类反馈数据。mhj28资讯网——每日最新资讯28at.com

研究者们采用了基于规则和模型的数据清洗方法,并设计了curriculum learning策略,让模型循序渐进地学习不同难度的样本。mhj28资讯网——每日最新资讯28at.com

预训练中使用了AdamW优化器,并动态调整超参数。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

预训练后,模型在长128K的长上下文数据上进一步训练,通过扩大RoPE的基频来实现长序列建模,以增强处理长文档的能力。mhj28资讯网——每日最新资讯28at.com

后的指令调优阶则段使用监督微调(SFT)和强化学习(RL)来使模型更好地适应下游任务,学会执行指令并与人类偏好对齐。mhj28资讯网——每日最新资讯28at.com

训练设施方面,盘古Ultra使用了一个由8192个昇腾AI处理器组成的大规模计算集群。mhj28资讯网——每日最新资讯28at.com

集群中每个节点包含8个NPU,通过华为高速缓存一致性互联HCCS以全互联的拓扑结构连接,每个NPU配备64GB内存,节点间则通过200Gbps的RoCE(RDMA over Converged Ethernet)网络互联。mhj28资讯网——每日最新资讯28at.com

为了实现盘古Ultra的高效训练,研究团队还采用了一套系统的并行策略和优化技术。mhj28资讯网——每日最新资讯28at.com

在并行策略的选择上,盘古Ultra综合考虑了模型的规模、数据的特性以及硬件的拓扑,终采用了数据并行、张量并行、序列并行和流水线并行等多种并行方式的组合:mhj28资讯网——每日最新资讯28at.com

128路数据并行,将训练数据分片到不同设备,保证了数据吞吐;8路张量并行,利用设备内部高带宽切分层内张量,实现高效通信;序列并行用于处理超长序列以降低显存压力;8段流水线并行,将不同层分布到不同设备,形成高效的计算流水线。mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

在并行策略的基础上,盘古Ultra还从多个角度对训练系统进行了深度优化。mhj28资讯网——每日最新资讯28at.com

一方面,通过使用ZeRO(Zero Redundancy Optimizer)分布式优化器,将模型状态分片到不同设备,大幅降低了单个设备的内存占用,在提高数据并行度的同时,确保了每个设备的内存负担在可接受范围内。mhj28资讯网——每日最新资讯28at.com

另一方面,研究者们通过各种通信和计算优化技术,小化了通信开销,提升了计算效率:mhj28资讯网——每日最新资讯28at.com

通过算子融合(Kernel Fusion)将多个小算子合并,减少了内存访问和kernel启动;通过通信计算重叠(Communication-Computation Overlapping)实现通信和计算的深度交织,隐藏通信延迟;MC^2(Merged Computation & Communication)和BOA(Batch Optimization Accelerator)分别对张量并行和规范化层的通信进行了专门优化……mhj28资讯网——每日最新资讯28at.com

英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练mhj28资讯网——每日最新资讯28at.com

在算法、工程、数据各个层面的精细优化下,盘古Ultra实现了52%以上的算力利用率。mhj28资讯网——每日最新资讯28at.com

技术报告:https://github.com/pangu-tech/pangu-ultra/blob/main/pangu-ultra-report.pdfmhj28资讯网——每日最新资讯28at.com


文章出处:量子位

本文链接:http://www.28at.com/showinfo-22-144384-0.html英伟达含量为零!华为135B密集模型性能比肩DeepSeek-R1:纯昇腾集群训练

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 2025年Q1全球智能手机份额公布:三星位居第一 领先苹果

下一篇: 曝华为Mate 80系列Q4末登场:发布时间比iPhone 17晚

标签:
  • 热门焦点
  • Automa-通过连接块来自动化你的浏览器

    1、前言通过浏览器插件可实现自动化脚本的录制与编写,具有代表性的工具就是:Selenium IDE、Katalon Recorder,对于简单的业务来说可快速实现自动化的上手工作。Selenium IDEKat
  • 量化指标是与非:挽救被量化指标扼杀的技术团队

    作者 | 刘新翠整理 | 徐杰承本文整理自快狗打车技术总监刘新翠在WOT2023大会上的主题分享,更多精彩内容及现场PPT,请关注51CTO技术栈公众号,发消息【WOT2023PPT】即可直接领取
  • 之家push系统迭代之路

    前言在这个信息爆炸的互联网时代,能够及时准确获取信息是当今社会要解决的关键问题之一。随着之家用户体量和内容规模的不断增大,传统的靠"主动拉"获取信息的方式已不能满足用
  • 一文搞定Java NIO,以及各种奇葩流

    大家好,我是哪吒。很多朋友问我,如何才能学好IO流,对各种流的概念,云里雾里的,不求甚解。用到的时候,现百度,功能虽然实现了,但是为什么用这个?不知道。更别说效率问题了~下次再遇到,
  • 大厂卷向扁平化

    来源:新熵作者丨南枝 编辑丨月见大厂职级不香了。俗话说,兵无常势,水无常形,互联网企业调整职级体系并不稀奇。7月13日,淘宝天猫集团启动了近年来最大的人力制度改革,目前已形成一
  • 阿里瓴羊One推出背后,零售企业迎数字化新解

    作者:刘旷近年来随着数字经济的高速发展,各式各样的SaaS应用服务更是层出不穷,但本质上SaaS大多局限于单一业务流层面,对用户核心关切的增长问题等则没有提供更好的解法。在Saa
  • 重估百度丨大模型,能撑起百度的“今天”吗?

    自象限原创 作者|程心 罗辑2023年之前,对于自己的“今天”,百度也很迷茫。“新业务到 2022 年底还是 0,希望 2023 年出来一个 1。”这是2022年底,李彦宏
  • 回归OPPO两年,一加赢了销量,输了品牌

    成为OPPO旗下主打性能的先锋品牌后,一加屡创佳绩。今年618期间,一加手机全渠道销量同比增长362%,凭借一加 11、一加 Ace 2、一加 Ace 2V三款爆品,一加
  • 荣耀Magic4 至臻版 首创智慧隐私通话 强劲影音系统

    2022年第一季度临近尾声,在该季度内,许多品牌陆续发布自己的最新产品,让大家从全新的角度来了解当今的手机技术。手机是电子设备中,更新迭代十分迅速的一款产品,基
Top