当前位置:首页 > 科技  > 数码

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型领先

来源: 责编: 时间:2024-09-20 16:06:35 182观看
导读 快科技9月20日消息,中国电信宣布,天翼云自研的国内首个单集群万卡国产化全功能预训练云服务平台,已经正式发布上线,基于华为昇腾芯片,并完成了万卡规模Llama3.1-405B大模型训练。Llama3.1-405B作为4000亿参数规

快科技9月20日消息,中国电信宣布,天翼云自研的国内首个单集群万卡国产化全功能预训练云服务平台,已经正式发布上线,基于华为昇腾芯片,并完成了万卡规模Llama3.1-405B大模型训练。pna28资讯网——每日最新资讯28at.com

Llama3.1-405B作为4000亿参数规模的大模型,在息壤训推服务平台的支持下,经过多轮优化,MFU(算力利用率)达到国内领先水平。pna28资讯网——每日最新资讯28at.com

另外,700亿参数大模型Llama2-70B在万卡规模下完成训练,MFU也处于业界领先水平。pna28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型pna28资讯网——每日最新资讯28at.com

据悉,天翼云的这套平台具备万卡纳管和并行训练能力,基于HPFS PB级并行文件系统、CTCCL RDMA高速卡间互联技术、Gang策略与拓扑感知的智算容器调度,以及慧聚自研分布式训练框架TeleFormers和平台,实现万卡资源纳管、万卡规模并行训练。pna28资讯网——每日最新资讯28at.com

其中,天翼云自研了AI框架Teleformers,对算子、通信、数据处理进行优化,还有并行策略的自适应调整,显著提升了大模型训练的训练效率。pna28资讯网——每日最新资讯28at.com

在目前业内大参数规模开源单体稠密模型Llama3.1-405B大模型训练测试中,性能表现达到国际同等水平。pna28资讯网——每日最新资讯28at.com

算子优化方面,针对昇腾芯片的特性,在网络结构层面对诸多高频算子进行了定制化改造,构建了高性能算子集。pna28资讯网——每日最新资讯28at.com

比如matmul算子,利用昇腾芯片的计算亲和性,将算子输入padding到特定的维度,大幅提升执行效率,从而明显缩短了训练时间。pna28资讯网——每日最新资讯28at.com

数据处理和流水线方面,通过设置合理的数据分片策略和HPFS条带化优化,结合数据预取与数据下沉技术,大幅提升数据流的处理效率和稳定性;对预处理后的数据集进行了二次分片并提供就近缓存能力,减少GPU空闲时间。pna28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型pna28资讯网——每日最新资讯28at.com

自适应并行策略方面,基于对3D并行中各类计算单元的分析,天翼云设计了多种自适应的3D并行策略,依据模型规模和硬件资源的不同可以自动选择合适的并行策略,充分利用计算资源和显存资源,缩短模型训练中每轮的迭代时间。pna28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型pna28资讯网——每日最新资讯28at.com

天翼云国产化万卡智算中心还有多项技术突破——pna28资讯网——每日最新资讯28at.com

天翼云息壤训练服务平台基于软硬件协同设计,提供全链路故障监控、基于主动感知的全链路故障监控和定位、CheckPoint秒级多级高速存储系统、容错优雅调度和模型编译缓存等系统,将万卡规模故障发现和解决问题缩短到业内前沿的分钟级,大幅提升有效训练时间。pna28资讯网——每日最新资讯28at.com

自动断点续训系统:pna28资讯网——每日最新资讯28at.com

建设丰富的故障库,基于此构建了多维故障感知系统,能够快速主动感知相关故障事件和潜在的故障风险;pna28资讯网——每日最新资讯28at.com

通过精准的故障隔离和调度手段,快速隔离处理故障节点并重新调度新节点接手任务继续训练,实现无人干预式断点续训,有效减少GPU闲置时间。pna28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型pna28资讯网——每日最新资讯28at.com

高速多级CheckPoint系统:pna28资讯网——每日最新资讯28at.com

天翼云设计基于多级存储的高速CheckPoint系统,通过两阶段异步存储,实现高速写入内存,并终异步写入远端系统;pna28资讯网——每日最新资讯28at.com

针对断点恢复场景,提供进程级故障原地快恢和远端快速恢复能力,终实现对CheckPoint的秒级读写能力,大幅降低断点恢复时间、提升训练效率。pna28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型pna28资讯网——每日最新资讯28at.com

全链路检测工具链:pna28资讯网——每日最新资讯28at.com

天翼云开发了全链路故障监控工具链,能够基于主动感知实现全链路的故障监控和定位。pna28资讯网——每日最新资讯28at.com

该工具链可以主动发现设备故障,并降低训练中断的频次,确保训练过程的连续性和稳定性。pna28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-24-114904-0.html中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型领先

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: AMD锐龙AI 300集显支持AFMF2插帧、可变显存:帧率暴涨多78%

下一篇: 玩家必备!雷克沙×魔域联名定制礼盒上市 首发549元

标签:
  • 热门焦点
  • 一加Ace2 Pro真机揭晓 钛空灰配色质感拉满

    终于,在经过了几波预热之后,一加Ace2 Pro的外观真机图在网上出现了。还是博主数码闲聊站曝光的,这次的外观设计还是延续了一加11的方案,只是细节上有了调整,例如新加入了钛空灰
  • 《英雄联盟》夏季赛总决赛今日开打!JDG对阵LNG首发名单来了 Knight:准备三连冠

    8月5日消息,今日17:00,《英雄联盟》2023LPL夏季赛总决赛将正式开打,由JDG对阵LNG。对两支队伍来说,这场比赛不仅要争夺夏季赛冠军,更要决定谁才是LPL赛区一
  • 把LangChain跑起来的三个方法

    使用LangChain开发LLM应用时,需要机器进行GLM部署,好多同学第一步就被劝退了,那么如何绕过这个步骤先学习LLM模型的应用,对Langchain进行快速上手?本片讲解3个把LangChain跑起来
  • 微信语音大揭秘:为什么禁止转发?

    大家好,我是你们的小米。今天,我要和大家聊一个有趣的话题:为什么微信语音不可以转发?这是一个我们经常在日常使用中遇到的问题,也是一个让很多人好奇的问题。让我们一起来揭开这
  • 梁柱接棒两年,腾讯音乐闯出新路子

    文丨田静 出品丨牛刀财经(niudaocaijing)7月5日,企鹅FM发布官方公告称由于业务调整,将于9月6日正式停止运营,这意味着腾讯音乐长音频业务走向消亡。腾讯在长音频领域还在摸索。为
  • 猿辅导与新东方的两种“归途”

    作者|卓心月 出品|零态LT(ID:LingTai_LT)如何成为一家伟大企业?答案一定是对“势”的把握,这其中最关键的当属对企业战略的制定,且能够站在未来看现在,即使这其中的
  • 大厂卷向扁平化

    来源:新熵作者丨南枝 编辑丨月见大厂职级不香了。俗话说,兵无常势,水无常形,互联网企业调整职级体系并不稀奇。7月13日,淘宝天猫集团启动了近年来最大的人力制度改革,目前已形成一
  • 超闭合精工铰链 彻底消灭缝隙 三星Galaxy Z Flip5与Galaxy Z Fold5发布

    2023年7月26日,三星电子正式发布了Galaxy Z Flip5与Galaxy Z Fold5。三星新一代折叠屏手机采用超闭合精工铰链,让折叠后的缝隙不再可见。同时,配合处
  • 荣耀Magic4 至臻版 首创智慧隐私通话 强劲影音系统

    2022年第一季度临近尾声,在该季度内,许多品牌陆续发布自己的最新产品,让大家从全新的角度来了解当今的手机技术。手机是电子设备中,更新迭代十分迅速的一款产品,基
Top