当前位置:首页 > 科技  > 手机

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型领先

来源: 责编: 时间:2024-09-20 16:06:34 186观看
导读 快科技9月20日消息,中国电信宣布,天翼云自研的国内首个单集群万卡国产化全功能预训练云服务平台,已经正式发布上线,基于华为昇腾芯片,并完成了万卡规模Llama3.1-405B大模型训练。Llama3.1-405B作为4000亿参数规

快科技9月20日消息,中国电信宣布,天翼云自研的国内首个单集群万卡国产化全功能预训练云服务平台,已经正式发布上线,基于华为昇腾芯片,并完成了万卡规模Llama3.1-405B大模型训练。dPc28资讯网——每日最新资讯28at.com

Llama3.1-405B作为4000亿参数规模的大模型,在息壤训推服务平台的支持下,经过多轮优化,MFU(算力利用率)达到国内领先水平。dPc28资讯网——每日最新资讯28at.com

另外,700亿参数大模型Llama2-70B在万卡规模下完成训练,MFU也处于业界领先水平。dPc28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型dPc28资讯网——每日最新资讯28at.com

据悉,天翼云的这套平台具备万卡纳管和并行训练能力,基于HPFS PB级并行文件系统、CTCCL RDMA高速卡间互联技术、Gang策略与拓扑感知的智算容器调度,以及慧聚自研分布式训练框架TeleFormers和平台,实现万卡资源纳管、万卡规模并行训练。dPc28资讯网——每日最新资讯28at.com

其中,天翼云自研了AI框架Teleformers,对算子、通信、数据处理进行优化,还有并行策略的自适应调整,显著提升了大模型训练的训练效率。dPc28资讯网——每日最新资讯28at.com

在目前业内大参数规模开源单体稠密模型Llama3.1-405B大模型训练测试中,性能表现达到国际同等水平。dPc28资讯网——每日最新资讯28at.com

算子优化方面,针对昇腾芯片的特性,在网络结构层面对诸多高频算子进行了定制化改造,构建了高性能算子集。dPc28资讯网——每日最新资讯28at.com

比如matmul算子,利用昇腾芯片的计算亲和性,将算子输入padding到特定的维度,大幅提升执行效率,从而明显缩短了训练时间。dPc28资讯网——每日最新资讯28at.com

数据处理和流水线方面,通过设置合理的数据分片策略和HPFS条带化优化,结合数据预取与数据下沉技术,大幅提升数据流的处理效率和稳定性;对预处理后的数据集进行了二次分片并提供就近缓存能力,减少GPU空闲时间。dPc28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型dPc28资讯网——每日最新资讯28at.com

自适应并行策略方面,基于对3D并行中各类计算单元的分析,天翼云设计了多种自适应的3D并行策略,依据模型规模和硬件资源的不同可以自动选择合适的并行策略,充分利用计算资源和显存资源,缩短模型训练中每轮的迭代时间。dPc28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型dPc28资讯网——每日最新资讯28at.com

天翼云国产化万卡智算中心还有多项技术突破——dPc28资讯网——每日最新资讯28at.com

天翼云息壤训练服务平台基于软硬件协同设计,提供全链路故障监控、基于主动感知的全链路故障监控和定位、CheckPoint秒级多级高速存储系统、容错优雅调度和模型编译缓存等系统,将万卡规模故障发现和解决问题缩短到业内前沿的分钟级,大幅提升有效训练时间。dPc28资讯网——每日最新资讯28at.com

自动断点续训系统:dPc28资讯网——每日最新资讯28at.com

建设丰富的故障库,基于此构建了多维故障感知系统,能够快速主动感知相关故障事件和潜在的故障风险;dPc28资讯网——每日最新资讯28at.com

通过精准的故障隔离和调度手段,快速隔离处理故障节点并重新调度新节点接手任务继续训练,实现无人干预式断点续训,有效减少GPU闲置时间。dPc28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型dPc28资讯网——每日最新资讯28at.com

高速多级CheckPoint系统:dPc28资讯网——每日最新资讯28at.com

天翼云设计基于多级存储的高速CheckPoint系统,通过两阶段异步存储,实现高速写入内存,并终异步写入远端系统;dPc28资讯网——每日最新资讯28at.com

针对断点恢复场景,提供进程级故障原地快恢和远端快速恢复能力,终实现对CheckPoint的秒级读写能力,大幅降低断点恢复时间、提升训练效率。dPc28资讯网——每日最新资讯28at.com

中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型dPc28资讯网——每日最新资讯28at.com

全链路检测工具链:dPc28资讯网——每日最新资讯28at.com

天翼云开发了全链路故障监控工具链,能够基于主动感知实现全链路的故障监控和定位。dPc28资讯网——每日最新资讯28at.com

该工具链可以主动发现设备故障,并降低训练中断的频次,确保训练过程的连续性和稳定性。dPc28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-22-114898-0.html中国电信天翼云完成首个国产GPU万卡训练!4000亿参数大模型领先

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 小米15入网,3999元一去不复返

下一篇: 自己搞定卡脖子技术!余承东:制裁某种意义是坏事变好事

标签:
  • 热门焦点
  • iPhone卖不动了!苹果股价创年内最大日跌幅:市值一夜蒸发万亿元

    8月5日消息,今天凌晨美股三大指数高开低走集体收跌,道指跌0.41%;纳指跌0.36%;标普500指数跌0.52%。热门科技股也都变化极大,其中苹果报181.99美元,跌4.8%,创
  • CSS单标签实现转转logo

    转转品牌升级后更新了全新的Logo,今天我们用纯CSS来实现转转的新Logo,为了有一定的挑战性,这里我们只使用一个标签实现,将最大化的使用CSS能力完成Logo的绘制与动画效果。新logo
  • 一篇聊聊Go错误封装机制

    %w 是用于错误包装(Error Wrapping)的格式化动词。它是用于 fmt.Errorf 和 fmt.Sprintf 函数中的一个特殊格式化动词,用于将一个错误(或其他可打印的值)包装在一个新的错误中。使
  • 19个 JavaScript 单行代码技巧,让你看起来像个专业人士

    今天这篇文章跟大家分享18个JS单行代码,你只需花几分钟时间,即可帮助您了解一些您可能不知道的 JS 知识,如果您已经知道了,就当作复习一下,古人云,温故而知新嘛。现在,我们就开始今
  • 腾讯盖楼,字节拆墙

    来源 | 光子星球撰文 | 吴坤谚编辑 | 吴先之“想重温暴刷深渊、30+技能搭配暴搓到爽的游戏体验吗?一起上晶核,即刻暴打!”曾凭借直播腾讯旗下代理格斗游戏《DNF》一
  • 三星获批量产iPhone 15全系屏幕:苹果史上最惊艳直屏

    按照惯例,苹果将继续在今年9月举办一年一度的秋季新品发布会,有传言称发布会将于9月12日举行,届时全新的iPhone 15系列将正式与大家见面,不出意外的话
  • iQOO Neo8 Pro真机谍照曝光:天玑9200+和V1+旗舰双芯加持

    去年10月,iQOO推出了iQOO Neo7系列机型,不仅搭载了天玑9000+,而且是同价位唯一一款天玑9000+直屏旗舰,一经上市便受到了用户的广泛关注。在时隔半年后,
  • OPPO K11评测:旗舰级IMX890加持 2000元档最强影像手机

    【Techweb评测】中端机型用户群体巨大,占了中国目前手机市场的大头,一直以来都是各手机品牌的“必争之地”,其中OPPO K系列机型一直以来都以高品质、
  • 2022爆款:ROG魔霸6 冰川散热系统持续护航

    喜逢开学季,各大商家开始推出自己的新产品,进行打折促销活动。对于忠实的端游爱好者来说,能够拥有一款梦寐以求的笔记本电脑是一件十分开心的事。但是现在的
Top