新闻中心

蚂蚁集团NextEvo全面开源AI Infra技术,可实现大模型训练“自动驾驶”

2024-02-02
浏览次数:
返回列表

近期,蚂蚁集团旗下ai创新研发部门nextevo宣布全面开源ai infra技术,该技术能够极大地提高大型模型训练的效率。根据数据显示,该技术能够将训练时间的有效占比提高至超过95%,实现了训练过程的自动化。这一突破性的进展显著推动了ai研发的效率提升。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

蚂蚁集团NextEvo全面开源AI Infra技术,可实现大模型训练“自动驾驶”

图:蚂蚁集团的自动化分布式深度学习系统DLRover现已全面开源

DLRover是一个专为大规模分布式训练而设计的技术框架。在当前许多企业中,训练作业常常在复杂多变的混合部署集群中运行。无论环境多么复杂,DLRover都能轻松应对,就像在崎岖的地形上行驶一样。

2025年大模型技术的快速发展催生了工程实践的爆炸式增长。如何高效管理数据、优化训练和推理效率,充分利用现有算力,成为了关键问题。

完成一个千亿参数级别的大模型,例如GPT-3,用一张卡训练一次要耗时32年。因此,在训练过程中,充分利用算力是非常重要的。为了实现这一目标,有两种方法可以采用。首先,可以进一步提高已购买GPU的性能,以充分发挥其潜力。其次,可以利用以前无法利用的算力资源,例如CPU和内存。为了实现这一点,可以通过异构计算平台来解决这个问题。

DLRover最新集成了Flash Checkpoint(FCP)方案,用于模型训练时的Checkpoint打点。传统的Checkpoint打点方式存在耗时长、高频打点降低训练可用时间、低频打点恢复时丢失过多等问题。通过应用新方案FCP,在千亿参数模型训练后,Checkpoint导致的训练浪费时间降低了约5倍,并将持久化时间降低了约70倍。这一改进将有效训练时间从90%提升至95%。这意味着DLRover的模型训练效率得到了显著的提升。

我们还集成了三项新的优化器技术进去。优化器是机器学习的核心组件,用于更新神经网络参数以最小化损失函数。其中,蚂蚁的AGD(Auto-switchable optimizer with Gradient Difference of adjacent steps)优化器在大模型预训练任务中比传统的AdamW技术加速1.5倍。AGD已在蚂蚁内部多个场景使用并取得显著效果,相关论文已被NeurIPS '23收录。

蚂蚁集团NextEvo全面开源AI Infra技术,可实现大模型训练“自动驾驶”

刺鸟创客 刺鸟创客

一款专业高效稳定的AI内容创作平台

刺鸟创客 110 查看详情 刺鸟创客

图:在大模型预训练任务中,AGD相比AdamW可以加速1.5倍

作为自动化分布式深度学习系统,DLRover的“自动驾驶”功能模块还包括:Atorch,一种PyTorch分布式训练扩展库,在千亿参数模型千卡级别规模下,训练的算力利用率可达60%,帮助开发者进一步压榨硬件算力。

DLRover以 “ML for System” 的理念来提升分布式训练的智能度,旨在通过一个系统,让开发者完全摆脱资源配置的束缚,专注于模型训练本身。在没有任何资源配置输入的情况下,DLRover 仍然可以为每个训练作业提供最佳资源配置。

据了解,蚂蚁集团在人工智能领域持续进行技术投入,最近,蚂蚁集团在内部成立了AI创新研发部门NextEvo,承担了蚂蚁AI的所有核心技术研发,包含百灵大模型的所有研发工作,涉及AI算法、AI工程、NLP、AIGC等核心技术,并在布局多模态大模型、数字人等领域的技术研发和产品创新。

同时,蚂蚁集团还加速开源节奏,填补了国内相关技术空白,推动人工智能行业快速发展。

DLRover开源地址:https://www.php.cn/link/cf372cbe6eae54c6a6dfb3ebbcdc3404 

以上就是蚂蚁集团NextEvo全面开源AI Infra技术,可实现大模型训练“自动驾驶”的详细内容,更多请关注其它相关文章!


# 大模型  # 常熟专业网站建设公司  # 济南国内运输网站建设  # 深圳网站优化按天计算  # 推广系统设计网站推荐  # 建设特效网站  # 技术研发  # 快速发展  # 之争  # 充分利用  # 新能源  # 这一  # 华纳  # 资源配置  # 都能  # 开源  # follow  # 蚂蚁集团  # 产业  # 哈尔滨网站建设方案策划  # 桂阳网站建设是什么  # 惠州网站建设外包公司  # 智赢互联SEO  # 安徽网站建设优化 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 如何用ftp连接命令行  单身聊天app有哪些软件 2025最靠谱的单身交友软件推荐  如何在命令行执行存储过程  苹果16自带配件有哪些  51单片机贴片怎么*  移动固态硬盘如何使用  cos150度等于多少  j*a二数组怎么创建  广东春运抢票怎么抢不到  固态硬盘质量如何  光刻机的分类及其优缺点  typescript和哪个语音很像  虽千万人吾往矣什么意思  汽车中控导航机power线是什么意思  1tb等于多少mb  如何更新typescript  如何去除计算器的命令  苹果16充电方式有哪些  单片机怎么储存和显示  typescript中如何定义json  市盈率百分位roe是什么意思  单片机怎么读取电流值  直接gmV是什么意思?直接GMV:定义和概念  车子上面nfc功能是什么意思  access中如何使用常用宏命令  树莓派命令行如何新建文件  固态硬盘如何备份  苹果手机16系统有哪些  春运抢票如何抢连坐的票  什么是域名解析 域名解析中采用了什么  点焊机接触器上power是什么意思  夸克网盘下载为什么要钱  linux环境中如何使用ping命令  怎么在项目中使用typescript  typescript如何标记私有方法  笔记本如何选择固态硬盘  typescript的文件如何执行  液位传感器power是什么意思  如何检测固态硬盘温度  win10锁屏壁纸怎么换360锁屏壁纸吗  typescript怎么使用vue  如何用dos命令分区  单片机加法程序怎么写  自己如何安装固态硬盘  命令行如何运行c  j*a数组怎么保存类  如何在命令行执行一个jar  2025年哪个局域网聊天软件好用  五十铃x-power是什么意思  nfc近场通讯功能是什么意思 

搜索