新闻中心
蚂蚁集团NextEvo全面开源AI Infra技术,可实现大模型训练“自动驾驶”
近期,蚂蚁集团旗下ai创新研发部门nextevo宣布全面开源ai infra技术,该技术能够极大地提高大型模型训练的效率。根据数据显示,该技术能够将训练时间的有效占比提高至超过95%,实现了训练过程的自动化。这一突破性的进展显著推动了ai研发的效率提升。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图:蚂蚁集团的自动化分布式深度学习系统DLRover现已全面开源
DLRover是一个专为大规模分布式训练而设计的技术框架。在当前许多企业中,训练作业常常在复杂多变的混合部署集群中运行。无论环境多么复杂,DLRover都能轻松应对,就像在崎岖的地形上行驶一样。
2025年大模型技术的快速发展催生了工程实践的爆炸式增长。如何高效管理数据、优化训练和推理效率,充分利用现有算力,成为了关键问题。
完成一个千亿参数级别的大模型,例如GPT-3,用一张卡训练一次要耗时32年。因此,在训练过程中,充分利用算力是非常重要的。为了实现这一目标,有两种方法可以采用。首先,可以进一步提高已购买G
PU的性能,以充分发挥其潜力。其次,可以利用以前无法利用的算力资源,例如CPU和内存。为了实现这一点,可以通过异构计算平台来解决这个问题。
DLRover最新集成了Flash Checkpoint(FCP)方案,用于模型训练时的Checkpoint打点。传统的Checkpoint打点方式存在耗时长、高频打点降低训练可用时间、低频打点恢复时丢失过多等问题。通过应用新方案FCP,在千亿参数模型训练后,Checkpoint导致的训练浪费时间降低了约5倍,并将持久化时间降低了约70倍。这一改进将有效训练时间从90%提升至95%。这意味着DLRover的模型训练效率得到了显著的提升。
我们还集成了三项新的优化器技术进去。优化器是机器学习的核心组件,用于更新神经网络参数以最小化损失函数。其中,蚂蚁的AGD(Auto-switchable optimizer with Gradient Difference of adjacent steps)优化器在大模型预训练任务中比传统的AdamW技术加速1.5倍。AGD已在蚂蚁内部多个场景使用并取得显著效果,相关论文已被NeurIPS '23收录。

刺鸟创客
一款专业高效稳定的AI内容创作平台
110
查看详情
图:在大模型预训练任务中,AGD相比AdamW可以加速1.5倍
作为自动化分布式深度学习系统,DLRover的“自动驾驶”功能模块还包括:Atorch,一种PyTorch分布式训练扩展库,在千亿参数模型千卡级别规模下,训练的算力利用率可达60%,帮助开发者进一步压榨硬件算力。
DLRover以 “ML for System” 的理念来提升分布式训练的智能度,旨在通过一个系统,让开发者完全摆脱资源配置的束缚,专注于模型训练本身。在没有任何资源配置输入的情况下,DLRover 仍然可以为每个训练作业提供最佳资源配置。
据了解,蚂蚁集团在人工智能领域持续进行技术投入,最近,蚂蚁集团在内部成立了AI创新研发部门NextEvo,承担了蚂蚁AI的所有核心技术研发,包含百灵大模型的所有研发工作,涉及AI算法、AI工程、NLP、AIGC等核心技术,并在布局多模态大模型、数字人等领域的技术研发和产品创新。
同时,蚂蚁集团还加速开源节奏,填补了国内相关技术空白,推动人工智能行业快速发展。
DLRover开源地址:https://www.php.cn/link/cf372cbe6eae54c6a6dfb3ebbcdc3404
以上就是蚂蚁集团NextEvo全面开源AI Infra技术,可实现大模型训练“自动驾驶”的详细内容,更多请关注其它相关文章!
# 大模型
# 常熟专业网站建设公司
# 济南国内运输网站建设
# 深圳网站优化按天计算
# 推广系统设计网站推荐
# 建设特效网站
# 技术研发
# 快速发展
# 之争
# 充分利用
# 新能源
# 这一
# 华纳
# 资源配置
# 都能
# 开源
# follow
# 蚂蚁集团
# 产业
# 哈尔滨网站建设方案策划
# 桂阳网站建设是什么
# 惠州网站建设外包公司
# 智赢互联SEO
# 安徽网站建设优化
相关栏目:
【
行业资讯67740 】
【
技术百科0 】
【
网络运营39195 】
相关推荐:
如何用ftp连接命令行
单身聊天app有哪些软件 2025最靠谱的单身交友软件推荐
如何在命令行执行存储过程
苹果16自带配件有哪些
51单片机贴片怎么*
移动固态硬盘如何使用
cos150度等于多少
j*a二数组怎么创建
广东春运抢票怎么抢不到
固态硬盘质量如何
光刻机的分类及其优缺点
typescript和哪个语音很像
虽千万人吾往矣什么意思
汽车中控导航机power线是什么意思
1tb等于多少mb
如何更新typescript
如何去除计算器的命令
苹果16充电方式有哪些
单片机怎么储存和显示
typescript中如何定义json
市盈率百分位roe是什么意思
单片机怎么读取电流值
直接gmV是什么意思?直接GMV:定义和概念
车子上面nfc功能是什么意思
access中如何使用常用宏命令
树莓派命令行如何新建文件
固态硬盘如何备份
苹果手机16系统有哪些
春运抢票如何抢连坐的票
什么是域名解析 域名解析中采用了什么
点焊机接触器上power是什么意思
夸克网盘下载为什么要钱
linux环境中如何使用ping命令
怎么在项目中使用typescript
typescript如何标记私有方法
笔记本如何选择固态硬盘
typescript的文件如何执行
液位传感器power是什么意思
如何检测固态硬盘温度
win10锁屏壁纸怎么换360锁屏壁纸吗
typescript怎么使用vue
如何用dos命令分区
单片机加法程序怎么写
自己如何安装固态硬盘
命令行如何运行c
j*a数组怎么保存类
如何在命令行执行一个jar
2025年哪个局域网聊天软件好用
五十铃x-power是什么意思
nfc近场通讯功能是什么意思


2024-02-02
浏览次数:次
返回列表