蚂蚁集团NextEvo全面开源AI Infra技术 可实现大模型训练“自动驾驶”
科技IT频道
2024-02-02 21:25:09
0

原标题:蚂蚁集团NextEvo全面开源AI Infra技术 可实现大模型训练“自动驾驶”

近日,蚂蚁集团AI创新研发部门NextEvo全面开源AI Infra技术,可帮助大模型千卡训练有效时间占比超过95%,能实现训练时“自动驾驶”,这推动了AI研发效率。

(图:蚂蚁集团的自动化分布式深度学习系统DLRover现已全面开源)

该技术框架名为DLRover,目标在于大规模分布式训练的智能化。目前很多企业的训练作业都是跑在混合部署的集群中,运行环境复杂多变,不管多么“崎岖的地形”,DLRover都可以“轻松行驶”。

2023 年大模型技术的发展,带来了工程实践的爆发,如何管理数据,提高训练和推理效率,最大化利用现有算力,成了关键一环。

完成一个千亿参数级别的大模型,如GPT-3,用一张卡训练一次要耗时32年,那么训练时的算力利用尤为重要。方法之一是把能用的算力用得更好,比如进一步压榨已购买GPU的性能;二是把以前利用不了的算力用起来,比如CPU、内存等,这就需要通过异构计算平台来解决。

最新集成进DLRover的是Flash Checkpoint(FCP)方案。模型训练时,一般要打Checkpoint(检查点),以便中断时能恢复到最近状态,目前常规的做法,存在着耗时长、高频打点易降低训练可用时间、低频打点恢复时丢失过多等缺点。新方案FCP应用在千卡千亿参数模型训练后,Checkpoint 导致的训练浪费时间降低约5倍,其中持久化时间降低约70倍,有效训练时间从90%提升至95%。

同时集成进去的,还有三项新的优化器(Optimizer)技术。优化器作为机器学习的核心组件,用于更新神经网络参数以最小化损失函数。其中,蚂蚁的AGD(Auto-switchable optimizer with Gradient Difference of adjacent steps)优化器,在大模型预训练任务中,相比传统的AdamW技术加速 1.5 倍,AGD已在蚂蚁内部多个场景使用并取得显著效果,相关论文已被 NeurIPS '23收录。

(图:在大模型预训练任务中,AGD相比AdamW可以加速1.5 倍)

作为自动化分布式深度学习系统,DLRover的“自动驾驶”功能模块还包括:Atorch,一种PyTorch分布式训练扩展库,在千亿参数模型千卡级别规模下,训练的算力利用率可达60%,帮助开发者进一步压榨硬件算力。

DLRover以 “ML for System” 的理念来提升分布式训练的智能度,旨在通过一个系统,让开发者完全摆脱资源配置的束缚,专注于模型训练本身。在没有任何资源配置输入的情况下,DLRover 仍然可以为每个训练作业提供最佳资源配置。

据了解,蚂蚁集团在人工智能领域持续进行技术投入,最近,蚂蚁集团在内部成立了AI创新研发部门NextEvo,承担了蚂蚁AI的所有核心技术研发,包含百灵大模型的所有研发工作,涉及AI算法、AI工程、NLP、AIGC等核心技术,并在布局多模态大模型、数字人等领域的技术研发和产品创新。

同时,蚂蚁集团还加速开源节奏,填补了国内相关技术空白,推动人工智能行业快速发展。

DLRover开源地址:https://github.com/intelligent-machine-learning/dlrover

相关内容

热门资讯

政策加码城市更新 “旧空间”酿... 政策加码城市更新“旧空间”酿出“新价值” 经济日报:人工智能重塑中国制造新优势 “共享中国经济高质量...
ACOEM对中仪维修 这是(13611080985)整理的信息,希望能帮助到大家 中仪维修作为工业自动化和仪器设备维护的重...
邦泽创科公布“一种多模式自适应... 天眼查APP显示,近日,广东邦泽创科电器股份有限公司申请的“一种多模式自适应过胶机”专利公布。 摘要...
上海建工公布“一种液压驱动双侧... 天眼查APP显示,近日,上海建工集团股份有限公司申请的“一种液压驱动双侧开合式泵管”专利公布。 摘要...
vivo发布全球最轻MR头显,... DoNews8月23日消息,8月21日,vivo Vision发布会暨影像盛典于广东东莞隆重举行。值...
25项黑科技护航出行 郑州聚智... 行业代表共同发起智能安全出行倡议。人民网 程明辉摄 人民网郑州8月23日电 (程明辉)8月21日,“...
固位力测量 固位力测量是什么?它在工业和科学研究中有何重要性?固位力通常指的是一个物体在某种条件下保持固定位置所...
2025广州国际低空经济贸易博... 低空经济作为融合人工智能、高端制造、新能源等技术的战略性新兴产业,已成为全球科技竞争与经济转型的核心...
龙岗区加速“鸿蒙化” 【深圳商报讯】(记者 刘宇峰)近日,深圳市龙岗区举办鸿蒙生态建设交流会。龙岗区科创局、区工业和信息化...
华为9月19日将在巴黎发布新品... IT之家 8 月 23 日消息,华为宣布将于 9 月 19 日在法国巴黎举办主题为“Ride the...
七城算力中心接入国家超算互联网... IT之家 8 月 23 日消息,在今日的 2025 中国算力大会主论坛上,国家超算互联网与七城算力中...
中国西部首个未来机器人公园 为... 封面新闻记者 赖芳杰 摄影报道 能跑能跳的机器狗、近身格斗的“机械战士”......这些往常只能在屏...
听从小米雷军建议,全新小鹏P7... 小鹏汽车董事长何小鹏昨晚(8 月 10 日)发文称:“之前雷总和我围绕真正高性能的纯电车型,专门讨论...
大丰实业获得发明专利授权:“一... 证券之星消息,根据天眼查APP数据显示大丰实业(603081)新获得一项发明专利授权,专利名为“一种...
汇百盛激光取得激光切割工作台加... 金融界2025年8月23日消息,国家知识产权局信息显示,佛山汇百盛激光科技有限公司取得一项名为“一种...
石景山区:创新引领现代化产业体... 导语 8月21日,北京市人民政府新闻办公室举行“一把手发布·京华巡礼”系列主题新闻发布会——石景山·...
太比特连接:6G能否终结数据中... 5G作为约五年前开始普及的无线网络标准,一直因未能兑现承诺而饱受批评。有些人甚至将其称为"过度炒作的...
运用产业招商大数据!邢台推动主... 运用产业招商大数据,高效制作产业链全景图 我市制定方案推动主导产业精准招商 8月20日,记者从市招商...
华为取得一种能降低端子阻抗的电... 金融界2025年8月23日消息,国家知识产权局信息显示,华为技术有限公司取得一项名为“一种电连接器、...
宇宙新纪录!天文学家捕获史上最... 近日,科技界传来了一则震撼人心的消息。据报道,一个由麻省理工学院等国际科研机构组成的团队,在2025...