斯坦福20亿参数端测多模态AI Agent模型大升级,手机汽车机器人都能用
量子位
2024-05-07 14:41:38
0

原标题:斯坦福20亿参数端测多模态AI Agent模型大升级,手机汽车机器人都能用

允中 发自 凹非寺

量子位 | 公众号 QbitAI

全球首个超小型多模态AI Agent模型Octopus V3,来自斯坦福大学的NEXA AI团队,让Agent更加智能、快速、能耗及成本降低。

今年四月份初,NEXA AI推出了备受瞩目的Octopus V2,该模型在函数调用性能上超越了GPT-4,减少了95%的推理时所需的文本量,为端侧AI应用带来了新的可能性。其专利性核心技术“functional token”通过创新的函数调用方式显著减少推理时所需的文本长度。

这种方法使得模型能够在只有20亿参数的情况下实现高效训练,并在精度和延迟方面超越了GPT-4,适应了各种端设备的部署需求。

发布以来,Octopus V2在LLM社区获得了广泛关注,受到了AI领域大量前沿技术专家及研究者的赞赏,如Hugging Face的CTO Julien Chaumond、知名AI Newsletter Rundown AI的创始人 Rowan Cheung以及Figure AI的创始人Brett Adcock、OPPO边缘人工智能团队负责人Manoj Kumar,称其“开创了端侧AI技术新纪元”。

在知名开源AI平台Hugging Face上,Octopus V2下载量已经超过12000次。

在不到一个月的时间里,NEXA AI团队发布下一代多模态AI Agent模型Octopus V3,展现进一步突破:具有图像处理和多语言文本处理能力,为智能手机等端侧设备真正走向AI时代铺平了道路。

首个参数量小于10亿的多模态AI Agent模型

Octopus V3不仅拥有多模态能力,在函数调用性能上远超同类模型,可媲美GPT-4V+GPT4;而且模型参数量不到10亿,具有多语言能力。

也就是说,相比传统的大型语言模型,它体积更小,能耗更低,能够更加轻松地在各种小型端设备上运行,比如树莓派,并做到高速且准确的函数调用。

这意味着,未来AI Agent能够广泛应用于智能手机、AR/VR、机器人、智能汽车等端侧设备,为用户交互体验更加流畅、智能。

另一方面,由于V3具有多模态处理能力,可同时处理文本和图像输入,再加上多语言能力,也将让用户体验更加丰富。

例如,在Instacart购物应用中,用户可以通过一张菠萝的图片及简单的对话指令,让AI Agent自动为他们搜索商品,提高了效率和用户的体验。

再比如,在发送邮件等场景中,Octopus V3可以根据一张具有文字的图像,自动提取信息并填写邮件内容,为用户提供更加智能、便捷的服务。

从软件交互到智能汽车,端侧AI潜力巨大

基于这些特性,Octopus V2及V3的应用场景丰富多样,具有广泛的应用前景。

除上文提到的手机场景,当Octopus V2应用在智能汽车上时,也能带来新的交互体验。目前的语音助手往往难以帮助车主完成较为复杂的任务,如在驾驶途中临时改变目的地、加入额外停靠点等。应用Octopus V3后,AI助手能够基于较为模糊简单的指令快速、精准地完成相应任务。

结合V2、V3的能力,从信息检索、到基于指令完成设计,用户可以在虚拟场景下获得流畅的AI体验:在一个社区用户的VR场景demo中,输入简单的语音指令后,AI Agent能够帮助用户快速完成一个客厅设计,在弹指间替换沙发、改变颜色灯光等。在用户输入旅行指令后,用户快速来到了日本,而AI Agent同样可以在简单的对话式交流中帮助用户搜索相应景点,提供丰富的信息。

数据显示,全球大型语言模型市场规模正在快速增长。Granview Research报告显示,全球大型语言模型市场规模估计为43.5亿美元,并预计从2024年到2030年的复合年增长率为35.9%。同样,边缘人工智能市场也呈现出蓬勃发展的势头——预计从2023年到2030年,全球边缘人工智能市场的复合年增长率为21.0%,到2030年将达到664.78亿美元。

NEXA AI团队由斯坦福大学的杰出研究人员创立。

创始人兼首席科学家Alex Chen(陈伟)正在攻读斯坦福大学的博士学位,拥有丰富的人工智能研究经验,并且曾担任斯坦福华人创业协会(Stanford Chinese Entrepreneurs Organization)的主席。

联合创始人兼首席技术官Zack Li(李志远)也是斯坦福大学的毕业生,并在Google和Amazon Lab126实验室拥有4年端侧AI的一线研发经验,同样曾经担任斯坦福华人创业协会的主席。

斯坦福大学副教授、斯坦福技术创业项目副主任Charles (Chuck) Eesley担任顾问,为团队提供指导和支持。

左:李志远;右:陈伟

目前,NEXA AI的独创性技术已申请专利保护。

NEXA AI的创始团队表示,他们将继续致力于推动端侧AI技术的发展,通过开源模型提升其创新技术的影响力,为用户创造更智能、高效的未来生活。

论文地址:

https://arxiv.org/abs/2404.11459

*本文系量子位获授权刊载,观点仅为作者所有。

量子位QbitAI

վ'ᴗ' ի 追踪AI技术和产品新动态

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~

相关内容

热门资讯

越秀区教育局:将全力打造拔尖创... “全运会运动员用数学优化的动作突破极限,而你们能让数学创新世界,愿你们始终保持对数学的好奇。”10月...
广交会观察:中国机器人热销国际... 中新社广州10月15日电 (记者 张璐)正在广州举办的第138届中国进出口商品交易会(广交会)第一期...
东航官宣Wi-Fi免费!空中上... 来源:IT时报 作者/ IT时报记者 孙妍 编辑/ 孙妍 10月11日起,东方航空国内“空中快线”宽...
Arm与开放计算项目合作发布A... Arm Holdings公司正与开放计算项目合作,致力于为人工智能数据中心提供高效的基础设施标准,以...
荣耀Magic8 Pro全球第... 快科技10月15日消息,在今天的荣耀新品发布会上,荣耀CEO李健表示,荣耀Magic8 Pro的跑分...
汇川技术湾芯展上发布全场景智能... 10月15日,在2025湾区半导体产业生态博览会(深圳)上,汇川技术发布驭沃iFA Evolutio...
特斯拉向三花智控下达50亿人形... 三花控股集团 视觉中国 资料图 一则总计69个英语单词,始载于东方财富网个人号的“出口转内销”小作文...
2025年5G地空通信(ATG... 今天分享的是:2025年5G地空通信(ATG)航空互联技术体系白皮书1.0-中国移动 报告共计:19...
正面迎击升级版苹果Vision... 财联社10月15日讯(编辑 史正丞)就在苹果即将推出性能升级版Vision Pro之际,由三星、谷歌...
调节性T细胞助力“消灭”肿瘤 2025年诺贝尔生理学或医学奖得主:弗雷德·拉姆斯德尔、玛丽·E·布伦科、坂口志文(从左至右) 10...
光伏逆变器MPPT效率低?芯森... 不知道大家有没有想过或遇到过这样的问题:为什么同样的光照条件,不同逆变器的发电效率会有差异?答案在M...
注入创新动力!这些专利从实验室... 新华社大连10月15日电13日至15日,第十四届中国国际专利技术与产品交易会在大连举行。创新成果与产...
吕梁市互联网行业青年工作委员会... 黄河新闻网吕梁讯 10月15日,吕梁市互联网行业青年工作委员会(以下简称“行业青工委”)揭牌成立仪式...
主力资金 | 特斯拉大单袭来?... A股三大指数今日(10月15日)重拾升势,沪指收复3900点整数关口,创业板指涨逾2%。行业板块呈现...
地球正在“变暗”或加剧气候变化... 来源:四川在线-华西都市报 格陵兰岛东部部分融化的冰川。 天问二号探测器拍摄的地球。 在我们赖以...
OpenAI千亿级合作遍地开花... OpenAI与博通(AVGO.US)传闻已久的合作终于摆上桌面。 两家公司于10月13日联合官宣了这...
Neuralink加速N1 脑... 据报道,近日,武汉东湖高新区印发《关于支持脑机接口产业创新发展的若干措施》,围绕加强技术产品攻关、推...
联泓新科:PEEK材料可用于人... 证券之星消息,联泓新科(003022)10月15日在投资者关系平台上答复投资者关心的问题。 投资者提...
vivo专访:高端市场一定有我... 10月13日晚,vivo正式发布X300系列,作为标准版的X300是去年X200 Pro mini的...
OPPO Pad 5评测:越级... 【CNMO科技】又到了一年一度的旗舰时刻,除了常规的Find系列新品,OPPO在平板领域也带来了全新...