Cohere发布企业视觉模型Command A Vision
创始人
2025-08-05 03:41:53
0

随着深度研究功能和其他AI驱动分析的兴起,越来越多的模型和服务致力于简化这一流程,并能读取企业实际使用的更多文档。

加拿大AI公司Cohere正依靠其模型,包括新发布的视觉模型,来证明深度研究功能也应该针对企业用例进行优化。

"无论是解读包含复杂图表的产品手册,还是分析现实场景照片进行风险检测,Command A Vision都能出色应对最具挑战性的企业视觉任务",该公司在博客文章中说道。

这意味着Command A Vision能够读取和分析企业最常需要的图像类型:图表、图形、示意图、扫描文档和PDF。

由于基于Command A的架构构建,Command A Vision只需要两个或更少的GPU,就像文本模型一样。该视觉模型还保留了Command A的文本能力,能够读取图像上的文字并理解至少23种语言。Cohere表示,与其他模型不同,Command A Vision降低了企业的总体拥有成本,并且完全针对企业的检索用例进行了优化。

Cohere如何构建Command A

Cohere表示,它采用了Llava架构来构建Command A模型,包括视觉模型。这种架构将视觉特征转换为软视觉Token,可以分为不同的图块。

这些图块被传递到Command A文本塔,"一个密集的1110亿参数文本大语言模型",该公司说。"以这种方式,单个图像最多消耗3328个Token。"

Cohere表示,它分三个阶段训练视觉模型:视觉-语言对齐、监督微调(SFT)和带有人类反馈的强化学习后训练(RLHF)。

"这种方法使图像编码器特征能够映射到语言模型的嵌入空间",该公司说。"相比之下,在SFT阶段,我们在多样化的指令跟随多模态任务集上同时训练视觉编码器、视觉适配器和语言模型。"

企业AI的可视化

基准测试显示,Command A Vision在性能上超越了其他具有类似视觉能力的模型。

Cohere在九项基准测试中将Command A Vision与OpenAI的GPT 4.1、Meta的Llama 4 Maverick、Mistral的Pixtral Large和Mistral Medium 3进行了比较。该公司没有提及是否测试了针对Mistral专注于OCR的API Mistral OCR。

Command A Vision在ChartQA、OCRBench、AI2D和TextVQA等测试中得分超过其他模型。总体而言,Command A Vision的平均得分为83.1%,相比之下GPT 4.1为78.6%,Llama 4 Maverick为80.5%,Mistral Medium 3为78.3%。

目前大多数大语言模型都是多模态的,意味着它们可以生成或理解照片或视频等视觉媒体。然而,企业通常使用更多图形化文档,如图表和PDF,因此从这些非结构化数据源中提取信息往往困难重重。

随着深度研究的兴起,引入能够读取、分析甚至下载非结构化数据的模型的重要性不断增长。

Cohere还表示,它正在开放权重系统中提供Command A Vision,希望那些希望摆脱封闭或专有模型的企业开始使用其产品。到目前为止,开发者们表现出了一定的兴趣。

Q&A

Q1:Command A Vision是什么?它有什么特殊能力?

Q2:Command A Vision相比其他模型有什么优势?

A:Command A Vision只需要两个或更少的GPU就能运行,降低了企业的总体拥有成本。在基准测试中,它的平均得分达到83.1%,超过了GPT 4.1的78.6%、Llama 4 Maverick的80.5%等竞争对手,并且支持至少23种语言。

Q3:Command A Vision采用了什么技术架构?

A:Command A Vision采用Llava架构构建,将视觉特征转换为软视觉Token并分为不同图块,然后传递到1110亿参数的文本大语言模型中处理。训练过程分为三个阶段:视觉-语言对齐、监督微调和带有人类反馈的强化学习后训练。

相关内容

热门资讯

卫星互联网低轨卫星成功发射 8月4日18时21分,我国在海南商业航天发射场使用长征十二号运载火箭,成功将卫星互联网低轨07组卫星...
科森科技获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示科森科技(603626)新获得一项实用新型专利授权,专利名为“...
成都首条自动驾驶公交线正在路测... 8月4日,“智驾公交·智启未来”活动在成都未来科技城举行,正式启动成都市自动驾驶公交示范场景打造。据...
广和通获得实用新型专利授权:“... 证券之星消息,根据天眼查APP数据显示广和通(300638)新获得一项实用新型专利授权,专利名为“C...
独家专访联合国首席信息技术官:... 21世纪经济报道记者吴斌 上海报道 “独行快,众行远。”家乡在非洲莫桑比克的联合国助理秘书长、首席信...
力生制药获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示力生制药(002393)新获得一项实用新型专利授权,专利名为“...
海尔智家获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示海尔智家(600690)新获得一项实用新型专利授权,专利名为“...
北碚区统计局积极赋能区域高质量... 北碚区统计局 以精准服务强数据之基 赋能区域高质量发展 数据是感知高质量发展的晴雨表,是赋能科学...
华能国际获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示华能国际(600011)新获得一项实用新型专利授权,专利名为“...
解读AI场景革命 新物种爆炸2... 封面新闻记者 张越熙 8月3日,“新物种爆炸·吴声商业方法发布2025”在北京举行。场景实验室创始人...
Cohere发布企业视觉模型C... 随着深度研究功能和其他AI驱动分析的兴起,越来越多的模型和服务致力于简化这一流程,并能读取企业实际使...
赛拉弗取得便于定制化组件手工叠... 金融界2025年8月4日消息,国家知识产权局信息显示,赛拉弗应用科技(江苏)有限公司取得一项名为“一...
威孚高科获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示威孚高科(000581)新获得一项实用新型专利授权,专利名为“...
世界机器人大会即将开幕,智能化... 2025世界机器人大会新闻发布会于8月2日在北京召开。会上介绍,2025世界机器人大会将于8日至12...
西南石油大学:AI赋能彝绣文化... 中国教育报-中国教育新闻网讯(通讯员 李泽楷 记者 陈朝和)“通过我们设计开发的基于AI技术搭建的彝...
韦布拍摄超级宇宙深空:突破哈勃... 全方位刷新纪录。 韦布重拍的“哈勃超深空场”。仅此图中展现的就至少有2500个天体,其中包括数百个...
浩霖电子取得新型EQ型电感骨架... 金融界2025年8月4日消息,国家知识产权局信息显示,遂宁市浩霖电子科技有限公司取得一项名为“一种新...
有没有人管管KTV里的AI生成... 时至今日,AI早已不算什么新兴技术。 从写PPT到修自拍再到情感咨询,它以各种形态渗你我日常生活。 ...
达人高科取得智能温度模拟系统专... 金融界2025年8月4日消息,国家知识产权局信息显示,深圳达人高科电子有限公司取得一项名为“一种智能...
王坚:计算与人工智能领域创新突... 7月29日,第六届全国非公有制经济人士优秀中国特色社会主义事业建设者表彰大会在北京召开。之江实验室主...