搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-25 02:06:12
来源:

猫眼电影

作者:

瞿四平

手机查看

  猫眼电影记者 东乡俊 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:jdb财神捕鱼

  12月25日,【理响中国】中国经济长期向好的确定性确定无疑,江西省委常委会、司法部党组召开会议:坚决拥护对唐一军审查调查,CBIN手机版下载。

  12月25日,无人机群飞行规划员、烧烤料理师……这些新职业带来哪些变化和新机遇?,以中信建投为例,作为国内前十大证券公司,其推出的蜻蜓点金App拥有超1000万用户量,月活超过700万,而其中使用华为设备的用户占比高达40%左右。这些用户就是鸿蒙的潜在使用者,因此中信建投在加入鸿蒙生态上没有任何犹豫,第一时间就进行了适配开发。,manbetx官网登陆网页版,lol竞猜官网网页,贝博登陆入口艾弗森。

 时事2:海洋之神8590线路检测网站

  12月25日,女子中巡锦标赛开赛 首轮胡婧、方羽涵领跑,经过近8个月反补贴调查,欧盟委员会(简称“欧委会”)6月12日披露了对从中国进口的纯电动汽车征收的临时关税水平,拟在目前10%的关税基础上,征收17.4%至38.1%不等的临时反补贴税。,国内最大的棋牌游戏平台,海立方809官方网址,澳银河国际游戏平台。

  12月25日,新版中俄双边投资协定于12月1日正式生效,车企高管们坦言,特斯拉的成功让同行纷纷效仿,试图复刻其发展路径。但车企们始终没能认清一个事实:消费者愿意买单的是特斯拉,而非所有品牌的电动汽车。,日博体育开户首页,匍京娱乐场,视讯真人游戏手机版登陆。

 时事3:bet8体育app

  12月25日,内蒙古:雪落古城 绘就中式浪漫画卷,上述规划中坦言,对标对表成都、西安、武汉等国家中心城市及南京、杭州等重要省会城市,郑州文旅还存在文化旅游产品整体竞争力有待提升、文化和旅游公共服务水平和效能有待提升、文化旅游和其他领域的融合联动度有待提升等亟待解决的问题。,MG电子注册,6up官网,ag手机客户端下载。

  12月25日,2025大湾区科学论坛在广州开幕,(1)价格部分:DR001延续在1.26%附近,7天14天资金因为跨年上行,Shibor 3M下行,全周来看,DR001和R001分别较前一周周五下行1.5BP和下行0.7BP至1.2556%和1.3450%;DR007和R007分别上行8.2BP和上行1.2BP至1.5237%和1.5264%。,开元棋盘app下载新版本,世界杯投注论坛吧,足球赛外围怎么买。

 时事4:97娱乐游戏9761

  12月25日,违规使用球员 马来西亚国家队三场比赛被判三球负,本案中,诺泰生物及高管多次强调“已聘请知名会计师事务所审计”“财务处理经中介认可”,试图将责任转移给外部机构。,广东会集团,亚服全,bbin2022世界杯。

  12月25日,山西:多地迎雨雪天气 部分高速封闭,另据德新社报道,朔尔茨2日在德国联邦议院发表讲话时称,尽管俄乌冲突爆发已超过一年,但“和平谈判仍没有基础”。他明确表示:“不能用枪指着人的太阳穴进行谈判。”,AG棋牌网页版,皇冠买球网站,澳门威斯尼斯人的网站。

责编:张玉明

审核:欧华报

责编:吕云图

相关推荐 换一换