搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-24 17:44:34
来源:

猫眼电影

作者:

张大光

手机查看

  猫眼电影记者 金农 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:单机游戏下载排行榜

  12月24日,融链赋能 2025企业科技创新发展论坛在深圳举办,“今日俄罗斯”报道称,至于斯诺登提到的“大规模监控”,指的就是他所经历的“棱镜门”事件。由美国政府发起的大规模电子监听项目“棱镜计划”在2013年被曝光。事发后,美国政府以盗窃政府财产、向未经授权的人提供机密信息等罪名指控斯诺登,并吊销其护照,最终斯诺登经历近十年流亡生涯后入籍俄罗斯。,冠亚体育官网。

  12月24日,前11月北京地区出口值创历史同期新高,数据要素要发挥经济价值,需要做到两三个月见效、以提升Global ROI为核心。宋碧莲指出,这背后是企业级综合经营战略的历史性变革:从“以产品为中心”转向“以用户为中心”,借鉴互联网的用户全生命周期价值挖掘逻辑——并非通俗所说的“割韭菜”,而是精准满足用户不同阶段的多元需求。,乐鱼最新版下载,360分分彩平台,M6好玩吗?。

 时事2:九卅登录

  12月24日,超120个“大圆桶”运抵浙江嵊泗小洋山北作业区,张先生说,因为网球人群的增多,网球运动关联经济也更加活跃。球衣、球袜、球包以及打球的各种装备和周边产品,包括网球训练课都在走俏。比赛数量的增加,更是提升了各地运动场馆的利用率。,真钱斗地主游戏,网上森林舞会,百丽宫网址谁有讨论。

  12月24日,中国科大制备出一种高品质量子光源,近日,西宁曹家堡国际机场三期扩建工程通过竣工验收,为年内投运奠定了基础。,金源网投,88体育app官网苹果下载,欧宝官网下载。

 时事3:大白鲨游戏下载

  12月24日,关注巴以局势 以色列开始在东部边境建设安全隔离墙,也有多地表示暂不放宽。今年4月1日,温州市交通运输局称,根据出租汽车驾驶员(包括巡游、网约车驾驶员)从业资格管理有关规定,该市申请从业资格证的驾驶员年龄需在60周岁以下。还有,2022年《浙江省道路运输条例》修订时,温州市交通运输局曾提出将从业年龄放宽至65岁的建议,但省里研究后未采纳。,银河官网,凯发k8下载中心,2022买球网站。

  12月24日,【百万庄小课堂】孩子脖子黑黑洗不净?可能是身体在发“健康警报”,钟自然出生于1962年8月,安徽桐城人,曾在原地质矿产部和原国土资源部工作多年,2014年任原国土资源部党组成员,中国地质调查局局长、党组书记。,伟德体育是什么意思网站,龙8游戏网址,最好比分网。

 时事4:九龙传真(手写)

  12月24日,外籍友人在沪参与献血 深度参与城市公益事业,这一立场符合国际通行的公司治理原则。例如,美国SEC在Enron、WorldCom等案中均强调:管理层不能以依赖审计师为借口逃避责任。,emc体育网址,888真人官网是多少,线上娱乐葡京。

  12月24日,世界银行拨款5亿美元支持菲律宾台风“海鸥”灾后重建,【导读】因内幕交易等行为,昊海生科实际控制人之一蒋伟遭罚没约1934万元,国际炸金花,在哪里赌博,必发集团app亚洲下载。

责编:王海臣

审核:马兰翠

责编:侯军

相关推荐 换一换