搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-24 12:05:16
来源:

猫眼电影

作者:

约——

手机查看

  猫眼电影记者 房道龄 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:大发888体育APP

  12月24日,中国海军989编队抵达印度尼西亚进行友好访问,2021年11月,邓可的国任保险总裁任职资格获得监管批复,成为该公司通过市场化方式招聘的第二位总裁,次年其还兼任该公司合规负责人。,手机赌钱app在线。

  12月24日,河南三门峡一项目工程发生安全事故 致5人遇难,在缤纷的世界中,无论是个人、群体还是国家,都会面对别人对我们的定义。我们要认真对待“被定义”,明辨是非,去芜存真,为自己的提升助力;也要勇于通过“自定义”来塑造自我,彰显风华,用自己的方式前进。,线上直营现金网站,4422leyu,ag在线真人。

 时事2:微球体育app

  12月24日,牧区行走33年的“马背医生”,锐联财智已与华夏基金合作,推出了一只纳斯达克上市的交易所交易基金,该基金专注投资寒武纪等拥有变革性技术的中国企业。,世界杯买球绕口令,AG网址,博天堂网址是多少。

  12月24日,海南全岛封关后首个制造业标志性外资项目开工,从资产质量角度看,尽管公司对应收账款计提了坏账准备,但在经济下行压力增大、部分医疗机构经营困难的宏观环境下,应收账款的实际回收风险正在上升。一旦发生大规模坏账,将对公司利润造成直接冲击,并进一步恶化现金流状况。,纬来体育外围官网,mg官网电子,姚记app。

 时事3:凯发k8娱乐

  12月24日,中国在大分子蛋白精准测量领域取得重要技术突破,首先,近期证监会和交易所陆续出台资本市场“1+N”配套制度规则,其中的发行上市规则修改了主板、创业板发行上市条件和板块定位要求,具体制度完善后,平稳推进发行上市审核工作有了更为明确的标准。其次,前期多数公司因IPO申请文件中的财务资料超过有效期而中止审核,日前申报企业陆续提交2023年财务数据,进入恢复审核程序,相关审核工作需要继续依法依规予以推进。,现金打牌app,2018亚冠直播,万博网页登录页面设置。

  12月24日,云南茶叶出口全球32个国家和地区,美国锐联全球顾问公司创始人许仲翔表示,在人工智能赛道的竞争中,美国在创新方面具有优势,而中国则在工程技术、制造业以及电力供应领域占据上风。,365bet怎么下注,疯狂万人捕鱼高爆版,十大靠谱棋牌。

 时事4:扑克王

  12月24日,2025-2026吉林国际高山/单板滑雪挑战赛启幕,沙姆桑表示,中国此次成功斡旋沙特伊朗恢复外交关系,让国际社会看到了和平解决也门冲突的可能,这对于缓和也门局势,缓解也门人道主义危机具有积极意义。他期待中国能在也门问题谈判以及维护地区安全稳定等议题上继续发挥积极作用。,真钱国际捕鱼游戏厅,火狐体育官网APP,m6米乐首页。

  12月24日,全国超千家三级医院帮扶中西部地区 提升医疗服务能力,该公司目前有19家股东,11家国有股东中,深投控与深圳罗湖投资控股均为深圳市国有资本投资运营公司,共占国任保险54.622%股权。民营股东共8家,公开关联信息层面无关联关系。,乐享彩票网站,AG8国际登录,08体育网址。

责编:林晓雪

审核:苗金玲

责编:甘永辉

相关推荐 换一换