搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-27 16:33:31
来源:

猫眼电影

作者:

周彦武

手机查看

  猫眼电影记者 宋必武 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:正规网投彩票平台

  12月27日,桂林会仙板鸭美食圩开市 冬日飘香引客来,按照深圳理工大学筹备办主任、国际欧亚科学院院士、中国科学院深圳先进技术研究院创院院长樊建平的说法,学校计划10年建成“深圳的‘中国科学技术大学’”,20年建成“中国的‘世界一流理工科大学’”。,葡京体育注册送18。

  12月27日,1名进境旅客人身绑藏雪茄49支 被西九龙站海关查获,当地时间3月12日,英国首相苏纳克将飞往美国与美国总统拜登及澳大利亚总理阿尔巴尼斯会谈,旨在敲定一份涉及三方的核潜艇合作协议细节。,澳门皇冠手机在线,纬来体育怎么注册,腾讯新闻世界杯投注。

 时事2:环亚旗舰厅官网下载

  12月27日,30秒,走进“全国商业保理之都”,当地时间6月5日,印度大选结果揭晓,印度全国民主联盟推选莫迪为联盟领导人,组建新一届印度政府。莫迪或将于6月8日宣誓就职,73岁的莫迪将成为继印度开国总理贾瓦哈拉尔·尼赫鲁之后,第二位连任三届的印度总理。,皇冠游戏合法,yabo22vip网投平台,优博网页登陆。

  12月27日,台湾五年来首见税收短征 媒体忧军购挤压民生,6月7日,中国海警2501舰艇编队在我钓鱼岛领海内巡航。这是中国海警依法开展的维权巡航活动。,现金mg游戏,沙巴体育注册平台,AG对打刷流水。

 时事3:买球网站排名

  12月27日,中央政府驻香港联络办下半旗志哀,中国西北地区与中亚国家存在同源跨国民族。中国与中亚地区开展安全合作,对于打击极端分裂势力、维护西北地区的稳定具有重要意义。,哪个棋牌平台公平公正,火狐体育网页登录火狐体育,真人玩二八杠赌的大。

  12月27日,我国多举措促进明年经济稳中求进 提质增效,双方高度评价中俄在二十国集团中的建设性合作,重申愿继续加强该机制下协作,推动构建普惠包容的经济全球化,采取平衡且具有共识的行动应对突出的经济金融挑战,推动全球治理体系朝着更加公正的方向发展,提升“全球南方”国家在全球经济治理体系中的代表性。双方欢迎非洲联盟成为二十国集团正式成员,并愿为新兴市场和发展中国家利益共同作出建设性努力。,棋牌游戏排名,炸金花游戏软件,必赢亚洲官网网页登陆。

 时事4:必威手机网页版下载

  12月27日,1.6万名马拉松爱好者在珠海齐齐开跑,从初期的艰难摸索,到如今的体验对齐、甚至特色反超,鸿蒙生态的“微笑曲线”已清晰可见。面对仍在观望的开发者,同程旅行鸿蒙App商务负责人王志强直言,必须及早布局,才能抓住鸿蒙生态的增长红利,否则很可能会落后于时代大势。,二八杠扑克牌规则,群友斗地主,口碑最好棋牌平台。

  12月27日,“00后”中国青年行走黄河畔 剪刀声里觅传承,反观乌鲁木齐,偏居西北一隅的位置,为向西开放提供了便利。李瀚明指出,与乌鲁木齐类似的其实是哈萨克斯坦阿拉木图,两座城市都位于亚欧航路的中间点。利用空客A321XLR这样的远程窄体机,阿拉木图成功开航伦敦。在国内,乌鲁木齐是唯一一个用窄体机能直飞欧洲的航空枢纽。,世界杯冠亚军投注时间,九游会俱乐部,尊龙快速开户。

责编:肖运伟

审核:朱承艺

责编:陈广富

相关推荐 换一换