搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-26 05:22:28
来源:

猫眼电影

作者:

蒂姆·沃斯托

手机查看

  猫眼电影记者 晋美 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:澳门金沙大全

  12月26日,潜艇老兵牟朝春:我手里攥着的不是舵轮 是整条艇的命,河南省气象台2024年6月14日8时继续发布高温橙色预警:预计6月14日白天,洛阳东部、郑州、开封、商丘、平顶山、许昌、漯河、周口、南阳东部、驻马店、信阳大部最高气温将升至37℃以上,其中周口南部、驻马店北部最高气温将升至40℃以上。,AG真人注册彩金。

  12月26日,第十五届中国智能车未来挑战赛举行 机器人担任“考官”,西安咸阳机场T5,与北京大兴机场、成都天府机场航站楼面积相当。三座机场中规模最小的兰州中川机场T3,面积也相当于上海虹桥机场两座航站楼之和。,GD真人体验视讯,手机上怎么投注3D,博冠。

 时事2:江南APP体育官方网站

  12月26日,突发强震后 日本首次发布“北海道·三陆沿海续发地震注意情报”,仅以当前主力LC2605为例,该合约在12月17日突破年内高点后迅速走高。截至12月22日收盘,LC2605已经升至11.4万元/吨。,泰国际真人秀,腾龙国际是正规平台吗,888caipiaocom。

  12月26日,冬奥会混双冰壶资格赛开赛 中国组合迎来两连胜,今年4月2日,中央纪委国家监委网站通报:江西省政协党组书记、主席唐一军涉嫌严重违纪违法,目前正接受中央纪委国家监委纪律审查和监察调查。,太阳城游戏链接,最新白菜送体验金,爱博网站是什么。

 时事3:365亚洲唯一下载

  12月26日,东西问丨德国汉学家叶翰:汉学研究须传统与当代并重,习近平指出,随着共建“一带一路”深入推进,新疆不再是边远地带,而是一个核心区、一个枢纽地带。,AG视讯论坛,三d走势图,亚新体育注册App。

  12月26日,哥伦比亚总统表示:哥海域发现的遗体或与海上打击行动有关,当下电动汽车市场的格局,是多重因素共同作用的结果:既有行业内部的竞争格局变化,也有外部因素的冲击,包括华尔街的资本施压,以及特朗普政府与拜登政府执政期间,对电动汽车政策的反复摇摆。,nba买球网站,欧宝在线注册,奥门新匍京官网手机登录。

 时事4:捕鱼大亨

  12月26日,昆明机场口岸11月出入境客流量超33万人次,据广州市统计局分析,一季度,广州经济运行在面临燃油车、房地产两大市场需求不足影响,以及自身产业周期性、结构性因素的挑战下平稳开局,全市经济“量”的扩张、“质”的提升持续显现。但当前广州经济运行仍处于动能转换、结构调整的关键期,面临行业修复不平衡、新动能未能有力支撑增长等问题。,国际澳门赌盘,16年凤凰平台官网登录,大阳城娱乐官网首页。

  12月26日,2025中国田径协会10公里精英赛重庆站鸣枪起跑,2023年,我国首次成为全球最大汽车出口国,而早在2021年欧洲已成为我国出口新能源汽车第一目的地。欧委会此举对中国电动汽车行业影响几何,未来出海面临怎样的阻力,中国车企又该如何应对?,MG真人平台网址,必赢亚洲网页版手机登入,老虎机电子官网。

责编:迈尔斯堡

审核:郭洋洋

责编:井上义久

相关推荐 换一换