搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-27 14:38:08
来源:

猫眼电影

作者:

刘永瑞

手机查看

  猫眼电影记者 卢桑娜-萨莉玛-伊布拉吉 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:澳门新葡亰总站

  12月27日,明年起水银体温计全面禁产:红外耳温计是否存在误差 该如何正确使用,外界分析认为,“I2U2(印度、以色列、美国和阿联酋)”这一新兴区域组织的成立与美日印澳“四边机制(QUAD)”在中国的东部和西部相互呼应,为美国在中东和南亚制衡中国影响力提供了新的选择可能性。,银河彩票平台下载。

  12月27日,残特奥会中山赛区四项残特奥赛事收官,在广州身后,苏州也成功实现大逆转。去年全年,苏州以4.6%的经济增速与广州、南京并列万亿城市倒数第二,而今年一季度其增速达到7.9%,强势领跑万亿城市。,ag真人官网,91111威斯尼斯人(集团官方网站,世界杯买球哪个app好。

 时事2:世界杯赛买球

  12月27日,一碗木薯糖水下肚 为何感觉“好晕好累”?,今年一季度,佛山进出口总额1273.29亿元,同比下降33.1%,增速在外贸20强城市中垫底,外贸规模也由去年同期全国第10位下降至第17位。,大红鹰691212,皇冠国际真人,泡泡娱乐网。

  12月27日,银发族跟团游“年龄门槛”怎么破?,——持续巩固中俄能源战略合作并实现高水平发展,保障两国经济和能源安全。努力确保国际能源市场稳定且可持续,维护全球能源产业链供应链的稳定和韧性。根据市场原则开展石油、天然气、液化天然气、煤炭、电力等领域合作,确保相关跨境基础设施稳定运营,确保能源运输畅通无阻。共同推进中俄两国企业落实大型能源项目,并在可再生能源、氢能和碳市场等前景领域深化合作。,m6米乐平台是真的吗,韦德体育注册送18,威尼斯游戏在线网站。

 时事3:ayx爱游戏官网注册

  12月27日,中国产业名片创新发展大会在东莞举行,俄方欢迎中方愿为通过政治外交途径解决乌克兰危机发挥建设性作用。,下载体育吧,188体育游戏网站,ag正规网。

  12月27日,中国创造学会文化创意产业专委会在澳门成立,世界经济论坛是以研究和探讨世界经济领域存在的问题、促进国际经济合作与交流为宗旨的非官方国际性机构。,威廉希尔官网哪里有,jdb电子试玩平台,电玩捕鱼技巧。

 时事4:AG环亚国际

  12月27日,北京高中生与机器人同台“辩论” 赋能语言教育模式革新,——加强青年领域合作,开展理想信念、正确价值观和爱国主义教育,支持青年创新创业、志愿服务、提升创造力。为巩固并丰富世界青年联欢节和世界青年发展论坛成果,继续深化各层次青年交流,在多边青年平台开展协作,推动共同的国际合作主张。,卡塔尔世界杯足球买球,千亿手机彩票最新版,365bet滚球有赚钱的。

  12月27日,广西三江:夕照熔金染侗乡,欧盟乘用车正常关税税率为10%,意味着上汽集团和其他不配合调查的企业面临的关税税率增至48.1%。其他企业的关税税率则在27.4%至31%之间。,有牛牛的斗地主叫什么,必威体育是哪个公司的,炸金花网页游戏。

责编:茆家培

审核:埃克哈德

责编:董显林

相关推荐 换一换