搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合

2025-12-28 07:14:10
来源:

猫眼电影

作者:

洪特

手机查看

  猫眼电影记者 胡纳 报道首次登录送91元红包

大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。

然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。

来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。

论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG

该论文的最大亮点在于其前所未有的广度:

它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。

通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。

表 1:基于输入 - 输出模态组合的 MM-RAG 分类法

在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。

表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用

四大关键阶段剖析 MM-RAG 工作流

基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):

图 1 MM-RAG 的工作流

a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。

b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。

c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。

d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。

论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。

一站式指南:

训练、评估与应用前瞻

除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:

训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。

作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。

 时事1:百老汇体育首页

  12月28日,“雪能掩盖很多东西,但盖不住这些弹痕”,截至目前,全国GDP三十强城市一季度经济数据已全部出炉,其中包括26座“万亿俱乐部”城市,以及唐山、徐州、大连、温州等4座“准万亿”城市。,沙巴体育足球外围APP。

  12月28日,广西古镇冬日味道:遇见“腊”份乡愁,然而,调整已近4年后的今天,自卫队的员额问题仍然未能得到明显改善。,彩票体育投注官网,365bet注册网址,电竞赌注。

 时事2:免费游戏

  12月28日,重庆首艘纯电推进150客位客渡船开工建设,根据普华永道年初公布的《广东专精特新“小巨人”成长手册》,广东“小巨人”主要分布在新一代信息技术、高端装备智造、新材料、节能与新能源汽车等赛道。广东省中小企业发展促进会会长谢泓曾分析,佛山产业总体仍较传统,而“小巨人”集中于新兴产业,因此较少诞生于佛山。,乐鱼体育官方下载,九州体育最新网站,港姐密报A。

  12月28日,新型能源体系加快建设,她谈到,人工智能要创造新质生产力,但绝非易事——若无法实现数倍效率与效果提升,便不能称之为新质生产力。它需要四个核心要素协同:数倍的效率效果提升、配套的生产工具、适配的生产关系,以及员工整体素质的提升。只有这四点同时满足,新质生产力才能真正落地推广。,世界杯应该怎么买球,博狗全站APP,天博平台总代理。

 时事3:必威网站

  12月28日,湖南高校教师远赴塞拉利昂 为当地培养汽修本土化人才,6月13日晚,吉利控股集团发布声明表示,欧委会对中国电动汽车加征关税是错误的决策,加征关税将损害欧洲自身利益,同时也会阻碍中欧经贸的发展。呼吁欧委会慎重考虑其决定,共同寻找促进公平竞争、营造良性发展环境的解决方案。,bet365在哪里玩,球探手机比分网足球,沙巴体育官网投注注册。

  12月28日,宁夏出台绿电直连实施方案 推动新能源就近消纳与企业绿色转型,施正文表示,此次关税法制定一大原则就是提升关税征管便利化水平,因此确定了关税征收管理可以实施货物放行与税额确定相分离的模式。比如,进口货物关税确认需要一段时间,要明确原产地、货物估价等。如果等缴完税再放行,影响通关便利。因此,目前采取了货物放行与税额确定相分离的模式,即根据企业申报纳税情况先发行,后审核纳税,提升通关速度,以促进对外贸易。,瑞博,手机怎么赚钱快,mg娱乐电子游戏检测。

 时事4:mg十大正规网站

  12月28日,两部门发布12月份全国自然灾害风险形势,底特律讯 —— 美国汽车行业的纯电动汽车赛道,正式迈入‘理性时代’。,最有实力赌博app,世界杯现金投注网站,99游戏网。

  12月28日,日本三季度国内生产总值修正后降幅扩大,在打平泰国队之后,积8分的中国队要在最后一轮小组赛客场挑战韩国队,而积5分的泰国队面对的是已经出线无望的新加坡队,后者刚刚在主场以0∶7败在了韩国队脚下。,凯发K8旗舰厅App下载,金牌大风,太阳集团娱乐网址。

责编:李家梁

审核:范春燕

责编:陈元才

相关推荐 换一换