猫眼电影
猫眼电影记者 张棻 报道首次登录送91元红包
大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。
然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。
来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。
论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG
该论文的最大亮点在于其前所未有的广度:
它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。
通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。
表 1:基于输入 - 输出模态组合的 MM-RAG 分类法
在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。
表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用
四大关键阶段剖析 MM-RAG 工作流
基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):
图 1 MM-RAG 的工作流
a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。
b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。
c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。
d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。
论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。
一站式指南:
训练、评估与应用前瞻
除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:
训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。
作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。
时事1:体育平台链接怎么打开
12月22日,上海最大数智草莓植物工厂落成 实现365天“草莓自由”,随着越来越多村民发现自己被注册了营业执照,刘院村村民们开始质疑这件事情背后的内幕。,万事博注册。
12月22日,4000万标准箱!宁波舟山港年集装箱吞吐量新突破,今年1月1日,佛山市委办公室、佛山市政府办公室联合发布的“1号文件”透露,佛山将加快建设十大创新引领型特色制造业园区、十大现代服务业产业集聚区,重点培育发展机器人、新能源汽车等战略性新兴产业,推进家电、铝型材等优势传统产业链向价值链高端跃升。,亚美体育登录,澳门萄京,pp体育下载安装。
时事2:365bet体育官网vip入口
12月22日,“对不起,人工座席目前全忙……”转人工客服,为何这么难?,西部证券发布研报称,据液冷产业链最前沿数据,2026年谷歌TPUv7及以上等级芯片预计出货约220万颗—230万颗,测算2026年谷歌机柜液冷市场规模为24亿美元—29亿美元。展望2026年,国产芯片出货有望保持高增,叠加AI超节点整机出货形式采用率的快速提升,将给国内液冷市场带来高增机遇。,英皇娱乐在哪注册,博发,皇冠体育篮球即时比分。
12月22日,26国嘉宾将出席2025腾冲科学家论坛,她指出,特斯拉车型从始至终都是‘以软件为核心的科技消费品’,只是恰巧采用了纯电驱动形式。特斯拉搭建了专属的充电网络,也培养出一批懂科技、高粘性的忠实用户 ——,猪哥报,AG官方平台,hg8868官网。
时事3:亚新体育网址是多少
12月22日,【践行新发展理念 中国经济行稳致远】创新引领 新质生产力蓬勃生长,通过天眼查查询,汪绪金、张青莲、汪文燕的营业执照,分别登记于2011年8月、2012年6月1日。,威尼斯真人有反水吗,心博天下在哪开户,手机彩票app下载。
12月22日,大国小巷·首善之治,2025年12月12日,公司收到了中国证监会湖北监管局的《行政处罚事先告知书》。本次处罚内容直接指向了公司的财务报告和资金管理问题。湖北证监局拟对人福医药给予警告,并处以850万元的罚款。针对原控股股东当代集团,监管部门的处罚更为严厉。当代集团被处以900万元罚款,时任董事长艾路明被处以390万元罚款,并被采取七年市场禁入措施。,真人华纳国际,aoa体育苹果版,千赢国际手机版注册。
时事4:网投正规平台
12月22日,香港政务服务平台“智方便”登记用户突破400万,其他七大类价格同比均上涨。其中,其他用品及服务、教育文化娱乐价格分别上涨3.8%和1.8%,衣着、医疗保健价格均上涨1.6%,生活用品及服务、居住、交通通信价格分别上涨1.4%、0.2%和0.1%。,12bet备用网址,e世博竞彩官网,博鱼体育app。
12月22日,百只企鹅同台亮相 哈尔滨极地公园开启“企鹅派对”,昊海生科表示,该处罚决定书所涉主体为蒋伟个人,涉及的事项与公司无关,不会对公司日常经营、业务及财务造成重大影响。,百家乐预测,世界杯体育投注怎么买,扎金花平台娱乐。
责编:朱永国
审核:贾茹马
责编:海恩斯












