猫眼电影
猫眼电影记者 张炳贤 报道首次登录送91元红包
大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。
然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。
来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。
论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG
该论文的最大亮点在于其前所未有的广度:
它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。
通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。
表 1:基于输入 - 输出模态组合的 MM-RAG 分类法
在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。
表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用
四大关键阶段剖析 MM-RAG 工作流
基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):
图 1 MM-RAG 的工作流
a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。
b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。
c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。
d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。
论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。
一站式指南:
训练、评估与应用前瞻
除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:
训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。
作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。
时事1:澳门js网站
12月27日,青藏高原第一块茶田:雪山脚下,茶园飘香,此外,除了马昌明,今年还有一位从高管名单中撤下——执行董事、党委副书记、工会主席、董事会秘书李东明,其自2017年11月起便担任该公司执行董事,2024年10月兼任董事会秘书。其于今年二季度将董事会秘书职务交给郑鹏后,继续担任该公司执行董事、党委副书记。,pokertime扑克时间官网入口。
12月27日,中国在大分子蛋白精准测量领域取得重要技术突破,常年打球的张先生告诉《环球时报》记者:“在郑钦文夺冠前的这几年,网球运动在大众层面一直是向上走的态势,加入网球运动行列中的人不断增多。”张先生分析,这也许跟网球是隔网运动有关,因此在疫情期间受到欢迎。,欧洲真人网上娱,现金网上平台,赢现金游戏官网。
时事2:凯时k66会员登录
12月27日,2025中国田径协会10公里精英赛重庆站鸣枪起跑,该公司成立第五年便实现盈利,不过盈利数额较小,且持续时间不长。2013年至2015年间共计盈利0.48亿元,2016年再度出现亏损2.31亿元,次年净亏损进一步放大。成立至2017年累计亏损达到了12.94亿元。,bbin官方下载,美高梅娱乐,白小姐特新刊B。
12月27日,外媒:关税政策引发经济不确定性 美国劳动力市场状况恶化,4月22日,中国金融四十人论坛(CF40)以“如何平衡债务增长与债务风险”为主题召开了CF40宏观政策季度报告(2024年一季度)发布会,就上述问题发表了研究成果和研究建议。,王者体育app官网,澳门萄京,乐鱼彩票官网。
时事3:濠江会app最新版下载
12月27日,央行:持续打击虚拟货币相关非法金融活动,俄罗斯高等经济学院教授安德烈·卡赞采夫说,首届中国-中亚峰会将在西安举行,表明中国在中亚的影响力越来越大,但这与俄罗斯在该地区的政策并不矛盾,因此不会看到两国为争夺中亚而展开激烈角逐。俄中在中亚的根本利益是一致的。中亚各国与中国的合作不是为了激怒俄罗斯,而是为了改善自身的政治和经济地位。,大阳城集团娱乐网站app666,皇冠国际网站是多少,半岛App综合体育下载。
12月27日,疲劳勿驾驶!多地发生疲劳驾驶引发的事故,坚持出作品与出人才相结合,拓展思维,增强合力,努力为人才施展才华搭建平台,提供舞台;,在哪里赌篮球,纬来体育官网nba,真人金花群。
时事4:牛宝体育官方入口
12月27日,国家发改委主任发文,在这方面中国远超日本丨园来如此,从工业增加值增速来看,温州、徐州、大连、唐山分别为10.7%、6.9%、7.2%、9.5%,工业经济增长动能均十分强劲。,世界杯买球app进as83点me,天博体育登录不上去,e世博体育下载。
12月27日,日本政府欲打造日版中情局 民众继续承压高市之“祸”,[环球时报报道 记者 倪浩]8月3日,郑钦文夺得2024巴黎奥运会网球女单冠军,实现中国选手在该项目上的历史性突破,也点燃了民众参与网球运动的热情,网球热度随之大涨。接受《环球时报》记者采访的专家认为,体育明星与体育经济会形成正向反馈:体育明星的示范效应会提振相关体育产业、吸引更多人参与到运动中来,大众的广泛参与则会成为“未来明星运动员”诞生的基石。,云顶娱乐,水浒游戏现金般,皇冠手机体育网下载。
责编:贾国荣
审核:陈媛媛
责编:王曙亮












