猫眼电影
猫眼电影记者 贝勒塔吉 报道首次登录送91元红包
大模型最广泛的应用如 ChatGPT、Deepseek、千问、豆包、Gemini 等通常会连接互联网进行检索增强生成(RAG)来产生用户问题的答案。随着多模态大模型(MLLMs)的崛起,大模型的主流技术之一 RAG 迅速向多模态发展,形成多模态检索增强生成(MM-RAG)这个新兴领域。ChatGPT、千问、豆包、Gemini 都开始允许用户提供文字、图片等多种模态的输入。
然而,目前对于 MM-RAG 的应用和研究都还处于非常初级的阶段,现有的 MM-RAG 研究以及综述论文主要聚焦于文本和图像等少数模态组合;音频、视频、代码、表格、知识图谱、3D 对象等多种模态的组合均可用于检索增强生成,却仅有很少的探索和研究。这使得研究者和开发者难以全面把握 MM-RAG 的技术脉络和广阔的应用空间。
来自华中科技大学、复旦大学、中国电信、美国伊利诺伊大学芝加哥分校的研究者们共同发布了一篇全面覆盖几乎所有模态作为输入和输出组合的MM-RAG综述来全面且系统化地阐述这个广阔的研究和应用空间。
论文标题:A Comprehensive Survey on Multimodal RAG: All Combinations of Modalities as Input and OutputTechRxiv: https://doi.org/10.36227/techrxiv.176341513.38473003/v2GitHub 项目主页: https://github.com/INTREBID/Awesome-MM-RAG
该论文的最大亮点在于其前所未有的广度:
它首次覆盖了几乎所有可能使用的模态组合作为输入和输出,包括文本、图像、音频、视频、代码、表格、知识图谱、3D 对象等。
通过这种全面的梳理,作者们首先揭示了 MM-RAG 领域中庞大的潜在输入 - 输出模态组合空间,并指出了其中尚未被充分探索的空白(如表 1 所示)。在作者提出的 54 种潜在组合中,目前只有 18 种组合存在已有研究(表 1 中绿色对勾的格子),许多极具应用价值的组合 —— 例如 “文本 + 视频作为输入,生成视频作为输出”—— 仍是一片亟待开拓的蓝海。
表 1:基于输入 - 输出模态组合的 MM-RAG 分类法
在此基础上,作者们构建了一个基于输入 - 输出模态组合的全新 MM-RAG 分类法,不仅系统性地组织了现有研究,还清晰展示了不同 MM-RAG 系统的核心技术组件(如表 2 所示),为后续研究提供了统一框架和方法参考。
表 2不同输入输出模态下多模态 RAG 的核心技术组件、任务和应用
四大关键阶段剖析 MM-RAG 工作流
基于这个新的分类法,该综述深入分析了MM-RAG系统的工作流程,并将其划分为四个关键阶段(如图 1 所示):
图 1 MM-RAG 的工作流
a)预检索 (Pre-retrieval): 数据组织和查询的准备工作。
b)检索 (Retrieval): 高效准确地从海量多模态知识库中找到相关信息。
c)增强 (Augmentation): 将检索到的多模态信息有效地融入到大模型中。
d)生成 (Generation): 根据输入和增强信息生成高质量的多模态输出。
论文详细总结了每个阶段的常用方法,并讨论了对于不同模态针对性的优化策略,为构建高性能的MM-RAG系统提供了实用的技术指导。
一站式指南:
训练、评估与应用前瞻
除了技术流程,该综述还提供了构建 MM-RAG 系统的一站式指南:
训练策略: 讨论了 MM-RAG 系统的训练方法,以最大化其检索和生成能力。评估方法: 总结了现有的MM-RAG 评估指标和 Benchmark,帮助研究者评估系统性能。应用与未来: 探讨了 MM-RAG 在多个领域的潜在应用,并指出了未来的重要研究方向。
作为首个覆盖所有常见输入 - 输出模态组合、并系统化解析了 MM-RAG 的工作流、组件、训练、评估等核心技术的综述,该论文不仅为研究者提供了索引式的知识入口,也为产业应用提供了全面的技术参考。论文作者还提供了持续更新的资源库,方便读者追踪最新进展。
时事1:AG真人作假
12月26日,国防部:日方避实就虚、偷梁换柱、倒打一耙不可能得逞,运用AI能力快速解析业务场景,精准定位需求,并提供可操作建议。,银河线上娱乐游戏。
12月26日,新疆发改委党组书记、副主任文华谈2026年经济工作:构建特色优势现代化产业体系,2025年10月31日,国家金融监督管理总局北京监管局的一纸罚单,为北京人寿看似稳健的经营蒙上了一层阴影。行政处罚信息公开表显示,北京人寿因“个别投资资产风险分类不准确、内控管理不到位”被给予警告并罚款26万元,时任资产管理中心总经理、职工监事晋小江被警告并罚款5万元。,有没有能上下分的捕鱼游戏,湘西内幕传真B,足球外围规则。
时事2:星际平台
12月26日,缓解亲子矛盾 家长如何化身“战略合伙人”,据路透社报道,美国国务院当地时间9日表示,美国当天在南太平洋岛国汤加正式开设新的大使馆。路透社老调重弹称,这是美国努力加强在太平洋地区的外交存在以“对抗”中国的一部分。对于相关问题,中国外交部发言人毛宁4月3日曾表示,中方对各国同太平洋岛国发展关系不持异议,同时中方也认为,各国同岛国合作的出发点应当是助力岛国的发展,不应该针对第三方。中国无意同任何人在太平洋岛国地区比拼影响力,也不想搞地缘争夺。,365bet娱乐在线娱乐,美高梅棋牌网址,天游登录。
12月26日,博物馆进入“沉浸时代”,感官残障观众如何“入场”,[环球网报道]据台湾《联合报》报道,岛内不仅鸡蛋价格上涨,台“农委会”畜产行情资讯网显示,生猪交易价格每公斤已破90元(新台币,下同,约合20.15元人民币),也创历史新高。随着夏天供应吃紧,日后交易价恐破百元新台币。有养猪业者称,饲料价格暴涨一倍长达一年多,猪农都快撑不住,现在涨价只是反映成本,若民进党当局再打压价格,到时候猪农都不养猪了,大家不仅没鸡蛋吃,也会没猪肉吃。,365bet手机官网,皇冠体育最新版下载,新濠天地登录。
时事3:ca88登录网址
12月26日,克重缩水,量贩零食店“算盘”打向何方?,李瀚明进一步分析,西安接近中国的几何中心,这样的地理位置飞国内任何地方都很便利。加上西安产业发达,又是旅游胜地,这些因素让西安国内客流常年处于高位,间接影响了打造国际枢纽的必要性。此外,也是因为接近国内几何中心,西安无论哪个方向的洲际航线,都得使用宽体机。二线枢纽用宽体机飞国际线,往往存在客流不足、上座率不高的情况。,电玩城,金龙游戏娱乐,金鼎国际。
12月26日,黄河兰州段兴起“天鹅经济”,瑞银全球财富管理在本月发布的一份报告中,将中国科技板块评为 “最具吸引力” 标的。报告指出,投资者寻求地域多元化配置,加之中国 “强劲的政策支持、技术自主战略推进以及人工智能商业化进程提速”,共同推动了该板块的投资价值。,电子游戏注册登录,新美高梅线上娱乐,im电竞注册。
时事4:美高梅在线登陆
12月26日,雪天走路“打出溜”?建议你多学企鹅走路,英国资产管理公司南北资本合伙人兼投资组合经理卡米尔・迪米奇表示:“目前已上市的芯片企业,其估值均缺乏基本面支撑,几乎完全由市场热度驱动。”,bet36手机app,沙巴体育客户端app,云顶娱乐体育官网app。
12月26日,贵州惠水:“中国芭比”唐娃娃订单赶制忙,在2022年7月21日举行的“‘中国有约·你好福建’2022年国际媒体主题采访活动”总结会上,福建省委常委、常务副省长郭宁宁再次发出邀请:真诚邀请各国媒体朋友留下来,更多地感受福山福水、福来福往的热情与魅力,多为福建“代言”,讲好福建故事,让世界通过福建窗口更好地了解中国、读懂中国。,皇冠多少钱,买球都用什么平台,彩6官网手机网站。
责编:申阳
审核:马里奥·科鲁纳
责编:童生












