搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

人类基准测试大翻车:样本不足、方法不透明,AI性能结论可信吗?

2025-12-28 14:59:37
来源:

猫眼电影

作者:

邵素雯

手机查看

  猫眼电影记者 康纽 报道首次登录送91元红包

我们经常在一些对比 AI 性能的测试中,看到宣称基础模型在自然语言理解、推理或编程任务等性能超人类的相关报道。

但你有没有想过,这些结果真的可信吗?

在近期的一项研究中,美国哈佛大学研究员魏来(Kevin Wei)与合作者指出,目前人类基准测试(Human Baselines)的严谨性和透明度存在一系列严重问题,这直接关系着相关测试中关于 AI 性能的结论是否“立得住”的问题。

为此,研究人员对基础模型评估中人类基线方法提出了相关的改进建议。与此同时,为全面梳理当前评估方法的短板,他们还系统回顾了 115 项人类基线研究。

相关论文以《立场:模型评估中的人类基线需要严谨性和透明性》(Position: Human Baselines in Model Evaluations Need Rigor and Transparency)为题发表在 ICML 2025(The Forty-Second International Conference on Machine Learning)[1]。

图丨相关论文(来源:ICML)

长期以来,人类基准测试作为 AI 领域评估模型性能的重要工具,直接影响着对 AI 基础模型表现的判断,尤其是为 AI 达到超人类的水平相关结论是否可靠提供关键参考。

魏来目前的主要研究方向是 AI 评估测试,致力于将安全测试的系统做得更安全,以及将相关机制做得更好。他对 DeepTech 表示:“我们在研究过程中发现,当下很多声称模型达到超人类性能的研究,其人类基线评估方法不仅严谨性不够,透明度也不足。这会导致人类和 AI 性能的比较缺乏可信性。”

图丨魏来(来源:魏来)

人类基准测试结果是否可信关系着对系统层级的理解,以及对人类的层级准确比较。相关结论不仅影响着机器学习社区、相关用户和政策制定者,还与 AI 是否能代替、如何替代人类工作等社会和经济问题密切相关。

表丨基线设计与实施项目(含数据填补)的汇总统计(来源:ICML)

研究人员发现,在以往研究中最大的问题是所选取作为基线缺乏代表性,或在进行基线测试时,为基线测试人员和网络系统提供的信息存在差异:要么对二者所提出的问题不同,要么在某些方面存在差异,使得二者之间难以进行有效比较。

让人意外的是,只有 59% 的基线使用与 AI 相同的测试集。举例来说,某个数据中有 1,000 个样本,然后研究人员可能仅从中选 50 个样本作为基线,再将这 50 个人类的层级与 1,000 个 AI 系统的场景做对比。

除此之外,人类基线的样本量普遍不足也是极为重要的问题,这会导致无法据此判断这一结果是否能够代表更广泛人群。其中,以单个测试题目计算,人类基线的回应者人数中位数仅有 8 人,远低于科学研究的可靠性要求。

另一方面,伦理审查报告方面,只有 14% 的论文报告了伦理审查,其中大部分研究并没有公开测试方法、参与者信息和数据分析代码。在统计检验使用方面的问题同样严重,进行统计检验的基线只有 8%。

“我们发现,这种在人类基准测试过程中普遍存在信息不透明的做法,在影响结果可重复性的同时,也很有可能存在潜在的偏差。”魏来表示。

(来源:ICML)

基于对测量理论和 AI 评估文献的分析,该团队提出了一个新的框架来改进相关问题,其涵盖五个阶段并在每个阶段给出了相关建议。

具体而言:

·设计与实施(Design&Implementation):选择一致且具有代表性的测试集,迭代基线工具,收集足够大小的样本和满足伦理要求;

·招募(Recruitment):指定感兴趣的人群,选择适当的抽样策略,在招募过程中采用质量控制;

·执行(Execution):在执行过程中采用质量控制,控制方法效应,控制人类和 AI 的努力程度,收集定性基线数据(例如解释);

·分析(Analysis):量化人类和 AI 表现之间的不确定性,确保评估指标、评分标准和评分方法的一致性;

·文档化(Documentation):报告方法和基线样本的详细信息,采用开放科学和可重复性标准。

根据相关建议,在设计人类基线时,可采用更科学的方法来确保公平性和准确性。例如,研究人员借鉴了包括心理学、经济学、政治学等在内的多学科知识,为 AI 和人类性能的比较提供了新的视角。研究还强调了透明度的重要性,指出基于详细的记录和报告,可促进研究结果更可信。

研究人员将这些建议整合成一份清单,并在此基础上系统性地回顾了 115 项基础模型评估中的人类基线研究。这项研究不仅梳理出当下人类基准测试方法中存在的不足,同时也为未来研究特别是数学领域 AI 技术的评估指出了改进方向。

参考资料:

1.https://openreview.net/forum?id=gwhPvu97Gm

运营/排版:何晨龙

 时事1:九游会登录大厅

  12月28日,训练时一火箭弹偏离目标 日本自卫队道歉,在被抽样选中的三家车企中,上汽集团面临加征的关税税率达38.1%,税率最高;吉利汽车和比亚迪面临加征的税率分别为20%和17.4%。,乐鱼登录网址。

  12月28日,考古新发现将济南建城史提前约1500年,“虽然大部分城市都未明确要求按套内面积计价,但一些开发商签订商品房买卖合同时,倾向于选择套内计价。”冯波进一步提到。,送3金币棋牌平台,世界杯在哪里买球微信,必发888唯一官网。

 时事2:电子游戏网址进

  12月28日,“五分钟社会救援圈”如何重塑生命守护网?,次月,福建省招商引资工作领导小组第一次会议在福州召开,福建省委常委、常务副省长郭宁宁出席会议并讲话。会议要求,要突出优质服务招商,加大优化营商环境力度,构建亲清政商关系,让项目引得进、留得住、发展好。,最新送彩金大全,伟德网址登录,伟德体育最新版APP。

  12月28日,坚守海岛15年女班长邹嫦艳:我的战位是方寸之间的“指尖江湖”,“J物体”是美国军方给2022年8月4日在在酒泉卫星发射中心和可重复使用试验航天器一起发射入柜的航天器起的代号。美国-加拿大北美航空航天防御司令部(NORAD)在该物体出现后也为其分配了识别号码54218,有关该物体的信息可以在美国政府运营的网站Space-Track.org上的公共数据库中查询。,新爱体育app下载安装,升博快速登陆,贝搏体育官网入口。

 时事3:欧博官网abg

  12月28日,2025中国公路自行车职业联赛大理站开赛,前一交易日(12月22日),多只A500ETF“吸金”;本月以来,中证A500ETF(159338)、A500ETF南方(159352)、A500ETF基金(512050)、A500ETF华泰柏瑞(563360)资金净流入额均超过100亿元。,MG官方游戏中心,电子游戏十万大奖视频,bb平台安装。

  12月28日,中外学者在上海共话世界多极化与中国式现代化,纪宁说:“欧美国家的网球市场已逐渐进入饱和阶段,中国被认为可能带来新的爆发性增长点。”他认为,在中国这个网球新兴市场,应更充分地挖掘体育明星的商业价值。“这有利于全面释放中国体育经济的增长潜力。”,线上信誉平台网,澳博入口,伟德体育app怎么下。

 时事4:澳门正规赌盘

  12月28日,残特奥会越野滑轮第二日决出七枚金牌,从承保端来看,该公司保险业务收入持续扩张,且于2021年大幅增长67.41%达104.23亿元,站上百亿保费平台。今年三季度,保险业务收入为93.41亿元,若要保持持续增长,还需更进一步。,kok手机登录,网游试玩,365娱乐平台注册。

  12月28日,触摸千年文脉,感受创新脉搏——2025“中国有约”国际媒体采访活动圆满收官,在核心项目与潜力项目路演环节,四个聚焦重大未满足临床需求的创新项目依次亮相。包括了眼科、肿瘤、代谢性疾病等行业热门治疗领域和技术路线。现场,来自泰格医药、和泽医药的临床与药学专家及多家基金代表,从临床价值、差异化竞争格局、关键数据里程碑与可行性评估等多维度进行提问与点评,为项目团队提供了具有可操作性的优化建议。,半岛官网最新下载,有彩金送的电子游戏,奔驰宝马娱乐。

责编:马旭

审核:罗伯特·唐

责编:埃斯马埃利贝吉

相关推荐 换一换