微信世界杯投注竞彩 - 独特的视觉设计与流畅的操作体验,让人爱不释手

首页 >新闻 >社会新闻

人类基准测试大翻车：样本不足、方法不透明，AI性能结论可信吗？

2025-12-23 10:43:50

来源：

猫眼电影

作者：

李靚蕾

手机查看

　　猫眼电影记者罗世平报道首次登录送91元红包

我们经常在一些对比 AI 性能的测试中，看到宣称基础模型在自然语言理解、推理或编程任务等性能超人类的相关报道。

但你有没有想过，这些结果真的可信吗？

在近期的一项研究中，美国哈佛大学研究员魏来（Kevin Wei）与合作者指出，目前人类基准测试（Human Baselines）的严谨性和透明度存在一系列严重问题，这直接关系着相关测试中关于 AI 性能的结论是否“立得住”的问题。

为此，研究人员对基础模型评估中人类基线方法提出了相关的改进建议。与此同时，为全面梳理当前评估方法的短板，他们还系统回顾了 115 项人类基线研究。

相关论文以《立场：模型评估中的人类基线需要严谨性和透明性》（Position: Human Baselines in Model Evaluations Need Rigor and Transparency）为题发表在 ICML 2025（The Forty-Second International Conference on Machine Learning）[1]。

图丨相关论文（来源：ICML）

长期以来，人类基准测试作为 AI 领域评估模型性能的重要工具，直接影响着对 AI 基础模型表现的判断，尤其是为 AI 达到超人类的水平相关结论是否可靠提供关键参考。

魏来目前的主要研究方向是 AI 评估测试，致力于将安全测试的系统做得更安全，以及将相关机制做得更好。他对 DeepTech 表示：“我们在研究过程中发现，当下很多声称模型达到超人类性能的研究，其人类基线评估方法不仅严谨性不够，透明度也不足。这会导致人类和 AI 性能的比较缺乏可信性。”

图丨魏来（来源：魏来）

人类基准测试结果是否可信关系着对系统层级的理解，以及对人类的层级准确比较。相关结论不仅影响着机器学习社区、相关用户和政策制定者，还与 AI 是否能代替、如何替代人类工作等社会和经济问题密切相关。

表丨基线设计与实施项目（含数据填补）的汇总统计（来源：ICML）

研究人员发现，在以往研究中最大的问题是所选取作为基线缺乏代表性，或在进行基线测试时，为基线测试人员和网络系统提供的信息存在差异：要么对二者所提出的问题不同，要么在某些方面存在差异，使得二者之间难以进行有效比较。

让人意外的是，只有 59% 的基线使用与 AI 相同的测试集。举例来说，某个数据中有 1,000 个样本，然后研究人员可能仅从中选 50 个样本作为基线，再将这 50 个人类的层级与 1,000 个 AI 系统的场景做对比。

除此之外，人类基线的样本量普遍不足也是极为重要的问题，这会导致无法据此判断这一结果是否能够代表更广泛人群。其中，以单个测试题目计算，人类基线的回应者人数中位数仅有 8 人，远低于科学研究的可靠性要求。

另一方面，伦理审查报告方面，只有 14% 的论文报告了伦理审查，其中大部分研究并没有公开测试方法、参与者信息和数据分析代码。在统计检验使用方面的问题同样严重，进行统计检验的基线只有 8%。

“我们发现，这种在人类基准测试过程中普遍存在信息不透明的做法，在影响结果可重复性的同时，也很有可能存在潜在的偏差。”魏来表示。

（来源：ICML）

基于对测量理论和 AI 评估文献的分析，该团队提出了一个新的框架来改进相关问题，其涵盖五个阶段并在每个阶段给出了相关建议。

具体而言：

·设计与实施（Design&Implementation）：选择一致且具有代表性的测试集，迭代基线工具，收集足够大小的样本和满足伦理要求；

·招募（Recruitment）：指定感兴趣的人群，选择适当的抽样策略，在招募过程中采用质量控制；

·执行（Execution）：在执行过程中采用质量控制，控制方法效应，控制人类和 AI 的努力程度，收集定性基线数据（例如解释）；

·分析（Analysis）：量化人类和 AI 表现之间的不确定性，确保评估指标、评分标准和评分方法的一致性；

·文档化（Documentation）：报告方法和基线样本的详细信息，采用开放科学和可重复性标准。

根据相关建议，在设计人类基线时，可采用更科学的方法来确保公平性和准确性。例如，研究人员借鉴了包括心理学、经济学、政治学等在内的多学科知识，为 AI 和人类性能的比较提供了新的视角。研究还强调了透明度的重要性，指出基于详细的记录和报告，可促进研究结果更可信。

研究人员将这些建议整合成一份清单，并在此基础上系统性地回顾了 115 项基础模型评估中的人类基线研究。这项研究不仅梳理出当下人类基准测试方法中存在的不足，同时也为未来研究特别是数学领域 AI 技术的评估指出了改进方向。

参考资料：

1.https://openreview.net/forum?id=gwhPvu97Gm

运营/排版：何晨龙

时事1：滚球怎么看下半场有球

12月23日,工信部：前10月我国软件业务收入同比增长13.2%,12月22日，全市场规模最大的四只A500ETF——A500ETF华泰柏瑞（563360）、A500ETF南方（159352）、A500ETF基金（512050）、中证A500ETF（159338）成交额集体突破百亿元，创下罕见的天量成交。12月23日，这4只A500ETF成交额均再次超过100亿元。,捕鱼乐在线玩。

12月23日,哈尔滨冰雪大世界开园融合东方美学和国际风情,12月26日，中央纪委国家监委网站公布了中国医药健康产业股份有限公司（中国医药，SH600056，股价10.47元，市值156.62亿元）原党委书记、董事长高渝文接受纪律审查和监察调查的消息。,九州体育登录,必赢亚洲登陆,二八杠游戏免费。

时事2：博狗快速登陆

12月23日,2025年10月中国企业信用指数基本平稳,证券日报网讯 12月23日，老百姓发布公告称，截至本公告披露日，公司对外担保总额9.8亿元，占公司最近一期经审计净资产的比例为13.69%，公司对外担保余额为4.4亿元（含本次担保），上述对外担保总额全部为公司对合并报表范围内子公司提供的担保，公司不存在对控股股东和实际控制人及其关联人提供担保情况，也不存在逾期对外担保情况。,金沙网游,世界杯厄瓜多尔投注站,e世博快速开户。

12月23日,“新格局·新动能”国是论坛：2025年会精彩集锦,经研究，聘任王炯、顾晓敏为招商局集团有限公司外部董事，罗东江、陈佐夫不再担任招商局集团有限公司外部董事职务。,必赢亚洲网页手机版官网,吉祥体育官网网址,亲朋棋牌抢庄十点半。

时事3：澳门新巴黎人线路blr

12月23日,《习近平谈治国理政》中肯读者会在内罗毕举行,带领国足三场比赛，主客场对阵新加坡、主场对阵泰国，伊万只交出了1胜1平1负的尴尬答卷，技战术角度，三场比赛，伊万留下了太多值得商榷之处，还有最后一场和韩国队的比赛，留给伊万的时间已经不多了……,如何在手机上买足球,库博体育app官网,万人牛牛百灵版。

12月23日,澳大利亚邦迪海滩枪击事件死亡人数升至12人,据路透社9日报道，在哈塔伊省省会安塔基亚市一家医院外，64岁的梅莱克（Melek）对缺乏救援队表示遗憾。“我们从地震中幸存下来，但我们会因为饥饿或寒冷而死在这里。”在另一重灾区马拉蒂亚市，民众萨比哈·阿利纳克（Sabiha Alinak）也表示，自己的亲属已被困在倒塌的建筑下两天，尚未等到救援队伍。,开心播,乐鱼体育平台,bet36网址多少。

时事4：平博这家公司

12月23日,广州造“五羊星座”将覆盖中国南部15省区,英格兰银行的金库主要承担国家官方储备的职能，存放英国自身的官方储备，和其他国家和机构委托保管的官方储备。,2020欧洲杯法国队阵容,188体育2017版本下载,九游会体育。

12月23日,悉尼邦迪海滩枪击事件已致12死29伤,以每周周五时间作为观测点，环比上周五，曲线熊陡变动，1年期AAA存单收益率目前录得1.6425%。,GPK老虎PP电子试玩,永利官网app,2020欧洲杯对阵图。

【全国规模以上工业企业利润累计增速连续四个月保持正增长】

【泰柬防长就停火问题签署协议】

责编：程豪

审核：方力

责编：浦峰