Notes · 2026.03.07

评测集自己造的坑

自己造,自己漏。

1 min · paper

评测集是自己造的,坑也是自己的:泄漏、重叠、标签不稳。ChProv-Bench 强调论文级隔离、划分无泄漏、门禁记录。数字要指回协议和发布版本。42.3 万条、4.05 万论文组、25 个模型族,这些数在简历上。站点上不把它们说成官方榜。自己造的集,没有「官方」四个字可用。规模数在简历上是范围。范围越大,泄漏和重叠的机会越大。机会大了更要靠能红的门禁,不能靠气势。气势会把 42.3 万说成权威。权威这个集配不上。

自己造,就会自己漏

别人的榜有别人的错。自己的集,错是我参与进去的那部分流程。流程里最常见的漏是:同一论文组的文本进了两侧,同一底本的改写没隔离,标签事后改了但旧文件还在。旧文件还在,run 会混。混了的数很好看。好看的数最难删。

门禁记录是为了让漏能被抓住。抓住的意思是检查会红。永远绿的检查,等于没查。我希望故意制造一组泄漏样本时,门禁失败。失败才是功能。功能没写之前,口头发誓无泄漏,和 Under Review 写成中了同类。

论文级隔离听起来硬。硬的是定义:什么叫同一篇、什么叫一组、跨组能不能共享句子。定义写在协议。协议版本要进日志目录。版本没进目录,规模数再大也指不回。

规模数不是官方榜

简历上可以写规模,那是工作量与数据范围。站点若写成「官方评测」「标准榜」,读者会以为社区已经认。社区认不认,不由我宣布。ChProv-Bench v5 是版本名。版本名可以写。官方榜不能写。

AAAI 2027 那篇状态是 Under Review。评测集的句子更要收。收成:我参与,强调隔离和门禁,数字以简历和稿子为准。稿子没让站点摘的细表,站点不摘。摘了就是抢跑。

重叠比泄漏更懒。泄漏像错误。重叠像没清洗。没清洗的重复会让模型记样例。记样例之后 OOD 会假好。假好会把日子写成作业。作业写成日子,后面的方法全跟着偏。

标签不稳

机器稿、人稿、改写稿,标签看起来是三类。三类边界在改写强度大的时候会糊。糊了还用硬标签报很高的分,分是对糊标签的拟合。拟合糊标签,产品上会骂人。骂人的那次,评测集的锅比模型大。

标签规范、抽检、不一致记录,评测流水线绿不等于这些有了。流水线绿只说明脚本跑完。跑完可以产出脏集。脏集进训练,是有效 run 的反面。有效 run 要求 split、seed、checkpoint、日志。脏标签会让这四样都指向一份不该出门的数。

我参与整理时,错误案例要和复现步骤一起存。只存错误文本,不存当时的协议版本,案例会变成故事。故事不能修门禁。

发布版本

集一改,旧结论作废。作废要显式。显式的方法是版本号。v5 就是这种钉子。钉子钉了,仍有人会把 v 前的数和 v5 的数画在一张图上。画的时候要写不能比。不能比还画,是装饰。装饰进论文是缺陷。

站点上的规模数跟着简历。简历改数,站点改数。站点先改,就是另一份超过证据。故事页也不要为了气势把 42.3 万写成「近五十万」。近五十万更好看。更好看就是超。

限制

这篇不公布新的泄漏率,不宣称集已经干净。干净是检查的结果,检查会过期。过期后再说干净,要重跑门禁。门禁没重跑,只写纪律:自己造的坑自己认;数字指回协议和版本;不是官方榜;我参与,不写一作已接收。

规模数写在简历上,是范围,不是免罪。范围越大,泄漏和重叠的机会越大。机会大了,更要靠门禁,不能靠气势。气势会把 42.3 万说成权威。权威两个字和官方榜一样,这个集配不上。配得上的是:版本号、协议、能红的检查、错误案例带复现步骤。四样缺一,数字只留在内部。内部可以很难看。难看的内部,比漂亮的对外榜对得起自己造的那些坑。

数字要指回版本

42.3 万条、4.05 万论文组、25 个模型族,写在简历上,站点上不把它们说成官方榜。要说,就连协议名和发布版本一起说。版本对不上的数,删。自己造的集,坑也是自己的:泄漏、重叠、标签不稳。门禁记录是为了以后的自己还能审计,不是为了装饰附录。