Notes · 2025.06.28

误伤怎么办

检测落地第一问。

1 min · textguard

把一段写得很工整的人话贴进去,系统给了高风险。那一段是我自己写的。中文 AI 生成文本检测听起来新,落地第一问是误伤。漏检会让人觉得模型不够利。误伤会让拿到报告的人开始不信任你。我是张恒基。报告要给人看的时候,假阳性比漏检更烦人。这句话我在京彩的场里说过。

人写的被判成机器之后

检测分数如果只是一个数,使用者没有反驳的抓手。反驳需要解释和样本对照:哪些特征把分数顶上去,像在哪一类机器文本上。没有这些,老师只能选择信或不信。信,误伤会变成处分。不信,系统就等于没上。两头都比「再调一调阈值」严重。

我把解释页当成误伤的出口,不当成可视化作业。出口的意思是:被误伤的人能指着某一条说,这条在人写的书面语里也会出现。能指,才谈得上人工复核。不能指,复核只是再看一遍分数。再看一遍分数,不会改变任何东西。

中文书面语本身就密。成语、连接、整齐的段落,在学生作业里合法,在生成文本里也常见。模型和规则如果只认「整齐」,误伤会集中在写得认真的人身上。认真的人被误伤,系统的名声坏得最快。名声一坏,可持续那一页在京彩就很难讲。

报告是给人签字的

误伤落到纸上,就变成一份可能被存档的文件。谁签字、谁存档、谁拿去对一篇作业,决定报告里必须出现不确定度,而不是只出现罪名。我要求导出里能看见:分数、主要特征、对照样本、一句「需要人工复核」的位置。位置要固定。固定了,使用者才找得到。找不到,等于没有。

和查重不是一回事。查重看像不像已有文献。我们看像不像机器写的。查重误伤是「像某篇」。我们误伤是「像机器」。两套后果都伤人,口径不能混。混了,教务会按查重的习惯来理解我们的报告。按那个习惯,高分几乎等于指控。指控不能从 TextGuard 的 PDF 里直接长出来。

我是项目总负责人。误伤口径最终要我认。认的方式是:演示里主动贴一段人写的、可能被顶高的文本,把复核路径走一遍。藏起误伤、只贴生成样本,评委当时会觉得准,事后会在追问里把你拆开。拆开过一次之后,我不再藏。

漏检和误伤的权重

漏检当然也要管。生成文本大段进作业、进申报书,检测如果全绿,系统就没价值。价值在两端之间。两端的权重不能只按论文里的 F1 来。F1 把两类错误对称看待。落地不对称。误伤会触发对人的处理。漏检会触发对系统的失望。处理比失望难收。难收的那边,产品要先让步。

让步的样子是:阈值可调、复核必经、解释必给。可调不是把责任推给老师。是承认单一阈值服务不了所有场景。作业、申报、公开网页,承受误伤的能力不同。不同场景用同一道红线,红线一定会伤到不该伤的人。伤到了,再解释模型原理,已经晚了。

预期里的论文会写指标。指标要划分、seed、评测集。评测集如果几乎没有「写得工整的人话」,假阳性会被低估。低估的数不能写进 textguard.site 的第一屏。第一屏只说我们做什么,不说我们从不误伤。从不误伤这种句子,现场贴我自己的段落就能打破。

我后来专门留了一小袋「写得认真的人话」当对照:课程报告、申请书、整理过的会议纪要。袋里的文本进系统,分数一高,就去看解释页指没指到书面语密度这类特征。指到了,才能跟使用者说:这一条在人写里也会出现,请复核。指不到,阈值再漂亮也是黑盒。黑盒在签字场景里站不住。站不住的系统,京彩问可持续时会被追到这一问。这一问我宁愿自己先追。

解释不是装饰

我收到的限制来自那次自己贴自己:系统会误伤,而且误伤会落在写得像样的中文上。解释和样本对照必须先于任何「再准一点」的承诺。准一点可以继续做。做的时候不能把复核入口拆掉。复核入口拆掉,分数就变成判决。判决不是检测系统该下的。

判决两个字一旦从报告里长出来,老师和学生面对的就不再是工具,是指控。指控会逼人二选一:全信或全不信。全信会伤人。全不信会让 TextGuard 白做。白做比指标低更失败。指标低还能改划分、改特征。伤了人,解释页来不及。来不及的事,要靠事先把误伤当第一问,而不是当附录。附录位置,我从演示里拿掉了。