Notes · 2026.02.14
改写之后还能不能检出
人类化改写。
对齐后中文 AI 文本和人写的表层差异减弱。再经过人类化改写,很多检测器就散。GA-AT、改写条件,是评测协议的一部分。散的位置要写进 limitation,不要藏。藏起来的散,会在产品里以误判和漏检出现。出现时再解释「我们测过同分布」,听起来像没测过日子。日子是改写之后还能否检出。检出不了要写散在哪。散在哪比「抗改写」三个字有用。三个字是满词。满词我从产品文案草稿里删过。
表层差异在减弱
早期检测可以靠很浅的习惯。对齐之后,浅的习惯被洗掉一层。洗掉一层不是坏事,是生成器在变。检测如果还靠那一层,数字会从作业滑向偶然。偶然在演示里能撑。撑到改写,就散。
人类化改写比换生成器更像有人故意在藏。藏的方式包括改句式、改连接、改标点、插入人常写的停顿。具体改写算子以协议为准。这里不编新算子名字。名字只写 GA-AT 和稿子里已有的条件。
我参与这部分评测整理,写参与。不写我们提出了不可破的改写。不可破这种词,检测里不该出现。出现了就是超证据。
协议不是为了把数字做高
改写条件会把表做难看。难看是协议的功能。功能是知道它在哪散。如果协议被调到模型刚好能过,协议就死了。死掉的协议还能产出论文句子。句子和风险无关。
MRS、MCC Decay 用来看改写和迁移下的衰减。准确率语言不要套过来。套过来会变成「改写后仍准确」。仍准确可能只是多数类。多数类救不了漏检。漏检才是有人把机器稿改成人腔之后想躲的东西。
划分在改写设定里更容易漏:原文和改写稿是否成组隔离,会决定数字是真散还是假稳。假稳来自两侧都见过同一底本。底本泄漏,改写评测就变成开卷。开卷很好看。开卷不是日子。
散的位置要写进 limitation
哪类改写后还留信号,哪类没有,是有用的句子。有用的句子往往不好看。不好看才像做过。我写对外材料时,手会想把「在某条件下仍可用」提前,把「在某条件下散」放脚注。放脚注等于藏。藏了对评审短期有利,对后面的自己有害。后面的自己会以为那块已经过了。
TextGuard-Bench 把这些条件放进评测。条件的版本要记。版本变了,旧的「还能不能」作废。作废的结论留在站点上,就是超证据。
OOD 和改写经常叠。叠了更散。叠了要标明叠了。标明之后表难读。难读比混成一个「鲁棒性」总分诚实。总分会把散的位置抹平。抹平了就无法改方法。方法改不动时,人会去改文案。文案改到最后就是全面解决。全面解决是禁句。
产品上的对应
检测平台的接口会遇到改写过的文本。评委换一组样本,可能就是改写稿。接口超时和空结果仍要当功能。功能之外,模型给出的分数要能和协议里的条件对上。对不上,就不要在界面上写「人类化改写免疫」。免疫两个字比准确率更满。
限制
这篇不给改写后的分数。不编哪一种改写一定失败或一定成功。GA-AT 是协议里的名字。我参与。结论以能指回 seed 和划分的表为准。表出门之前,limitation 里先有散的位置。没有散的位置,我当这张表还没写完。
产品文案上我见过「抗改写」三个字的草稿。草稿删了。抗是满词。满词会在评委换一组人类化样本时,把接口的诚实返回显得像失败。返回其实是检测器在散。散了要显示不确定或低把握,不要显示免疫被打破的震惊。震惊是戏剧。戏剧和 Under Review 抢跑一样,都在用情绪补证据。证据在协议和日志目录里。目录没有,三个字不能上线。
散的位置要写出来
改写之后检测器散在哪一类样本,要进 limitation,不要只留还站得住的曲线。GA-AT 和改写条件是协议的一部分,不是把数字做高的开关。我参与这些评测。结论说到证据停。停的地方不要改写成「即将解决」。