Notes · 2025.08.23

一稿多投怎么表示

引用网络那条线。

1 min · mingcha

两段摘要像,不一定是一稿多投。投稿记录、版本、引用是不是同一谱系上的重复,才把「像」从文字相似里抬出来。明察万象要处理的形态里,这一条最不像图像检索。图还能摆在旁边看。谱系要画成能反对的结构。我是张恒基。没有证据的风险分数,老师不敢用。

像不像字,和是不是同一谱系

文本相似能抓住一批改写。改写在一稿多投里常见,在正当的预印本更新里也常见。正当更新如果被画成红,作者有理由怒。怒完如果系统拿不出投稿时间、版本号、共用引用、共用图表来源,对话只剩「模型认为重复」。模型认为,在诚信场景里不够。

我联调引用网络那条线时,先问页面上的节点是不是来自同一份可核对的数据。节点从哪张表来、边表示什么、时间戳是投稿还是抓取,三件事写不清,图就会变成装饰。装饰性的网络图很好看,评委和老师都会先被吸走,再在第二分钟问边的含义。含义答不上,好看变成把柄。

可视化不是为了好看。是为了让人能反对这个分数。反对的方式是:指出这两篇只是同一课题的会议版和期刊版、指出引用重叠来自综述、指出时间线对不上「同时投」。系统要把这些反对所需的字段摊开。摊不开,分数就变成无法反驳的指控。指控不该从监测系统里直接长出来。

风险和证据必须绑在一起

平台要能把风险和证据放在一起。分开放,老师会只看见风险。只看见风险的界面,用起来像名单。名单在科研诚信里太重。重的东西要配得上证据密度。密度不够,宁可只展示「需复核的候选」,不展示等级。等级很诱人。诱人的等级会在数据差的那天误伤一整串正当投稿。

LLM 可以帮忙把谱系说成一段话。一段话如果写在证据前面,人会先读结论再扫图。扫图会扫得更懒。我把生成说明放在后面,并标明依据的是哪些节点和边。依据列不出来,说明就不展示。不展示比写得流畅安全。流畅的假说明,比空着更难揭。

和图像复用那条线相比,一稿多投更依赖元数据质量。元数据缺投稿时间、缺版本、缺会议名,谱系会断。断了要显示断,不要补一条假边让图连通。连通很好看。假连通会把两篇无关的论文绑上。绑上之后,解释成本高于检索本身。实习里我碰到的脏数据,多数以「先把图画全」的方式骗人。全,往往是假的。

老师不敢用的分数不要出厂

不敢用有两种。一种是完全不信。一种是信了又怕用错。怕用错的老师,其实是系统该争取的人。争取的办法是让他能反对。能反对的界面,才会进入工作流。进入工作流之后,空结果、超时、权限仍要诚实。诚实在智链、TextGuard、明察里形状不同,原则相同:不要用假成功把人往前推。

我参与的是构建和联调。谱系算法怎么定、阈值怎么定,不写成我的方法。方法如果进论文,论文状态另算。实习周报只写:某类案例上证据字段是否齐全、页面是否允许反对、反对所需的时间线和引用是否可见。可见性是我能验收的。验收不了的「发现了多少一稿多投」,不写。写了就是编。

官网 verischolar.cn 上如果展示这类能力,文案要配得上当前证据链。配不上,就不要用「一稿多投识别」这种完成态。完成态会把老师的期望顶到判决。判决需要的字段,很多库里还没有。没有的时候,监测停在候选。候选两个字不好看,比较能用。

分数旁边必须能反对

我收到的限制来自老师不敢用这一句:一稿多投不能靠两段字像不像来结案。引用网络、版本、时间,要和风险绑在同一屏,并且留出反对的位置。位置如果被漂亮的图占满,分数就失去使用者。失去使用者的能力,等于没做。没做的能力,实习生不该在介绍里用完成态去讲。