Notes · 2026.02.21
成语密度
语言画像路径。
LPP:成语密度、结构助词、标点节奏这类特征,用来引导语义表征交互。写进笔记不是因为中文很美。对齐之后,表层差异减弱,还剩一些统计上能抓住的习惯。抓得住的,可以说引导。抓不住的,别写成抓住了。我参与 LPP 特征。特征名单以论文和代码为准,这里不编新特征。我想加的口头禅、数字写法,都还只是想。想加不等于已加。已加以代码为准。站点上把想写成已有,和软著还没进简历就吹,是同一类抢跑。抢跑的名字在审稿人那里对不上仓库。
为什么会盯上成语密度
中文里成语会出现,人写和机器写的频率、位置、是否用对,可能不同。可能两个字很重要。可能不等于已经不同。不同要在划分不漏的前提下,看同分布之外还在不在。只在作业集上看成语密度有差异,差异可能是话题。话题不是检测。
我没有在这篇里报一个密度阈值。阈值一报,读者会当成品。成品需要表、seed、协议。表未出门,只写我参与的路径:语言画像特征进交互,不当成单独分类器。单独当分类器,准不准都容易过时。过时之后还把「成语密度」四个字当贡献,贡献就漂了。
结构助词和标点节奏是同一篮子里的别的钩子。篮子叫 LPP。篮子可以提。钩子的计算公式以稿子为准。笔记里复述公式,容易复述错。复述错比不写更糟。
我参与时做过一件很土的事:在一小段文本上手工数成语,再和脚本对。对不上,先查定义,不先改模型。定义若把四字格全算进去,密度会被成语以外的词抬起来。抬起来的差异像特征,底子是计数口径。口径要进代码注释和协议,不要只进我的记忆。记忆会在改写实验那周把口径换掉,还以为自己在做对照。
对齐之后还剩什么
生成器对齐之后,很多浅特征被洗。洗完仍可能剩习惯:爱用哪些连接、标点是否密、成语是堆还是不用。剩,是假设。假设要被改写条件打。GA-AT 一类人类化改写,会专门动这些习惯。动完密度还在,才谈还抓住。动完没了,要写没了。
CDFI、语义表征交互,是稿子里的名字。我参与,不把交互说成我发明的模块。发明这种词需要稿件贡献表。贡献表对外写参与就够。够的意思是:站点不扩写。扩写会把别人的工作吃进第一人称。
特征引导交互,听起来像方法句。方法句在笔记里要降级成:我们用这些可计算的量去影响表征怎么融合。影响有没有用,看 MCC Decay、MRS、OOD。看这些,不看「成语很中国」。很中国不是指标。
不要把单个特征写成贡献
成语密度单独拿出来很好写。很好写的东西最像贡献。贡献在组合和评测协议。组合失败时,单个特征的漂亮图还在,会诱惑人把图放进 PPT。PPT 和系统不是同一套。图若对应一次没有 seed 的探索,就冻在探索,不进答辩页。
我写 limitation 时会问:去掉成语密度,协议上的表会怎样。没有这张对照,就不说它关键。关键两个字我尽量不用。不用的原因是它常在证据前面出现。证据前面的关键,是修辞。
TextGuard-Bench 上如果要谈特征,也要带条件。条件包括改写。改写后成语被换掉,密度信号可能先死。先死不是丢脸。先死是信息。信息写进 limitation,后人知道别只靠它。
名单以论文和代码为准
我想加的特征很多。口头禅、数字写法、引号套层。想加不等于已加。已加以代码和稿子名单为准。这里不编。编一个新特征名,看起来像进展。进展要对着仓库。仓库没有,站点不能有。
NeurIPS 2026 仍是 Under Review。LPP 作为名字可以出现。作为已接收贡献不能出现。已接收不存在。
限制
这篇没有密度分布图。没有「人写比机器多多少」。多多少是数字。数字要指回 run。指不回就停。停在:我参与 LPP;成语密度是其中一项;写它是为了对齐后还想抓住的习惯;抓住与否看协议,不看这篇散文。
我想过把这篇写成「中文特征为什么有用」的科普。科普会把美、文化、传统请进来。请来之后,评测协议就退到后台。后台的东西最容易漏:划分、改写、对照。漏了,成语密度就变成故事。故事不能当方法。方法要能去掉这项再看表。表还没有,这篇只负责把名字留在简历允许的名单里,并把「单独当贡献」这条路堵上。堵上之后,若以后有对照,再写对照。没有对照,不升级形容词。