Notes · 2025.08.09
明察万象不只查文字
多模态科研诚信。
打开一篇 PDF,问题不一定写在段落里。图被换过配色,表被挪过列,引用网络上两篇像同一谱系。明察万象 / MingChaWanXiang 做多模态科研诚信监测,官网 verischolar.cn。文本、图像、公式、表格与引用网络都在范围里。我是张恒基。2026 年 1 月起在教育部信息网络工程研究中心实习,参与构建和联调。平台不是「我做的产品」。
文字检测覆盖不住的那些
论文工厂、一稿多投、图像篡改复用、AIGC,会叠在同一篇里,也会分头出现。只查文字,改过的图会漏。只查图,一稿多投的谱系会漏。只看引用,图像复用会漏。多模态在这里是任务形状,不是贴标签。任务形状决定系统里要有 CLIP、向量检索、LLM 推理,以及把证据放回原文位置的展示。
我进组时链路已经有骨架。骨架上的活是:接口对得上、检索结果能回到页面、空和超时有提示、不要把科研诚信四个字写成万能。万能的句子在诚信系统里特别糟。糟在它会让老师以为点一次就有判决。判决需要证据链。证据链需要人看。人看需要页面把图、文、引用摊开,而不是只给一个红分。
和 TextGuard 要切开。TextGuard 跟中文 AI 生成文本,报告给要签字的人。明察跟论文里的多种不端形态,用户是科研诚信场景里的人。两边都有模型和向量,任务不是同一个。混进同一段「我做检测」,是错的。实习身份更不能混。混了,简历上的三条实习会变成一条糊的。
联调碰到的是证据,不是口号
CLIP、Milvus、LLM 这些词很好写进周报。周报要写的是:某类图能不能召回、召回之后页面指没指到原图、LLM 给出的说明和检索证据是不是同一套。同一套做不到的时候,先把展示改成「模型说像,证据在这里」,不要改成「已确认篡改」。确认权不在实习生,也不该在单次推理。
我参与构建,意思是把模块接进能跑的路径,并在路径断的时候复现。复现要带着样本编号和请求。不带样本的「图检索有点不准」,排不上号。排上号的问题通常很土:字段名、超时、权限、坐标对不上裁边后的图。土问题修完,口号才有地方站。站不住的口号,不要写进对外介绍。
官网 verischolar.cn 能打开,和某一类图像复用能被找到,仍是两件事。打开证明服务在。找到证明这一条能力在当前数据上成立。当前数据之外,我不知道。不知道的部分,介绍里就写参与,不写「覆盖全部科研不端」。全部两个字在诚信产品里比在创业赛里更危险。危险的词,实习生尤其不该用。
多模态仍要落到一屏证据
老师不会先学 CLIP 再看报告。报告要把图像近邻、文本相似、引用关系放在能反对的位置。能反对,系统才像监测。不能反对,系统像黑盒打分。黑盒打分在诚信场景里会伤人,伤法类似 TextGuard 的误伤,只是介质换成论文图和投稿记录。伤人的系统,中心不会让实习生负责对外口径。口径不归我。我归联调。
公式和表格比自然图更滑。滑的意思是:改一点渲染参数,向量就散。散了不能假装没有。页面上要能说「未召回」,并留下当时查询。未召回是结果。把未召回画成加载失败,会把科研问题变成工程事故。工程事故好修。科研问题需要换表示、换阈值、换人看。人看的时间要留在流程里。
我在智链写过空状态。明察的空状态更敏感。空可能是干净,也可能是没检到。两种空的文案不能一样。一样了,干净的人被吓到,没检到的人被放过。吓到和放过都是错。错的文案,比错的模型先被看见。
参与构建,不署名产品
我收到的限制写在身份和任务边界上:明察万象是中心的多模态科研诚信系统,我是 2026 年 1 月起的实习生。参与构建和联调,可以把 CLIP / Milvus / LLM 这条链说清楚,不能把平台写成我的作品。作品在简历的项目栏要另写属于我负责的那些。这一栏写明察,只写参与。