Notes · 2025.08.16
CLIP 和论文图
图像复用怎么找。
两张图,一张对比度高,一张裁了边。肉眼不一定认得出同源。论文里的图被改对比、裁边、换配色,复用会躲过「看过这篇」的记忆。CLIP 把图拉到一个能近邻检索的空间。Milvus 里放的是向量,不是原图本身。我是张恒基。明察万象这条线上,我跟的是检索和展示,不是「我发明了 CLIP」。
向量近,仍要人看
召回给出一批邻居,邻居里混着真复用和只是同一类实验图。同一类实验图在论文里合法。合法的近邻如果被画成红框,作者会来问。问的时候如果系统只能说「向量很近」,对话走不下去。报告里得指出像在哪:构图、曲线形状、显微镜视野,还是只是配色方案接近。指得出,人才能判。指不出,分数只是分数。
我联调时先核对一件土事:页面上的缩略图是不是检索用的那张。预处理裁边、去字、缩放到 CLIP 入口尺寸,任何一步和入库时不一致,近邻都会漂。漂了不要先调模型。先对预处理。预处理对上了,再谈阈值。阈值没记进配置、没留下当次查询,下周的「感觉更好」作废。
Milvus 的集合名、维度、度量方式,写错一个,联调会表现为「检索很笨」。很笨的原因可能是度量反了。反了的问题在日志里不像事故,像业务差。业务差会把人带去调 CLIP。调 CLIP 解决不了度量反了。我把这类核对写成检查项,放在换模型之前。换模型很炫。炫之前先把集合问对。
展示要带证据链
老师点开一条图像风险,要能看见:查询图、近邻图、来源论文、相似度、当时用的集合。少一项,证据链就断。断了的链上如果还挂着 LLM 生成的说明,说明会显得比证据硬。显得硬是危险的。危险的说明,我在展示里放到证据后面,并标明是辅助,不是鉴定。鉴定两个字不出现。
原图本身不一定能进页面。权限、版权、存储,都会把展示限制在缩略图或授权副本。限制要说出来。说出来,使用者才不会以为系统藏图。藏图的印象在诚信工具里很糟。糟过检索不准。不准可以解释。藏没法解释。
和 TextGuard 的样本对照是亲戚,不是同一套代码。那边对照的是文本片段。这边对照的是图。亲戚关系让我少走一点空状态的弯路:空召回要画成空召回,不要转圈。转圈会让人以为后面还有一张铁证。没有铁证的时候,诚实的空比较短,也比较能用。
改配色不是魔法隐身
换配色、翻转、加水印,能骗过一部分哈希。CLIP 这类表示对语义更宽,对水印更钝。钝有好处,也有坏处。好处是能抓住一批改过皮的复用。坏处是把同一主题的合法图拉近。宽和钝都要在介绍里承认。承认完,阈值和人审才有理由存在。没有人审的图像检索,不该直接进处理流程。
我是实习生。处理流程怎么定,不归我签字。我能做的是:让召回结果在页面上可核对,让配置可复现,让一次查询留痕。留痕才能在错误案例里回头看。错误案例比正确案例有用。正确案例会让人以为链路已经稳了。稳了的错觉,会把人审时间砍掉。砍掉之后,误伤从文本换成图,伤法更难看,因为图印在论文里,撤不掉。
这一层我跟的是检索和展示。句子里不出现「我提出了一种基于 CLIP 的方法」。提出是论文口径。论文如果有,状态另说。明察这条实习线,贡献写参与。参与已经够具体:向量有没有进对集合,近邻有没有画对图,说明有没有压在证据后面。
模型说像,报告还要说像在哪
我收到的限制来自那两张看起来不像的图:近邻检索能找,不能判。CLIP 和 Milvus 把候选找出来之后,报告必须指向像在哪,并留下人看的位置。位置如果被自动化鉴定顶掉,系统就越过了监测该停的线。监测停在证据。判决停在人。实习生的活停在让证据能被看见。
像在哪要能指
召回之后还要人看。模型说两张图近,报告里得标出近在哪一块,不能只给一个分数。分数没有证据链,老师不敢用。我跟的是检索和展示这一截,不把 CLIP 写成自己的方法贡献。方法名以平台和论文为准,实习笔记只写我碰到的联调。