Notes · 2025.09.27

企业库不是论文库

实习和科研别混口径。

1 min · intern · rag

同一天可能打开两扇窗口。一扇是 Humanitelligence 的内部查询,权限不够就空。一扇是论文 PDF,默认没有这层门。两边都有向量,两边都有切片这个词。不是同一个任务。我是张恒基,北邮计算机。混着写进同一段「我做 RAG 检测」,是错的。

权限把企业任务钉死

企业文档有密级、角色、部门。检索在过滤之后发生。过滤失败表现为空或权限提示,不表现为「库里没有知识」。论文库做实验,PDF 通常整库可扫,评测可以公开复现。公开复现在企业这边往往做不到。做不到,就不要用论文评测的数字去给企业周报充数。充数会在权限一开时碎掉。碎掉的是假提升。

实习里我跟的是可查询知识库、引用定位、内部问答。验收是:权限内能否跳回原文、空和超时是否诚实、切片和窗口改动能否复现。科研里 TextGuard 跟的是中文 AI 生成文本检测鲁棒,报告给要签字的人,拟申报大创,论文状态是 Under Review。明察万象跟的是多模态科研诚信,我是实习生,参与构建和联调。三条线的用户、门、输出物都不同。

不同,简历上也要分栏。智能知识科技一条,教育部信息网络工程研究中心的智链和明察一条,TextGuard 作为自己负责的项目一条。智链从 2025 年 7 月起,前端,Vue3。明察从 2026 年 1 月起,多模态。Humanitelligence 从 2026 年 1 月起,企业 RAG。时间可以重叠。口径不能重叠。重叠的那句话通常以「向量检索」开头,以什么都没说清楚结尾。

论文数字进不了企业库

划分、seed、OOD、MCC,是检测和 benchmark 的语言。企业问答很少用这些词验收。业务方问的是这句话能不能引用到现行制度、会不会把过期版本召回来、会不会越权。过期版本在论文库里可能叫数据污染。在企业库里叫事故。事故的处理路径不是改评测脚本,是改权限和生效时间。生效时间如果没进元数据,切片再漂亮也召回旧文件。

我把企业错误案例按权限、过期、切碎、窗口重复、无引用乱说分类。分类里没有「模型在生成文本上的假阳性」。假阳性是 TextGuard 的第一问。拿过来解释企业错答,听起来专业,帮不上工单。工单要能指到配置和接口。配置和接口在 human-intelligence.cn 后面的内部系统里。内部系统没有论文附录。

Under Review 的 NeurIPS 2026、AAAI 2027,不写进企业实习产出。不写中了,也不拿来给 RAG 站台。站台是口径膨胀。膨胀一旦写进个人站,就和故事页对不上简历一样,属于文档超过证据。超过证据是缺陷。企业库的证据是工单和对照表。论文的证据是划分和协议。两套证据不要互相签名。

词共用,验收不共用

解析、切片、向量、召回、问答,企业 RAG 的流水线可以这样写。论文侧也可能有检索。写给别人看的时候,必须点明库是有门的还是没门的。有门,空是产品。没门,空可能是评测集构造问题。评测集构造问题用补样本解决。产品空用权限文案和诚实接口解决。补样本解决不了 403。403 解决不了 OOD。

我自己会懒,会想用一段「检索增强」把三条线收掉。收掉之后字数少、看起来完整。完整是假的。假完整会在面试追问里被拆开:你说的召回,是论文图近邻,还是制度条款,还是 AI 文本特征?三个答案来自三个仓库、三套用户。拆开答,才像做过。并成一段,像读过介绍。

官网可以并列:textguard.site、ilink.bupt.edu.cn、verischolar.cn、human-intelligence.cn。并列不等于同一项目。个人站的笔记也并列。并列的时候每篇只负责一件事。这件事里的限制要写在同一篇里,不要把限制留到「总述」里去和稀泥。和稀泥的总述,我尽量不写。这篇就是用来把两库切开的。

两套任务别写进同一句

我收到的限制是口径本身:企业库有权限,论文库没有;实习跟可查询知识和内部问答,科研跟检测鲁棒和诚信监测。向量这个词两边都会出现。出现时必须带着库的门。门写掉了,句子就错。错的句子不要因为好写就留下。留下一次,下一次介绍还会再混。再混,四条线都会变得不像真的做过。