关闭广告

腾讯与中科大联手:当AI搜索遇上"阅卷老师",文档筛选的革命来了

科技行者2026-08-05 00:00:011人阅读


这项由中国科学技术大学与腾讯元宝团队、中国科学院大学及山东大学联合开展的研究,以预印本形式于2026年7月发布,论文编号为arXiv:2607.19747。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。

一、搜索结果"全对"但答案却是错的?

假设你请了五位助手去图书馆帮你查一道历史题,结果他们带回来的五本书,每一本都与这道题有关联——然而翻开一看,两本书讲的几乎是同一件事,第三本里有一个关键错误,第四本把重要信息藏在几百页无关内容的中间,第五本提供了一些边角信息但缺少最核心的那块拼图。最终你手里有五本"相关书籍",却依然无法给出一个完整、准确的答案。

这个令人沮丧的场景,正是当今人工智能搜索系统天天都在经历的困境。在传统的信息检索逻辑中,评估一次搜索好不好的标准非常简单:每一篇文档单独打分,看它与查询问题有没有关系,然后把分数加总排个名次,这就是所谓的nDCG评估体系。这套方法沿用了几十年,在人类用眼睛浏览搜索结果的时代运转得还不错——毕竟人类有能力自己过滤重复内容、识别矛盾说法、判断哪些信息是真正需要的。

然而现在,读取搜索结果的主体变了。大型语言模型(也就是那些能对话、能写文章、能回答问题的AI)会直接把搜索到的文档塞进自己的"大脑"里,以此为依据生成答案。这个过程叫做检索增强生成,简称RAG。在这种模式下,文档集合的质量直接决定了AI最终能给出多好的答案——就像厨师只能用现有的食材做菜,如果送来的食材里有坏的、重复的、甚至掺了杂质的,再高明的厨师也无法做出完美的菜肴。

这项研究的切入点正是这个被长期忽视的问题:现有的评估体系根本看不出文档集合里存在哪些深层缺陷,更无法指导我们去修复这些缺陷。于是,研究团队决定从头设计一套全新的诊断工具。

二、一份专为"文档集合"量身定制的成绩单

研究团队构建的核心工具叫做SETWISEEVALKIT,可以把它理解为一位非常挑剔的阅卷老师,不只是问"这份答卷有没有写到点子上",而是从三个层次、九个维度对整套文档组合进行全面体检。

第一个层次是文档个体层面,考察每一篇文档自身的质量。这里包含三个维度:相关性,也就是文档有没有真正触及问题的核心,而不只是表面上出现了关键词;真实性,文档里陈述的事实有没有和正确答案相符,有没有包含错误信息;以及质量,文档的结构是否清晰,读者能不能方便地从中提取到需要的信息,而不是把关键内容淹没在大量无关废话里。

第二个层次是文档集合层面,考察多篇文档放在一起时如何相互作用。这里同样有三个维度:互补性,不同文档有没有各自提供不同的关键信息片段,拼合起来比任何单一文档都要完整;冗余性,有没有两篇或多篇文档说的几乎是同一回事,白白占用了有限的空间;以及冲突性,不同文档对同一个事实有没有给出互相矛盾的说法,从而可能误导AI得出错误结论。

第三个层次是整体效用层面,把这套文档组合当作一个整体来看,考察它能不能真正支撑AI完成推理任务。这里的三个维度分别是完整性,文档集合有没有覆盖生成正确答案所需的所有关键信息点;信息密度,文档里真正有用的内容占整篇文档的比例,有没有被大量无关填充物稀释;以及可达性,仅凭这套文档集合,不依赖任何外部知识,AI能不能从头到尾走完完整的推理链条,最终得出正确答案。

这套体系的精妙之处在于,它打破了"文档集合的质量等于每篇文档质量之和"这个长期被默认接受但实际上并不成立的假设。五篇各自相关的文档,组合在一起可能因为高度重叠而几乎没有额外价值;而五篇看起来分散的文档,如果每篇恰好提供了不同的关键信息片段,组合起来的价值可能远超单纯的分数叠加。

三、28000条评分标准从何而来

光有评估维度还不够,还需要具体的评分标准。研究团队采用了一种被称为"评分细则"的方法——为每一个查询问题专门定制一套评判标准,而不是用千篇一律的模板来评价所有问题。

生成这些评分细则的过程本身就颇具巧思。研究团队把每一对"问题+标准答案"同时交给两个顶级AI模型分别生成候选标准,要求每条标准必须具体到这道题的关键实体、具体事实和数字,绝对禁止写"包含相关内容"这样的模糊废话。然后,第三个AI模型对两批候选标准进行汇总和筛选,去掉重复的和质量差的,最终产出精华版本。

这个过程在两类场景下分别进行。第一类是短答案场景,基于四个多跳问答数据集——HotpotQA、2WikiMultihopQA、MuSiQue和Bamboogle——最终保留了2061个高质量样本,生成了约24000条评分标准。为什么偏偏选多跳问答?因为这类问题天然需要综合多篇文档才能回答,比如"哪家公司收购了在1994年引发个人电脑价格战的那家公司,最终于2002年完成合并",一篇文档可能只知道谁发起了价格战,另一篇才知道后续的收购,两篇合起来才能回答完整。这种结构特别适合检验文档集合的组合质量。

第二类是长答案场景,基于ResearchQA这个横跨75个研究领域的学术问答数据集,随机抽取200个样本,生成了约4000条评分标准。长答案场景下使用的是一个叫做DR.Tulu-8B的开源深度研究智能体,它会自主进行多轮搜索,每次调用谷歌搜索API获取文档,最终综合所有轮次的发现生成一篇完整的研究报告。

整套标准经过人工质量审核。研究团队随机抽取样本,请博士级别的专家对每条评分标准从两个角度打分:这条标准有没有实际区分高低质量文档集合的能力,以及如果删掉这条标准,文档集合的排名会不会发生明显变化。结果显示,经过多模型汇总后,大约70%的标准被评定为高度或极度有区分力,远高于单个模型生成时的37%到43%的比例,而质量堪忧的标准占比只有约8%。三位专家之间的一致性得分也达到了非常高的水平,说明这套评分体系是可靠的。

四、现有搜索排序方法究竟差在哪里

有了这把精准的量尺,研究团队对12种主流文档重排序方法进行了全面测评。这12种方法大致分为三类:传统的逐文档打分排序方法(如BGE-Reranker、MonoT5、RankT5等),加入了推理能力的增强型排序方法(如Rank1、Rearank、ReasonRank),以及专门针对文档集合整体进行优化的新型方法(SetR和Rank4Gen)。

结果令人瞩目,但不是那种令人振奋的瞩目,而是令人清醒的瞩目。即便是表现最好的方法,在这套九维度评估体系下的综合覆盖率也不超过45%。换句话说,所有现有方法在保障文档集合质量方面,都还有超过一半的改进空间。

在短答案场景下,专门优化文档集合整体结构的SetR和Rank4Gen方法明显领先,这说明在固定候选池里选择最优子集的策略是有效的。加入了链式思维推理能力的ReasonRank在全局评估层面表现较强,因为推理能力帮助它更好地判断一套文档能不能支撑完整的推理链条。而传统的逐文档打分方法在任何层次上都没有明显优势,暴露出这类方法在设计上的根本局限。

在长答案场景下,情况发生了有趣的反转:推理增强型方法后来居上,ReasonRank和Rearank分别占据第一、第二位,而在短答案场景称雄的集合型方法反而跌到了中游。这个反转背后的逻辑是:多轮累积搜索场景需要的是判断每次新检索到的文档相对于已有信息的边际价值,这正是推理能力的用武之地。

贯穿两种场景的一个共同发现是:几乎所有方法在跨文档协调这个层面都表现得非常薄弱,尤其是互补性和完整性这两个维度。这意味着现有的排序方法几乎都没有真正考虑过"这批文档放在一起是不是一个有机的整体"这个问题,它们更像是在给每道菜单独评分,而不是在判断这一桌菜拼在一起算不算一顿营养均衡的餐食。

另外还有一个值得关注的细节:在长答案的多轮搜索场景里,每一轮检索到的文档质量评分都呈现出系统性下降的趋势,第一轮最高,越往后越低。但这并不意味着排序方法在后面几轮变差了,而是搜索本身的规律使然——前几轮把最容易找到的信息都采集完了,后面几轮面对的是越来越窄、越来越难的信息缺口,候选文档池天然稀薄。研究团队因此采用了把所有轮次选到的文档合并去重后统一评分的方式,才能公平衡量整个搜索过程累积下来的文档集合质量。

五、评分标准能直接变成筛选标准

前面的测评是诊断,接下来研究团队做了一件更大胆的事:既然评分细则能量化文档集合的质量,为什么不让它直接指导文档的选择?

这个想法催生了另一个核心贡献——RUBRIC4SETWISE方法。这个方法不需要任何额外的模型训练,直接把评估标准转换成筛选指令。具体来说,给定一个查询问题和对应的评分细则,系统会把所有候选文档和评分细则一起喂给一个推理模型(使用了Qwen3-8B作为推理主干),要求它先逐一核查哪些文档能满足哪些评分条目,然后选出能够覆盖所有评分条目所需信息的最小文档子集,而不是预先设定"取前五篇"这样的固定数量。

这种方式的直觉是清晰的:如果我们明确知道回答一个问题需要哪些具体的信息点,那么选文档的策略就不应该是"取得分最高的几篇",而应该是"找到一个能覆盖所有必要信息点的最精简组合"。前者是量化排名,后者是目标导向的集合优化。

测试结果充分证明了这个思路的价值。在短答案场景下,RUBRIC4SETWISE以平均仅使用2.66篇文档的代价,在精确匹配率和F1分数两个指标上都超过了所有其他方法,而排在第二位的SetR平均需要2.75篇文档,传统方法则固定使用5篇。用更少的文档获得更好的答案,说明精准筛选比堆砌数量更有效。

在长答案场景下,RUBRIC4SETWISE同样以70.57分的LLM裁判得分拔得头筹,超过第二名SetR的70.54分,以及推理增强方法ReasonRank的68.36分。更值得注意的是,它使用的总文档数(20.52篇)少于SetR的29.23篇,搜索轮次(平均4.52轮)也少于SetR的4.73轮。也就是说,RUBRIC4SETWISE用更少的资源换取了更好的结果,这在实际应用中意味着显著的效率提升。

还有一点尤为重要:RUBRIC4SETWISE是唯一一个在短答案和长答案两种场景下都保持顶尖表现的方法,其他方法要么在短答案场景强而在长答案场景弱,要么反之。这种跨场景的稳定性,正是研究团队此前就已发现的现有方法普遍存在的"泛化天花板"问题的解法所在。

六、一道题的完整诊断报告

理解这套评估体系最直观的方式,是看一个具体的例子。

考虑这样一道问题:"在《办公室》这部美剧里,德怀特在哪一集救了帕姆的丈夫不被罗伊伤害?"正确答案是第三季第十九集《谈判》。

排序系统选出了五篇文档:第一篇和第二篇分别从不同角度记录了这一事件,都明确提到了集名和德怀特用辣椒喷雾阻止罗伊的情节;第三篇来自同一集的另一段落,讲的是事件之后帕姆和罗伊的关系,没有重述关键事件;第四篇是德怀特这个人物的传记介绍,完全没有涉及这场冲突;第五篇讲的是第五季完全不同的一集。

逐文档评分(以相关性为例)显示:文档一和二得4分,文档三得1分,文档四和五得0分。这和传统评估体系能给出的信息基本一致。然而一旦上升到集合层面,新的洞察就出现了:互补性只有1分,因为文档一和文档二几乎涵盖了所有必要信息,没有真正的分工;冗余性反而得了4分(这个维度分数越高代表冗余越少,因为两篇各自提供了略有不同的背景细节);冲突性得4分,说明两篇核心文档没有矛盾。但在全局层面,信息密度只有1分,因为有用的那一两句话在每篇文档中占的篇幅实在太小;可达性只有2分,因为没有任何文档明确交代帕姆的丈夫就是吉姆,这个看似显而易见的链接在文档中是缺失的,纯粹依赖这套文档而没有外部知识的AI,无法完整地推理出答案。

这就是传统评估与多维度评估之间的核心差距:前者告诉你有没有把"对"的文档选进来,后者告诉你这些文档放在一起能不能真正帮AI把问题解决掉。

七、研究的真实边界与未来方向

任何研究都有它诚实承认的局限,这项研究也不例外。

RUBRIC4SETWISE方法依赖预先准备好的评分细则,而这些细则的生成需要知道正确答案。这在研究环境中是可行的,因为研究团队手里有标准答案,但在真实应用场景中,系统往往不知道答案是什么。研究团队把这种设定诚实地称为"神谕设置",也就是说目前的结果代表的是这个方法在理想信息条件下的能力上限,而不是日常部署时可以直接复现的性能。

这个局限同时指向了一个清晰的研究方向:如何在没有标准答案的情况下,让系统自己推断出它需要满足哪些信息条件?一种可能的思路是把评分细则的偏好"蒸馏"成可训练的奖励信号,让排序模型在训练过程中内化这套多维度的质量意识,而不需要在推理时依赖现成的细则。这是研究团队在结论部分明确指出的下一步工作方向。

另一个需要关注的现象是长答案场景下方法间差距的显著收窄——所有方法的综合得分差距只有大约3个百分点,而在短答案场景下这个差距接近9个百分点。研究团队的解读是:目前排序模型和搜索智能体基本上是各自为政,排序模型不知道智能体已经积累了哪些信息,智能体也不会把自己的状态反馈给排序模块,两者之间没有信息流动,这才是当前长答案搜索质量的真正天花板所在。解决这个问题需要的是排序模型与搜索过程的协同优化,而这超出了当前这项研究的范围。

归根结底,这项研究做了一件在信息检索领域长期被忽视但又至关重要的事:把评估的视角从"每篇文档够不够好"转向"这批文档放在一起够不够用"。随着AI系统越来越多地依赖外部知识库来生成答案,这种系统性的视角转换不只是学术上的整洁,更是工程实践上的必要进化。

当AI助手开始在医疗咨询、法律分析、科研支持等高风险领域发挥作用时,它所依据的文档集合究竟有多可靠,直接关系到答案的质量乃至安全性。一套能够诊断文档集合深层缺陷的评估体系,和一套能够主动规避这些缺陷的选择策略,其价值远不止于提升几个百分点的基准测试分数。

Q&A

Q1:SETWISEEVALKIT和传统的nDCG评估方法有什么本质区别?

A:nDCG是对每篇文档单独打相关性分数然后加总,默认"集合好坏等于单篇之和"。SETWISEEVALKIT则把文档集合当作整体来评估,涵盖九个维度,能发现传统方法看不到的缺陷,比如多篇文档高度重复、不同文档之间存在事实矛盾、整套文档无法支撑完整推理链条等问题。这相当于从"每道菜单独打分"升级到"整桌饭合不合理"的评估逻辑。

Q2:RUBRIC4SETWISE方法为什么用更少的文档反而能得到更好的答案?

A:传统方法通常取排名前五的文档,其中可能有两三篇内容高度重复。RUBRIC4SETWISE会先明确这道题需要哪些具体信息点,再找到能覆盖所有信息点的最小文档子集,平均只需2.66篇。删掉冗余文档后,AI不需要处理重复噪音,关键信息更突出,推理更准确。

Q3:评分细则的生成需要知道正确答案,实际使用时怎么解决这个问题?

A:目前RUBRIC4SETWISE确实依赖预先知道标准答案来生成评分细则,研究团队自己也承认这是"神谕设置",代表的是方法的能力上限而非日常可用的状态。研究团队提出的解决方向是把评分偏好"蒸馏"成可训练的奖励信号,让模型在训练阶段就内化这套质量意识,推理时不再需要现成答案。

版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

农妇遭错判寻衅滋事罪被羁押507天 获30万元国家赔偿

扬子晚报 浏览 361 02-04

12月22日发布 零跑D19内饰设计图曝光

网易汽车 浏览 424 12-21

整车34.98万元/租电24.18万元,蔚来新ES6 30万台纪念版上市

IT之家 浏览 1140 11-17

日本开年密集外交搞了不少小动作 引发地区国家警惕

澎湃新闻 浏览 399 01-20

新中式,才是属于我们的时尚与生活

LinkFashion 浏览 484 10-06

61岁影后张曼玉回港低调看演唱会,化身迷妹

娱乐留声机彡 浏览 383 02-04

西媒:巴萨正在与小将库巴西商讨新合同,同时有信心留下坎塞洛

直播吧 浏览 2919 04-25

特朗普威胁对欧洲8国加税:直到美"彻底购买格陵兰岛"

红星新闻 浏览 378 01-19

吉利自研了神盾短刀电池,用在银河E5上会怎么样

汽车圈生活 浏览 2731 07-03

关键邦选举印人党"罕见胜利" 莫迪重掌政治主动

环球网资讯 浏览 300 05-06

谷爱凌穿泡泡机,肯豆cos胜利女神,这届Met Gala的赢家到底是谁?

LinkFashion 浏览 231 05-08

胡塞武装宣布:打掉隶属美以沙三方间谍网络

环球网资讯 浏览 396 11-15

台媒:面对解放军军演 台当局黔驴技穷、原形毕露

参考消息 浏览 456 01-02

郭磊:三季度经济数据——哪些线索需要关注

首席经济学家论坛 浏览 461 10-22

喜羊羊之父,又要去IPO了

投资家 浏览 428 01-02

外套真的没有必要买太多,准备这几件大衣就足够,简单耐穿又百搭

静儿时尚达人 浏览 347 03-15

巴尔韦德:皇马有我信任的理疗师,我都听他的

懂球帝 浏览 370 03-11

有望今年二季度投产 沃尔沃EX60正式发布

车质网 浏览 376 01-22

社评|立足新起点 奋力开新局

中国企业家杂志 浏览 393 01-05

消息称三星Galaxy S27 Ultra将搭载更安全的Polar ID面部识别技术

IT之家 浏览 388 02-03

避免引发恐慌 中东多国收紧社媒敏感信息管控

环球网资讯 浏览 380 03-17
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除沪ICP备2023013132号-2