KuaiLian
客户端说明网络观察技术指南帮助中心

KuaiLian 多设备

AI摘要包含引用为何仍可能误导:原文事实、模型推论与未知项怎样分开

引用名称只提供查找线索,不能证明摘要中的每个数字、因果与限制都来自原文。文章结合NIST生成式AI风险框架与W3C来源追踪模型,给出主张、证据、生成活动、责任者和未知项的逐句核对法。

一份AI摘要列出三个机构名称和四篇报告,语气肯定,数字也很具体。团队因此默认“有引用就已经核实”,直接把摘要放进项目文档。复查时才发现,其中一个报告不存在,另一个数字来自不同年份,第三个来源只支持相关性,摘要却写成因果关系。

问题不只是模型有没有附上引用,而是每一项主张能否回到原文中的具体位置。来源名称只回答“可能去哪里找”,不能回答“这句话究竟由哪段证据支持”。

引用格式也可能是生成结果

NIST指出生成式AI可能虚构内容、推理步骤和引用,自信语气会增加人对错误结果的信任。模型的任务是根据上下文产生统计上合理的后续内容,格式完整、语句顺畅与事实正确不是同一个指标。

虚构不一定表现为整篇胡说。更常见的是把真实发布者与不存在的标题拼在一起,把正确数字放错年份,或把来源中的“可能”“在特定样本中”删成普遍结论。读者看到熟悉机构和规范格式,反而更容易降低警惕。

两次模型都给出同一个引用也不构成独立验证。它们可能使用相似训练资料、相同检索结果,或重复同一错误模式。相似输出最多说明表面结论接近,不能把两个生成结果当成两个独立来源。

先把长段摘要拆成主张

逐段问“这段有没有来源”太粗。一个句子可能同时包含数字、时间范围、比较、因果和限制,其中只有部分得到支持。应先拆成最小可核对主张。

例如,“2025年某措施使故障率下降30%,并改善所有地区的稳定性”至少包含四项:年份、下降幅度、因果关系和适用地区。原文也许只报告某次观察中下降30%,没有对照组,也没有覆盖全部地区。若整句只挂一个引用,范围扩张会被藏起来。

优先拆数字、最高或最低等比较词、导致或改善等因果词、所有或普遍等范围词,以及可能、尚未确定等限制词。这些部分一旦写错,往往会改变读者的决定。

原文锚点要能让别人重查

发布者名称不能替代原文定位。可用锚点应写页码、章节、小标题、表格号或一段稳定的可搜索短语。接手者不需要猜作者为什么引用整份六十页报告,而能直接检查相关段落。

核对时先看主题是否一致,再看研究对象、时间、地区、样本和方法。接着检查原文使用的是事实陈述、模型估计、情境假设还是建议。最后保留原文中的限制,不用摘要语言把不确定性磨平。

如果来源页面更新频繁,还要记录阅读日期和使用版本。今天打开的“最新”页面可能与生成摘要时不同。无法固定版本时,至少保存标题、发布日期、章节锚点和核对时间,并在记录中说明页面可能变化。

找不到原文不是“小瑕疵”。若关键数字、因果或安全结论无法定位,应标为未验证并从正式结论移出。普通背景句可以暂留为查找线索,但不能与已核实事实使用相同语气。

来源链说明摘要怎样产生

W3C PROV-O用实体、活动和责任者描述资料怎样被使用、生成、衍生和归属。把这个结构放进AI摘要,原始报告、检索快照、模型输出和编辑后的摘要是不同实体;检索、生成、人工核对和批准是不同活动;模型服务、编辑与批准者承担不同角色。

这一区分解决一个常见误会:摘要列出某份报告,不代表生成活动实际使用了报告全文。模型可能只接触标题、搜索片段、二手转述或旧版本。记录“来源名称”仍无法还原输入。

可靠记录要说明哪次检索取得哪一版资料,完整输入包含哪些内容,模型生成了哪份原始输出,编辑删除或改写了什么,最后由谁核对。来源名称只回答可能去哪里查,原文锚点回答哪段支持主张,来源链则回答谁通过什么活动把证据变成摘要。

PROV-O还区分直接引用、修订自和第一手来源。直接转述应忠实保留原意;编辑改写需要说明推论;第一手来源则表示生产者具有直接经验或知识。三种关系都不自动评价质量,却能阻止它们在摘要里被压成同一种“参考资料”。

事实、推论和未知项分开写

事实栏只放原文可以定位的内容,并保留对象、期间、条件和单位。推论栏解释编辑如何从多项事实得到当前判断,使用“据此可推测”“在这些条件下”一类明确边界。未知栏记录证据没有回答的问题。

假设两份官方资料分别说明某种风险机制和一组历史观测。编辑可以提出两者可能相关的判断,但若没有直接研究,就不能写成已证实的因果。推论并非不能写,关键是让读者知道它不是来源原话。

冲突证据也不能被“综合来看”一句抹平。两份来源结论不同,可能因为样本、时期、定义或方法不同。摘要应并列差异和适用条件;若无法解释,就把冲突本身保留下来。

未知项不是写作失败。明确写出“没有找到跨地区数据”“报告未说明对照条件”,比用一般常识补空白更有信息价值。它告诉下一位研究者该去补什么证据。

人工复核需要按风险分级

NIST建议在接近实际使用情境的条件下测试生成式AI,并记录测量、监控、人工监督和风险反应。用来寻找阅读线索的摘要,与用于医疗、法律、资金或公共安全决定的摘要,不能采用同一抽查比例。

低风险导航可以核对标题、来源和主题是否相符。内部研究记录还应逐项核对关键数字、比较和限制。会影响外部决定的内容,应由具备领域知识的人复核原文、方法和适用范围,并保留批准记录。

人工复核也会出错。复核者可能只看引用是否存在,却没看是否支持当前句子;也可能受到模型肯定语气影响。因此,复核状态不能只写“已看”,要区分来源可打开、锚点匹配、范围一致、推论已标记和限制已保留。

五栏表怎样逐句使用

建立主张、原文锚点、推论性质、来源链与复核状态五栏表,对数字、因果、比较和限制逐项核对。第一栏每格只写一个可判断真假的主张;第二栏放发布者、标题、日期和精确锚点。

第三栏标记直接事实、编辑推论、模型建议、冲突或未知。第四栏记录使用的来源版本、检索时间、模型与工具版本、完整输入保存位置、原始输出编号、编辑者和批准者。第五栏逐项标明可打开、内容匹配、范围一致、限制保留,并写复核日期。

若一句话同时有三个主张,就占三行。若同一主张由两份来源支持,可以在同一行列出两个锚点,同时说明它们是否真正独立。若来源只支持一部分,就缩小主张,不要扩大引用。

完整来源链提高可追查性,却不能自动证明来源质量、方法适用性或摘要结论正确。PROV-O提供的是描述关系的语言,不是事实审判器;NIST框架提供风险管理方法,也不替代具体领域的专业判断。

用一个数字主张做受控对照

假设AI摘要写道:“采用新流程后,处理时间缩短40%,且结果适用于所有团队。”第一行把“缩短40%”列为数字主张,第二行把“由新流程造成”列为因果主张,第三行把“适用于所有团队”列为范围主张。三项不能共用一个复核结果。

原文表格可能显示试点组平均时间从十分钟降到六分钟,数字计算确实是40%。但若研究没有对照组,下降也可能受到人员经验、任务难度或同时实施的其他变化影响,因果栏就只能标为推论。若样本只来自一个团队,范围栏必须改为“该试点团队”,不能保留“所有团队”。

来源链还应写明模型读到的是完整报告、表格截图还是二手摘要。若模型只看见截图,方法和限制并未进入生成活动;编辑后来打开原文补查,就要把这次人工阅读记录成独立活动。最终批准者据此缩小表述,并不等于认可模型最初的因果解释。

这种逐项对照看似比检查引用是否存在更慢,却能把错误停在草稿阶段。关键主张数量通常远少于全文句子,优先处理数字、因果、最高级、普遍范围与安全结论,就能把复核资源放在最可能改变决定的位置。

把摘要停在证据边界

出现引用不等于摘要全部准确,发布者名称不能替代原文定位,模型的肯定语气也不表示事实确定。抽查部分句子不能证明整份摘要可靠,特别是数字、因果、比较和安全结论仍未逐项核对时。

一份可靠摘要不必假装没有不确定性。它应让读者清楚看见哪些是原文事实、哪些是编辑推论、哪些证据相互冲突、哪些问题仍未知,以及谁在什么条件下完成复核。

当每项关键主张都能回到原文锚点,并沿着检索、生成、编辑和批准活动还原,引用才从装饰变成证据入口。无法完成这条链的内容,应保持为待查线索,而不是进入正式结论。

资料来源

  • National Institute of Standards and Technology:《Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile》,发布或更新于 2024-07-26
  • World Wide Web Consortium:《PROV-O: The PROV Ontology》,发布或更新于 2013-04-30