中文

医用 Fabric and ETHER:面向医学大语言模型的词级造假生成与检测的数据主导框架

计算与语言 2026-05-07 v1 人工智能

摘要

大型语言模型在推理和语义理解方面表现出强大的能力,但在需要专业知识的领域常出现幻觉现象,其中造假(即生成事实错误却流畅的陈述)在医学语境中风险最高。现有的医学幻觉数据集由于造假覆盖范围有限、人类作者文本与 LLM 作者文本之间存在风格差异,以及在幻觉样本合成过程中出现分布漂移,无法充分捕捉造假现象。为此,我们提出一种数据主导的管道,用于生成保持语法和风格忠实性同时引入细微事实偏差的词级造假,形成 MedFabric 数据集。基于该数据集,我们引入 ETHER——一种集成 Text2Table 分解、词掩码填充和混合句对评估的模块化词级造假检测器,以增强事实对齐。实证结果表明,MedFabric 在词级造假基准测试中超越最新检测方法超过 15%,并在结构相似性保持一致性能,提供了可靠且领域特定的事实性检测框架。

关键词

引用

@article{arxiv.2605.04180,
  title  = {MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs},
  author = {Tung Sum Thomas Kwok and Qian Qian and Xiaofeng Lin and Dongxu Zhang and Jun Han and Zhichao Yang and Davin Hill and Tamer Soliman and Sanjit Singh Batra and Robert Tillman and Guang Cheng},
  journal= {arXiv preprint arXiv:2605.04180},
  year   = {2026}
}