AlignCheck:用于事实一致性评估的语义开放域指标
计算与语言
2025-12-04 v1 人工智能
摘要
大语言模型显著推进了自然语言处理任务,但仍然容易生成不正确或具有误导性但看似合理的论点。这一问题被称为幻觉,在临床应用等高风险领域尤为令人担忧,因为事实不准确可能带来严重后果。现有的评估指标无法充分评估事实一致性且缺乏可解释性,使得诊断和缓解错误变得困难。我们提出了一种可解释的框架,用于评估领域内和开放域文本的事实一致性。我们的方法将文本分解为原子事实,并引入了一种灵活的、无模式的方法。与先前使用绝对指标的方法不同,我们采用了加权指标以增强事实评估。此外,我们提出了一种机制来控制复杂领域中的评估复杂度。我们在流行的一般和临床数据集上对我们的方法进行了基准测试,并发布了代码以支持未来研究中的事实感知模型训练。
引用
@article{arxiv.2512.03634,
title = {AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment},
author = {Ahmad Aghaebrahimian},
journal= {arXiv preprint arXiv:2512.03634},
year = {2025}
}