安卓机器人知道它们只是在梦见电子羊吗?
计算与语言
2024-06-11 v2 人工智能
机器学习
摘要
我们设计了针对 Transformer 语言模型内部表示进行训练的探测器 (probes),以预测其在三个有依据的生成任务中的幻觉行为。为了训练这些探测器,我们对采样(有机)和人工编辑(合成)的参考输出进行了跨度级 (span-level) 的幻觉标注。我们的探测器是在狭窄领域内训练的,我们发现它们对训练域非常敏感:从一个任务泛化到另一个任务,或从合成幻觉泛化到有机幻觉时,表现不佳。然而,在域内数据上,它们能够在许多 Transformer 层中可靠地检测幻觉,早在第 4 层就达到了其峰值性能的 95%。在此,探测被证明是评估幻觉的准确方法,优于几个当代基线,甚至在响应级检测 F1 上超越了专家人工标注者。同样,在跨度级标注方面,探测器在三个生成任务中的两个上与专家标注者持平或更优。总体而言,我们发现当模型状态可用时,探测是一种可行且高效的语言模型幻觉评估替代方案。
引用
@article{arxiv.2312.17249,
title = {Do Androids Know They're Only Dreaming of Electric Sheep?},
author = {Sky CH-Wang and Benjamin Van Durme and Jason Eisner and Chris Kedzie},
journal= {arXiv preprint arXiv:2312.17249},
year = {2024}
}
备注
ACL 2024 (Findings) Camera-Ready