LLM毒性解释中的论证一致性
计算与语言
2026-01-27 v3
摘要
关于LLM与毒性的讨论主要集中在检测任务上。本工作将注意力转向评估LLM对毒性的推理能力——即从其为立场提供的解释中,以增强其在下游任务中的可信度。尽管已有大量关于可解释性的研究,但由于过度依赖输入文本扰动等因素,现有方法难以用于评估自由形式的毒性解释。为此,我们提出了一种新颖且理论依据严密的多维准则——论证一致性(ArC),用于衡量LLM的自由形式毒性解释是否反映理想且逻辑的论证过程。基于不确定性量化,我们开发了六个指标来全面评估LLM毒性解释中的一致性与不一致性。我们在三个Llama模型(最大规模达70B)和一个8B Ministral模型上,对五个多样化的毒性数据集进行了实验。结果表明,尽管LLM对简单提示生成合理的解释,但其对毒性推理在面对完整原因集合、单个原因及其毒性立场之间的细微关系时会失效,导致不一致和无关的响应。我们开源了代码(https://github.com/uofthcdslab/ArC)和LLM生成的解释(https://huggingface.co/collections/uofthcdslab/arc),供后续研究使用。
引用
@article{arxiv.2506.19113,
title = {Argument-Based Consistency in Toxicity Explanations of LLMs},
author = {Ramaravind Kommiya Mothilal and Joanna Roy and Syed Ishtiaque Ahmed and Shion Guha},
journal= {arXiv preprint arXiv:2506.19113},
year = {2026}
}
备注
29 pages, 7 figures, 9 tables