中文

实用推理链 (PIC):提高大语言模型对真实隐式有害语言的推理能力

计算与语言 2025-08-22 v2 人工智能

摘要

大型语言模型(LLMs)的快速发展带来了伦理顾虑,同时也为开发有害语言检测技术提供了新思路。然而,LLMs的不道德输出以及其检测有害性的能力,主要是在不要求复杂语义推理的数据上进行测试的,例如将“he”与程序员、将“she”与家务琐事的偏见关联。如今,有害语言正以更加创造性的隐式形式出现,这得益于更先进的审查技术。本研究收集了经人工标注者验证的、旨在规避在线审查的真实有害交互数据,这些数据需要复杂的语义推理。为评估和提高LLMs对真实隐式有害语言的推理能力,我们提出了一种新颖的提示方法——实用推理链(PIC),该方法取材于认知科学和语言学等跨学科的研究成果。与五种基线提示方法(如CoT和规则基方法)相比,PIC提示显著提高了GPT-4o、Llama-3.1-70B-Instruct、DeepSeek-v2.5和DeepSeek-v3在识别隐式有害语言方面的成功率。此外,它还促进模型生成更明确且连贯的推理过程,从而可能被推广到其他推理密集型任务,例如理解幽默和隐喻。

关键词

引用

@article{arxiv.2503.01539,
  title  = {Pragmatic Inference Chain (PIC) Improving LLMs' Reasoning of Authentic Implicit Toxic Language},
  author = {Xi Chen and Shuo Wang},
  journal= {arXiv preprint arXiv:2503.01539},
  year   = {2025}
}

备注

14 pages, 4 figures, 2 tables