净化人工心智:面向大语言模型的自反思式解毒框架
计算与语言
2026-01-21 v1 人工智能
摘要
大语言模型(LLMs)的最新突破揭示了其卓越的生成能力和新兴的自我调节机制,包括自我修正和自我奖励。然而,当前的解毒技术很少利用这些内置能力;相反,它们依赖外部模块、劳动密集型的数据标注或人工干预——这些因素阻碍了可扩展性和一致性。在本文中,我们引入了一个完全自反思的解毒框架,该框架利用 LLMs 的内在能力来检测、纠正有毒内容,并在无需外部模块和数据标注的情况下精炼 LLMs。具体而言,我们提出了一个有毒信号检测器——一种内部自我识别机制,并配以系统化的干预过程,将有毒文本转化为其无毒对应版本。这一迭代过程产生了一个对比解毒数据集,用于微调模型,增强其生成安全且连贯文本的能力。在 DetoxLLM 和 ParaDetox 等基准数据集上的实验表明,我们的方法在保持语义保真度的同时,取得了优于最先进方法的解毒性能。通过消除对人工干预或外部组件的需求,本文揭示了 LLMs 内在的自我解毒能力,为减轻有害内容生成提供了一种一致且有效的方法。最终,我们的发现强调了真正自我调节语言模型的潜力,为更负责任、更符合伦理的文本生成系统铺平了道路。
引用
@article{arxiv.2601.11776,
title = {Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models},
author = {Kaituo Zhang and Zhimeng Jiang and Na Zou},
journal= {arXiv preprint arXiv:2601.11776},
year = {2026}
}