中文

DSCD:面向大语言模型的自约束解码去宣扬

计算与语言 2025-10-16 v1

摘要

大语言模型 (LLMs) 的去宣扬仍是一个重要的研究挑战。现有的解码去宣扬方法均基于外部约束,需额外资源开销且会牺牲生成的流畅性。本工作提出一种新方法——带自约束解码的去宣扬 (DSCD),无需参数微调即可实现 LLM 去宣扬。DSCD 在输出生成过程中加强了安全层内部的下一个 token 分布,同时削弱了幻觉和有毒层的分布,从而有效降低毒性并提升输出安全性。DSCD 具备轻量级、高兼容性和即插即用特性, readily 集成到现有的去宣扬方法中以进一步提升性能。广泛的实验在代表性开源 LLMs 和公开数据集上验证了 DSCD 的有效性,表明其在去宣扬和生成流畅性方面均实现了最新 (SOTA) 性能,同时在效率上优于现有方法。这些结果凸显了 DSCD 作为一种实用且可扩展的更安全 LLM 部署解决方案的潜力。

关键词

引用

@article{arxiv.2510.13183,
  title  = {DSCD: Large Language Model Detoxification with Self-Constrained Decoding},
  author = {Ming Dong and Jinkui Zhang and Bolong Zheng and Xinhui Tu and Po Hu and Tingting He},
  journal= {arXiv preprint arXiv:2510.13183},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 MainConference