中文

大语言模型的双用途困境:赋能伦理能力会降低实用性吗?

计算与语言 2025-02-28 v2 人工智能

摘要

近年来,人们致力于在各个领域提升大语言模型(LLM)的性能,同时也关注其伦理影响。然而仍有一个关键挑战被大大低估:大语言模型必须在出于安全考虑拒绝有害请求,和提供合法请求以保证实用性之间取得平衡。本文提出一种基于直接偏好优化(DPO)的对齐框架,通过解决伦理与实用性之间的权衡,在化学领域应用作为案例,实现更好的整体性能。我们的对齐管道采用GPT辅助的三阶段数据生成方案,其中创建了LibraChemQA数据集,包含31.6k个三元组实例。通过在数据生成过程中引入创新的平衡种子,该框架系统性地考虑了合法和非法请求。该框架还引入了一种重述机制,用于高效数据增强,从而增强模型的化学理解能力。我们进一步开发了一种新型混合评估方案,利用LLM评判器对安全性和实用性进行精确评估。实验结果表明,我们的模型在综合考虑安全性和实用性时表现显著提升——相较于Claude-3、GPT-4o和LLaMA-3,分别提升了13.44%、7.16%和7.10%。本文最后我们测试DeepSeek-R1在我们的基准测试上的结果,揭示了该高度赞誉的模型所引发的严重伦理问题。我们指出,DeepSeek-R1以及其他从其它模型蒸馏的模型所采用的长链式思维(CoT)推理过程,在面对用户时会引入显著的伦理漏洞。

关键词

引用

@article{arxiv.2501.13952,
  title  = {The Dual-use Dilemma in LLMs: Do Empowering Ethical Capacities Make a Degraded Utility?},
  author = {Yiyi Zhang and Xingyu Chen and Kexin Chen and Yuyang Du and Xilin Dang and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2501.13952},
  year   = {2025}
}