中文

通过链式思维微调与对齐,提升 LLM 评判器效率——精炼输入限制

计算与语言 2025-01-23 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)已展现出在不同应用中发挥重要作用的强大能力,包括对话式 AI 产品。确保这些产品安全可靠,尤为关键,这需要缓解其针对恶意用户交互的脆弱性,以避免引发重大风险和声誉损失。本文我们系统研究了对不同大型语言模型的链式思维(Chain-of-Thought, CoT)响应进行微调和对齐的有效性。我们系统性地探索了各种调优方法,利用小规模训练数据将这些模型适配为代理防御机制,以检测恶意输入并提供判决依据,从而防止对话式智能体的被利用。我们严格评估了不同调优策略在面对多样化对抗性和恶意查询时的有效性与鲁棒性。实验结果表明,即便在数据资源有限的情况下,针对广泛的有害输入查询进行定制化对齐进程也具有潜力。这些技术显著提升了对话式 AI 系统的安全性,并为部署更安全可信的 AI 驱动交互提供了可行框架。

关键词

引用

@article{arxiv.2501.13080,
  title  = {Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment},
  author = {Melissa Kazemi Rad and Huy Nghiem and Andy Luo and Sahil Wadhwa and Mohammad Sorower and Stephen Rawls},
  journal= {arXiv preprint arXiv:2501.13080},
  year   = {2025}
}

备注

16 pages, 9 figures