中文

探索指令调优对 LLM 易受误导性信息影响的作用

计算与语言 2025-07-25 v1

摘要

指令调优提高了大型语言模型 (LLM) 遵循用户指令的准确性,改善了可用性,同时减少了有害输出。然而,这一过程可能增加模型对用户输入的依赖,潜在导致其无过滤地接受误导性信息并生成幻觉。现有研究主要表明 LLM 对与其参数知识相矛盾的外部信息具有敏感性,但针对指令调优对这一现象直接影响的研究仍寡言。本研究探讨了指令调优对 LLM 易受误导性信息影响的作用。我们的分析表明,指令调优后的 LLM 在误导性信息由用户提供时更容易接受误导。与基线模型比较显示,指令调优增加了对用户提供信息的依赖,将易受性从助手角色转移到用户角色。此外,我们进一步探讨了影响误导性信息易受性的其他因素,包括用户在提示结构中的角色、误导性信息的长度以及系统提示中警告的存在。我们的发现凸显了系统性方法的必要性,以缓解指令调优的意外后果,并提高 LLM 在实际应用中的可靠性。

关键词

引用

@article{arxiv.2507.18203,
  title  = {Exploring the Impact of Instruction-Tuning on LLM's Susceptibility to Misinformation},
  author = {Kyubeen Han and Junseo Jang and Hongjin Kim and Geunyeong Jeong and Harksoo Kim},
  journal= {arXiv preprint arXiv:2507.18203},
  year   = {2025}
}

备注

ACL 2025 Main Accepted