大型语言模型中气候错误信息的遗忘
计算与语言
2024-05-31 v1
摘要
关于气候变化的错误信息是应对人类最严重威胁之一的关键障碍。本文研究了大型语言模型(LLMs)在气候信息方面的事实准确性。使用真/假标注的问答数据对LLMs进行微调和评估,比较开源模型在气候变化问题上生成真实回答的能力。我们研究了故意用虚假气候信息投毒模型的可检测性,发现这种投毒可能不会影响模型在其他领域的回答准确性。此外,我们比较了遗忘算法、微调和检索增强生成(RAG)在使LLMs在气候变化主题上事实基础化方面的有效性。我们的评估表明,遗忘算法对于细微的概念性主张是有效的,尽管先前的研究表明它们在隐私背景下无效。这些见解旨在指导开发更事实可靠的LLMs,并强调需要额外工作来保护LLMs免受错误信息攻击。
引用
@article{arxiv.2405.19563,
title = {Unlearning Climate Misinformation in Large Language Models},
author = {Michael Fore and Simranjit Singh and Chaehong Lee and Amritanshu Pandey and Antonios Anastasopoulos and Dimitrios Stamoulis},
journal= {arXiv preprint arXiv:2405.19563},
year = {2024}
}