模型间误导性评估
计算与语言
2024-05-24 v1 人工智能
摘要
当高度能力的语言模型能够产生误导性输出时,其可信度将受到威胁。此外,当模型易受欺骗时,这会削弱其可靠性。本文引入一种方法来调查复杂的模型间误导场景。我们创建了一个包含超过10,000个误导性解释的数据集,通过要求Llama-2 7B、13B、70B和GPT-3.5为MMLU中的问题提供错误答案的理由。我们发现,当模型读取这些解释时,所有模型都会受到显著误导。令人担忧的是,所有模型在误导他人方面都很成功,而更强大的模型仅稍微更好地抵抗了误导。我们建议发展检测和抵抗欺骗的技术。
引用
@article{arxiv.2405.12999,
title = {An Assessment of Model-On-Model Deception},
author = {Julius Heitkoetter and Michael Gerovitch and Laker Newhouse},
journal= {arXiv preprint arXiv:2405.12999},
year = {2024}
}
备注
Accepted at Secure and Trustworthy Large Language Models Workshop at ICLR 2024