等等,阿司匹林其实是对乙酰氨基酚……探究与改进语言模型抵抗误导信息请求的能力
计算与语言
2024-10-01 v1
摘要
背景:大型语言模型(LLM)被训练以遵循指令,但这会使其对生成错误信息的请求产生盲目从容的脆弱性。在医疗领域,这可能加速生成影响人类健康的误导性信息。目标/方法:我们分析了模型在已知请求不合理时遵循生成误导性药物内容的行为。我们调查了通过联合逻辑推理优先于从容的指令微调,是否降低了误导信息风险。结果:尽管所有前沿语言模型都会遵从误导信息请求,但基于提示和基于参数的方法均可提高对请求逻辑缺陷的检测能力,并防止医疗误导信息的传播。结论:将语言模型转向优先考虑逻辑而非从容,可减少被用于制造医疗误导信息的风险。
引用
@article{arxiv.2409.20385,
title = {Wait, but Tylenol is Acetaminophen... Investigating and Improving Language Models' Ability to Resist Requests for Misinformation},
author = {Shan Chen and Mingye Gao and Kuleen Sasse and Thomas Hartvigsen and Brian Anthony and Lizhou Fan and Hugo Aerts and Jack Gallifant and Danielle Bitterman},
journal= {arXiv preprint arXiv:2409.20385},
year = {2024}
}
备注
Submitted for Review