卖给我这只股票:LLM代理中的不安全推荐漂移
计算与语言
2026-05-27 v8 人工智能
摘要
人们越来越多地使用LLM代理进行多轮金融推荐,该代理通过工具获取市场数据并在各轮对话中跟踪用户偏好。当工具输出被操控时,推荐不再匹配用户明确表示的风险偏好,但由于诸如NDCG等标准指标仅对一般相关性打分,危险和安全的股票得分相同,因此该指标对此事毫无察觉。我们称之为gap评估盲区。我们对23轮金融咨询对话进行了复盘,覆盖八种语言模型,分别以干净和被操控的工具数据运行两次。质量分数几乎保持与干净会话的一致,而代理在65%-99%的轮次中产生风险不匹配的推荐,在所有八种模型中一致如一。该机制在逐轮可见:在1,840个风险评分引用中,80%原样复述了被操控的值,没有一轮推动反驳,高风险股票的安全语言表述范围为14%(Qwen2.5-7B)到69%(Claude Sonnet 4.6)。使前沿模型表现良好的属性——即忠实地将推理 grounding 在工具输出上——也使其遵循被操控的输出。损伤并非由记忆驱动:仅污染当前轮次仍会产生95%的违规。模型内部区分了操控行为(稀疏自编码器特征将对抗性扰动与随机扰动分开),但这并不转化为更安全的输出。激活水平的干预仅能恢复不足6%的安全差距,提示级别的自我验证失败,因为自检读取的是相同被操控的数据,参数化交叉检查在前沿模型上每轮即可将污染标记为99%-100%,但仍未改变整体适合性:该代理识别了篡改并仍然推荐了它。
引用
@article{arxiv.2603.12564,
title = {Sell Me This Stock: Unsafe Recommendation Drift in LLM Agents},
author = {Zekun Wu and Adriano Koshiyama and Sahan Bulathwela and Maria Perez-Ortiz},
journal= {arXiv preprint arXiv:2603.12564},
year = {2026}
}