中文

当代理人说服时:LLM中的修辞生成与缓解

人工智能 2026-04-02 v2

摘要

尽管LLM-based代理人在开放环境中发挥着广泛的益处,但可能被用于生成操纵性材料。本 study 任务LLMs产生宣传目标,并使用两个特定于领域的模型分析其输出:一个将文本分类为宣传或非宣传,另一个检测宣传的修辞技术(例如,引言情感语言、恐惧诉求、旗帜 waving、贬称)。我们的发现表明,受提示时,LLMs表现出宣传行为并运用多种修辞技术。我们也探讨了通过监督微调(SFT)、直接偏好优化(DPO)和ORPO(Odds Ratio Preference Optimization)进行缓解。我们发现,微调显著降低了其生成此类内容的倾向,ORPO最为有效。

关键词

引用

@article{arxiv.2603.04636,
  title  = {When Agents Persuade: Rhetoric Generation and Mitigation in LLMs},
  author = {Julia Jose and Ritik Roongta and Rachel Greenstadt},
  journal= {arXiv preprint arXiv:2603.04636},
  year   = {2026}
}

备注

Accepted to the ICLR 2026 Workshop on Agents in the Wild (AgentWild). 20 pages including appendix, 3 figures