中文

衡量与改进大型语言模型的说服力

计算与语言 2024-10-08 v2 计算机视觉与模式识别

摘要

大型语言模型正在越来越多地被用于涉及生成供人类消费内容(例如营销)并直接与人类交互(例如通过聊天机器人)的工作流程中。能够生成可验证说服信息的系统为社会带来了机遇和挑战。一方面,这类系统可能积极影响广告和社会公益领域,如针对毒品成瘾等问题;另一方面,可能被用于传播错误信息并塑造政治意见。为了引导大型语言模型对社会的影响,我们需要开发系统来衡量和基准测试其说服能力。基于此动机,我们引入 PersuasionBench 和 PersuasionArena,这是第一个大规模基准和竞技场,包含衡量生成模型说服能力的多个任务。我们调查了大型语言模型认识并利用哪些语言模式以帮助生成更具说服力的语言。我们的发现表明,大型语言模型的说服力与模型规模呈正相关,但更小的模型也能被训练出超过更大模型的说服能力。值得注意的是,使用合成和自然数据集进行针对性训练显著提升了更小模型的说服能力,挑战了与规模相关的假设。我们的发现对模型开发者和政策制定者都有重要启示。例如,欧盟 AI 法案和加州 SB-1047 旨在基于浮点运算数量来监管 AI 模型,我们展示了这类简单指标本身无法捕捉 AI 对社会影响的完整范围。我们邀请社区探索和贡献 PersuasionArena 和 PersuasionBench,地址为 https://bit.ly/measure-persuasion,以推动对 AI 驱动说服及其社会影响的理解。

关键词

引用

@article{arxiv.2410.02653,
  title  = {Measuring and Improving Persuasiveness of Large Language Models},
  author = {Somesh Singh and Yaman K Singla and Harini SI and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2410.02653},
  year   = {2024}
}