中文

大语言模型能理解并可通过情感刺激增强

计算与语言 2023-11-14 v7 人工智能 人机交互

摘要

情商显著影响我们的日常行为与互动。尽管大语言模型(LLMs)日益被视为迈向通用人工智能的一步,在众多任务中展现出令人印象深刻的性能,但 LLMs 是否能真正掌握心理情感刺激仍不确定。理解并回应情感线索使人类在问题解决中具有独特优势。在本文中,我们迈出探索 LLMs 理解情感刺激能力的第一步。为此,我们首先使用多种 LLMs(包括 Flan-T5-Large、Vicuna、Llama 2、BLOOM、ChatGPT 和 GPT-4)在 45 个任务上开展自动实验。我们的任务涵盖确定性与生成式应用,代表全面的评估场景。我们的自动实验表明,LLMs 具备情商理解能力,且其性能可通过情感提示(我们称之为“EmotionPrompt”,将原始提示与情感刺激结合)得到提升,例如,在 Instruction Induction 中相对性能提升 8.00%,在 BIG-Bench 中提升 115%。除那些可使用现有指标自动评估的确定性任务外,我们开展了有 106 名参与者的人工研究,以评估使用普通提示与情感提示的生成式任务质量。我们的人工研究结果表明,EmotionPrompt 显著提升了生成式任务的性能(在性能、真实性与责任性指标上平均提升 10.9%)。我们就 EmotionPrompt 对 LLMs 生效的原因及可能影响其性能的因素进行了深入讨论。我们主张 EmotionPrompt 开辟了探索人机-LLMs 交互跨学科知识的新途径。

关键词

引用

@article{arxiv.2307.11760,
  title  = {Large Language Models Understand and Can be Enhanced by Emotional Stimuli},
  author = {Cheng Li and Jindong Wang and Yixuan Zhang and Kaijie Zhu and Wenxin Hou and Jianxun Lian and Fang Luo and Qiang Yang and Xing Xie},
  journal= {arXiv preprint arXiv:2307.11760},
  year   = {2023}
}

备注

Technical report; updated the std error for human study; short version (v1) was accepted by LLM@IJCAI'23; 32 pages; more work: https://llm-enhance.github.io/