中文

通过虚构作品的人物画像评估大型语言模型的人物理解能力

计算与语言 2024-10-10 v3

摘要

大型语言模型(LLMs)展现出了令人瞩目的性能,并催生了众多 AI 应用,其中角色扮演智能体(RPAs)尤为受欢迎,尤其是针对虚构人物的角色扮演。这些 RPAs 的前提在于 LLMs 理解虚构作品人物的能力。以往的评估工作通过基础分类任务或特征模仿来衡量这种能力,未能捕捉 LLMs 细致的人物理解能力。在本文中,我们提出通过人物画像任务来评估 LLMs 的人物理解能力,即从相应材料中总结人物画像,这是 RPA 开发中广泛采用但研究不足的实践。具体而言,我们由文学专家构建了 CroSS 数据集,并通过将生成的人物画像与真实参考进行比较以及评估其在下游任务中的适用性来对其进行评估。我们的实验涵盖了多种摘要生成方法和 LLMs,取得了有希望的结果。这些结果有力地验证了 LLMs 的人物理解能力。资源可在 https://github.com/Joanna0123/character_profiling 获取。

关键词

引用

@article{arxiv.2404.12726,
  title  = {Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works},
  author = {Xinfeng Yuan and Siyu Yuan and Yuhan Cui and Tianhe Lin and Xintao Wang and Rui Xu and Jiangjie Chen and Deqing Yang},
  journal= {arXiv preprint arXiv:2404.12726},
  year   = {2024}
}

备注

EMNLP 2024 camera-ready