中文

RoleMRC:面向角色扮演与指令遵循的细粒度复合基准

计算与语言 2025-02-18 v1

摘要

角色扮演对于大语言模型(LLM)在保持角色身份及角色预定义能力限制的前提下遵循多样化指令至关重要。现有的角色扮演数据集主要致力于控制角色风格和知识边界,但忽视了在指令遵循情境下的角色扮演。我们引入一个细粒度角色扮演与指令遵循复合基准,命名为RoleMRC,包括:(1)理想角色与人类之间多轮对话,包括就给定段落进行的自由聊天或讨论;(2)角色扮演机器阅读理解,涉及根据段落可读性及角色能力进行响应、拒绝或尝试;(3)更复杂的情境,包含嵌套、多轮及优先级指令。最终的RoleMRC features 10.2k角色配置元池、37.9k精心综合的角色扮演指令以及1.4k测试样本。我们构建了一个管线,用于量化评估几主流LLM在细粒度角色扮演与指令遵循方面的能力,以及在我们数据上微调的模型。此外,对外部角色扮演数据集进行交叉评估确认,在RoleMRC上微调的模型在不损害通用角色扮演与推理能力的前提下提升指令遵循能力。我们还探测了不同能力在后微调LLM中的神经层激活图。我们提供RoleMRC、RoleMRC-mix及代码:https://github.com/LuJunru/RoleMRC。

关键词

引用

@article{arxiv.2502.11387,
  title  = {RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following},
  author = {Junru Lu and Jiazheng Li and Guodong Shen and Lin Gui and Siyu An and Yulan He and Di Yin and Xing Sun},
  journal= {arXiv preprint arXiv:2502.11387},
  year   = {2025}
}