中文

ActorMind:模拟人类演员推理的语音角色扮演

声音 2026-04-27 v2 人工智能

摘要

角色扮演正在引起越来越多的关注,因为它为人机交互提供了强大的基础,并促进了社会学研究。然而,现有工作仅限于文本模态,忽略了语音这一重要组成部分,限制了真正的角色扮演。为弥合这一差距,本文提出了ActorMindBench基准测试,并提出相应的推理框架,称为ActorMind。具体而言:(1)语音角色扮演使模型能够基于角色、场景和已 spoken dialogue 中的情境,交付具有个人化语言特征的自然响应。(2)ActorMindBench是一个分层基准,包含7,653条utterance级别内容、313个scene级别内容和6个角色级别内容。(3)ActorMind是一个即插即用、多智能体、链式思考风格的推理框架,模拟了演员在戏剧中如何表现。具体地,ActorMind首先通过Eye Agent阅读其分配的角色描述,然后通过Ear Agent理解上下文语音对话中的情感线索。随后,Brain Agent生成描述性情感状态,最后由Mouth Agent输出融合相应情感状态的脚本。实验结果表明,ActorMind在增强语音角色扮演方面效果显著。

关键词

引用

@article{arxiv.2604.11103,
  title  = {ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing},
  author = {Xi Chen and Wei Xue and Yike Guo},
  journal= {arXiv preprint arXiv:2604.11103},
  year   = {2026}
}