中文

SIG:基于提示生成的文学作品中说话人识别

计算与语言 2024-02-20 v2 机器学习

摘要

识别叙事中引语的说话人是文学分析中的一项重要任务,其挑战性场景包括针对未见说话人的域外推断,以及周围上下文中没有提及说话人的非显式情况。在这项工作中,我们提出了一种简单有效的方法 SIG,这是一种基于生成的方法,它根据设计的提示模板将任务和引语输入 verbalize(转化为文本描述),从而能够轻松集成其他辅助任务以进一步增强说话人识别性能。预测既可以来自模型的直接生成,也可以由每个说话人候选者的最高生成概率确定。基于我们的方法设计,SIG 支持域外评估,并实现了能够接受任何形式候选输入的开放世界分类范式。我们在该任务最大的数据集 PDNC 上进行了跨域评估和域内评估,实证结果表明 SIG 优于以往设计复杂的基线方法以及零样本 ChatGPT,特别是在那些困难的非显式场景中,提升幅度高达 17%。在另一个数据集 WP 上的额外实验进一步证实了 SIG 的有效性。

关键词

引用

@article{arxiv.2312.14590,
  title  = {SIG: Speaker Identification in Literature via Prompt-Based Generation},
  author = {Zhenlin Su and Liyan Xu and Jin Xu and Jiangnan Li and Mingdu Huangfu},
  journal= {arXiv preprint arXiv:2312.14590},
  year   = {2024}
}

备注

Accepted to AAAI 2024