中文

口语叙事的 topical 分割:以大屠杀幸存者证词为测试用例

计算与语言 2022-12-06 v2 机器学习

摘要

topical 分割任务已被充分研究,但以往工作多在有结构、定义明确的片段背景下处理,例如分段为段落、章节,或分割源自多源的文本。我们处理对连续(口语)叙事的分割任务,这带来了迄今未解决的挑战。作为一个测试用例,我们处理以英语给出的大屠杀幸存者证词。除了为 Holocaust 研究研究这些证词的重要性外,我们认为它们为 topical 分割提供了一个有趣的测试用例,因其非结构的表层、相对丰富性(已收集数万份此类证词)以及所覆盖的相对受限领域。我们假设片段间的边界点对应于边界前后句子间的低互信息。基于该假设,我们探索了一系列算法途径,建立在以往使用生成式贝叶斯建模与最先进神经机制的分割工作之上。与人工标注的参考相比,我们发现所开发的方法相较以往工作有显著改进。

关键词

引用

@article{arxiv.2210.13783,
  title  = {Topical Segmentation of Spoken Narratives: A Test Case on Holocaust Survivor Testimonies},
  author = {Eitan Wagner and Renana Keydar and Amit Pinchevski and Omri Abend},
  journal= {arXiv preprint arXiv:2210.13783},
  year   = {2022}
}