口语对话话语语用相似度判断数据集
计算与语言
2024-03-25 v1
摘要
话语间相似度的自动度量对于训练语音合成器、评估机器翻译以及评估学习者产出具有不可估量的价值。尽管存在语义相似度和韵律相似度的度量方法,但目前尚无语用相似度的度量方法。为了能够训练此类度量方法,我们开发了首个话语对之间语用相似度的人类判断数据集。每个话语对由一条从录制对话中提取的话语和该话语的重演构成。重演是在旨在创造不同程度相似性的各种条件下进行的。每个话语对由 6 至 9 名评判者在连续量表上进行评分。英语的平均评判者间相关系数高达 0.72,西班牙语为 0.66。我们在 https://github.com/divettemarco/PragSim 公开此数据。
引用
@article{arxiv.2403.14808,
title = {A Collection of Pragmatic-Similarity Judgments over Spoken Dialog Utterances},
author = {Nigel G. Ward and Divette Marco},
journal= {arXiv preprint arXiv:2403.14808},
year = {2024}
}
备注
LREC 2024