“我从没说过那个”:一个关于回复清晰度分类的数据集、分类体系与基线
计算与语言
2024-09-24 v1
摘要
公开演讲中的含糊其辞与模棱两可是被充分研究的语篇现象,尤其在政治学和政治访谈分析中。受关于含糊其辞的完善理论的启发,我们旨在利用大型语言模型和人类专业知识,解决从政治访谈中提取的问题中与之密切相关的回复清晰度问题。为此,我们引入了一种新的分类体系,用于构建检测和分类回复清晰度的任务,以及一个相应的清晰度分类数据集,该数据集由从政治访谈中提取并据此标注的问答对组成。我们提出的两级分类体系根据对给定问题提供的信息来评估回复的清晰度(高层级),并提供了与不清晰、模棱两可的回复相关的回避技巧的细粒度分类体系(低层级)。我们结合 ChatGPT 和人类标注者,从政治访谈中收集、验证并标注离散的 QA 对,用于我们新引入的回复清晰度任务。我们提供了详细的分析,并在不同的模型架构、规模和适配方法上进行了多项实验,以获取见解并在所提出的数据集和任务上建立新的基线。
引用
@article{arxiv.2409.13879,
title = {"I Never Said That": A dataset, taxonomy and baselines on response clarity classification},
author = {Konstantinos Thomas and Giorgos Filandrianos and Maria Lymperaiou and Chrysoula Zerva and Giorgos Stamou},
journal= {arXiv preprint arXiv:2409.13879},
year = {2024}
}
备注
Accepted at Findings of EMNLP 2024