当众包遇上人格设定:构建大规模开放域人格对话语料库
计算与语言
2023-04-04 v1
摘要
构建自然语言数据集需要谨慎,因为词语语义易受细微文本改动或标注概念定义的影响。这种倾向在问答和对话生成等生成式任务中可见,在创建基于分类的语料库(如主题分类或情感分析)的任务中亦如此。开放域对话涉及两名或更多众包工作者自由谈论任意话题,收集此类数据尤为困难,原因有二:1)出于隐私考虑,数据集应被“精心构建”而非“直接获取”;2)付费创建此类对话可能与众包工作者在真实场景中的行为不同。本研究中,我们在创建大规模开放域人格对话语料库时应对这些问题,其中人格意指对话由若干具有固定人格的演员与来自未指定人群的用户的众包工作者进行。
引用
@article{arxiv.2304.00350,
title = {When Crowd Meets Persona: Creating a Large-Scale Open-Domain Persona Dialogue Corpus},
author = {Won Ik Cho and Yoon Kyung Lee and Seoyeon Bae and Jihwan Kim and Sangah Park and Moosung Kim and Sowon Hahn and Nam Soo Kim},
journal= {arXiv preprint arXiv:2304.00350},
year = {2023}
}
备注
Presented at HCOMP 2022 as Works-in-Progress