FinChat:面向芬兰语日常话题聊天对话的语料库与评测设置
计算与语言
2020-08-20 v1
摘要
创建开放域聊天机器人需要大量对话数据及相关的基准任务来对其进行评测。标准化评测任务对于建立模型开发的自动评测指标至关重要;否则,模型比较将需要耗费资源的真人评测。尽管聊天机器人挑战赛近期已为英语提供了大量此类资源,其他语言的资源尚不可用。在本工作中,我们为芬兰语开放域聊天机器人研究提供了起点。我们描述了构建并公开芬兰语聊天对话语料库 FinChat 的收集工作。FinChat 包含不同年龄人群关于七个话题的非脚本对话。利用该语料库,我们还构建了用于芬兰语聊天机器人开发的基于检索的评测任务。我们观察到,在对话语料库上训练的现成聊天机器人模型,在依据自动指标选择正确答案时表现不优于随机猜测,而人类完成同一任务几乎完美。类似地,在人工评测中,聊天机器人从评测集生成的问题回复大多被标记为不连贯。因此,FinChat 提供了一个具有挑战性的评测集,旨在促进芬兰语聊天机器人的开发。
引用
@article{arxiv.2008.08315,
title = {FinChat: Corpus and evaluation setup for Finnish chat conversations on everyday topics},
author = {Katri Leino and Juho Leinonen and Mittul Singh and Sami Virpioja and Mikko Kurimo},
journal= {arXiv preprint arXiv:2008.08315},
year = {2020}
}