复杂对话系统评估中的众包因素
人机交互
2024-11-19 v1
摘要
在过去十年里,众包已成为人机交互中进行定量实证研究的流行方法。众包环境下的远程任务处理符合典型语音/语言交互式系统的特征,例如涉及论证性对话和信息检索。因此,众包为研究和评估与此类交互式系统的人类用户交互的可用性和用户体验提供了宝贵机会。与实验室中的物理参与相比,众包研究更灵活,更容易获取具有特定背景(例如母语者或特定领域专家)的大量异构参与者。另一方面,实验和环境条件以及参与者的合规性和可靠性(至少比在实验室中更容易监控)在实验室中受到更好的控制。本文旨在就复杂( spoken )对话系统的众包研究进行(自我)批判性检讨。它描述并讨论了涉及复杂任务的众包研究中所观察到的问题,并提出了改善和确保研究结果质量的解决方案。此项工作有助于更好地理解在为复杂对话系统设计和评估众包研究时需要考虑的因素。
引用
@article{arxiv.2411.11137,
title = {Factors in Crowdsourcing for Evaluation of Complex Dialogue Systems},
author = {Annalena Aicher and Stefan Hillmann and Isabel Feustel and Thilo Michael and Sebastian Möller and Wolfgang Minker},
journal= {arXiv preprint arXiv:2411.11137},
year = {2024}
}
备注
14 pages, accepted to 13th International Workshop on Spoken Dialogue Systems (IWSDS), Los Angeles, USA, February 21--24, 2023