中文

BotEval:促进交互式人类评估

计算与语言 2024-07-26 v1

摘要

随着自然语言处理(NLP)模型的快速进步,语言模型被应用于越来越复杂的交互式任务,如谈判和对话 moderation。直接让人类评估员与这些 NLP 模型进行交互是充分评估此类交互式任务性能的关键。我们开发了 BotEval,一个易于自定义、开源的评估工具包,专注于在评估过程中启用人类与机器人之间的交互,而不是人类评估员对静态输入进行判断。BotEval 通过为各种复杂度的常见用例提供模板,并内置与流行众包平台的兼容性,在灵活性和用户友好性之间取得平衡。我们通过评估各种聊天机器人在对话式 moderation 效果方面的性能来展示 BotEval 的众多有用功能,并讨论 BotEval 与其他标注工具的不同之处。

关键词

引用

@article{arxiv.2407.17770,
  title  = {BotEval: Facilitating Interactive Human Evaluation},
  author = {Hyundong Cho and Thamme Gowda and Yuyang Huang and Zixun Lu and Tianli Tong and Jonathan May},
  journal= {arXiv preprint arXiv:2407.17770},
  year   = {2024}
}

备注

ACL 2024 SDT, 10 pages