中文

人类-LLM 混合文本答案聚合用于众包标注

计算与语言 2024-10-23 v1 人机交互 机器学习

摘要

众包标注的质量是一个关键问题。答案聚合是一种重要的解决方案。来自多个众包答案对同一实例的聚合结果是最终收集的标注,而非各个众包工作者的个人答案。最近,大型语言模型(LLM)在数据标注任务方面的能力吸引了研究者的注意。大多数现有研究主要关注单个众包工作者的平均性能;最近几项工作研究了在类别标签上进行聚合且 LLM 用作标签创建者的场景。然而,在文本答案上进行聚合以及 LLM 作为聚合器的角色尚未得到充分研究。本文我们研究 LLM 在众包文本答案聚合场景中作为聚合器的能力。我们提出了一种人类-LLM 混合文本答案聚合方法,并提出了创作者-聚合器多阶段(Creator-Aggregator Multi-Stage, CAMS)众包框架。我们基于公共众包数据集进行实验。结果表明,我们方法基于众包工作者和 LLM 的协作效果良好。

关键词

引用

@article{arxiv.2410.17099,
  title  = {Human-LLM Hybrid Text Answer Aggregation for Crowd Annotations},
  author = {Jiyi Li},
  journal= {arXiv preprint arXiv:2410.17099},
  year   = {2024}
}

备注

Accepted in EMNLP 2024