中文

Baby Bear:寻找标量注释的合适评级尺度

机器学习 2024-08-20 v1 人机交互

摘要

我们的目标是为大量元素高效分配标量评级。例如,"这篇产品评论是多少正面或负面?"在样本量较小时,先前的工作主张使用最差尺度(Best Worst Scaling,BWS)作为比直接的有序标注("Likert 量表")更稳健的方法。我们首先引入 IBWS,通过迭代收集最差尺度标注, resulting in robustly ranked crowd-sourced data。虽然有效,但 IBWS 对大规模任务来说过于昂贵。使用 IBWS 作为理想结果,我们评估了各种直接评估方法,以确定既成本效益高又与大规模 BWS 标注策略高度相关的方法。最后,我们在对话和情感领域展示了这些标注如何支持稳健的学习排序模型。

关键词

引用

@article{arxiv.2408.09765,
  title  = {Baby Bear: Seeking a Just Right Rating Scale for Scalar Annotations},
  author = {Xu Han and Felix Yu and Joao Sedoc and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2408.09765},
  year   = {2024}
}