无需人群的群体智慧:用于多元视角数据异步协商的苏格拉底式LLM
人机交互
2025-08-14 v1
摘要
数据标注是现代AI成功的基础,但众包数据集的聚合可能损害数据中多元视角的保留。困难和模糊的任务难以坍缩为单一标签。先前的研究表明,协商与讨论可以提升数据质量并保留多元视角——然而,通过众包平台进行的同步协商耗时且成本高昂。在本工作中,我们创建了一个基于大语言模型(LLM)的苏格拉底式对话系统,作为替代其他众包工作者的协商伙伴。针对两个任务(讽刺检测和关系检测)上的同步协商基准,我们的苏格拉底式LLM鼓励参与者考虑替代标注视角,根据需要更新其标签(并提高置信度),并在有真实标签的关系检测任务上取得了更高的标注准确性。定性结果表明,该代理的苏格拉底式方法有效鼓励了参与者给出有理有据的论证,且该干预措施广受好评。我们的方法为构建可扩展的系统奠定了基础,这些系统能够在生成更具代表性的数据集时保留个体视角。
引用
@article{arxiv.2508.09911,
title = {Wisdom of the Crowd, Without the Crowd: A Socratic LLM for Asynchronous Deliberation on Perspectivist Data},
author = {Malik Khadar and Daniel Runningen and Julia Tang and Stevie Chancellor and Harmanpreet Kaur},
journal= {arXiv preprint arXiv:2508.09911},
year = {2025}
}
备注
To appear at CSCW 2025