使用大语言模型评估在线讨论中的贡献质量
人工智能
2024-08-23 v1 人机交互
摘要
讨论涉及参与者交换知识、论点和观点,已被证明能有效应对两极分化。斯坦福在线讨论平台促进了大规模讨论。它支持基于视频的在线小组讨论,遵循结构化议程,无需人工主持人。本文的数据来自多个讨论活动,包括一次与Meta在32个国家合作进行的活动,以及另一次与美国38所高等教育机构合作的活动。评估对话中贡献的质量对于衡量功能和干预措施的影响至关重要。传统上,这由人工标注员完成,既耗时又昂贵。我们使用一个大语言模型(LLM)与八名人工标注员一起,根据论证合理性、新颖性、对对话的扩展以及进一步扩展的潜力,对贡献进行评分,分数范围为1到5。标注员还需为其评分提供简要理由。以其他人工标注员的平均评分作为真实值,我们发现模型的表现优于单个标注员。虽然两名人工标注员的组合在评分论证合理性方面优于模型,而三名标注员的组合在所有四个指标上都优于模型,但模型仍具有竞争力。我们通过评估“助推”对讨论质量的影响,展示了自动质量评分的实用性。我们首先观察到,在长时间不活跃后进行的单独助推非常有效,能使个人在接下来30秒内请求发言的可能性增加65%。利用我们的自动质量评估,我们发现由助推引发的陈述的质量评分与未经助推的陈述相似,这表明助推能在不损失整体质量的情况下,在对话中产生更多想法。
引用
@article{arxiv.2408.11936,
title = {Estimating Contribution Quality in Online Deliberations Using a Large Language Model},
author = {Lodewijk Gelauff and Mohak Goyal and Bhargav Dindukurthi and Ashish Goel and Alice Siu},
journal= {arXiv preprint arXiv:2408.11936},
year = {2024}
}