中文

玩家游戏聊天中的利他行为检测:从对齐人类-人工智能定义到大规模高效标注

计算与语言 2025-08-11 v1 人工智能 计算机与社会

摘要

检测旨在肯定、支持或改善他人行为的文本沟通中的利他性,是信任和安全系统中一个新型且日益重要的挑战。与毒性内容检测不同,利他性缺乏明确的定义和标注数据,需新的标注和部署方法。我们提出了一个实用的方法,使可扩展的、高精度的利他内容分类在最小化人类标注 effort 和推理成本的同时实现。首先,我们识别了最佳的基于大语言模型的标注策略,采用小规模的人类标注示例。随后,我们引入人类-人工智能 refinement 循环,让标注员审查GPT-4与人类之间的高 disagreement 案例,以迭代澄清和扩充任务定义——这是类似利他性等新兴标注任务的关键步骤。该过程导致标签质量和定义对齐的改进。最后,我们使用GPT-4合成10000个高质量标签,并训练一个两阶段推理系统:轻量级分类器处理高置信度预测,而仅有约35%的模糊实例被升级到GPT-4o。该架构在推理成本降低约70%的同时实现高精度(约0.90)。我们的管道展示了如何通过针对性的人类-人工智能交互、谨慎的任务表述和面向部署的架构设计,从而解锁针对新型负责任AI任务的可扩展解决方案。

关键词

引用

@article{arxiv.2508.05938,
  title  = {Prosocial Behavior Detection in Player Game Chat: From Aligning Human-AI Definitions to Efficient Annotation at Scale},
  author = {Rafal Kocielnik and Min Kim and Penphob and Boonyarungsrit and Fereshteh Soltani and Deshawn Sambrano and Animashree Anandkumar and R. Michael Alvarez},
  journal= {arXiv preprint arXiv:2508.05938},
  year   = {2025}
}

备注

9 pages, 4 figures, 4 tables