SPOT:用于检测线上对话中关键干预的标注法语语料库与基准
计算与语言
2026-03-10 v4 计算机与社会
摘要
我们介绍SPOT(Online Threads 中的停止点),第一个将社会学概念转化为可复现 NLP 任务的标注语料库。停止点是一类平常的关键干预,通过各种形式(讽刺、微妙的怀疑或片段化论点)暂停或引导在线讨论,这些形式常被反对 speech 或社交纠正等框架所忽视。我们将其操作化为二分类任务并提供可靠的标注指南。该语料库包含 43,305 条手动标注的法语 Facebook 评论,链接至被社交媒体用户标记为虚假信息的 URL,包含丰富的上下文元数据(文章、帖子、父评论、页面或群组,以及来源)。我们对 fine-tuned 编码模型(CamemBERT)和 instruction-tuned LLM 在各种提示策略下的表现进行基准测试。结果表明,fine-tuned 编码器在 F1 分数上比 prompted LLM 高出超过 10 个百分点,确认了监督学习在非英语社交媒体任务中的重要性。进一步地,将上下文元数据纳入模型可提升编码器的 F1 分数从 0.75 提升至 0.78。我们发布了匿名化数据集,以及标注指南和代码,以促进透明度和可复现研究。
引用
@article{arxiv.2511.07405,
title = {SPOT: An Annotated French Corpus and Benchmark for Detecting Critical Interventions in Online Conversations},
author = {Manon Berriche and Célia Nouri and Chloée Clavel and Jean-Philippe Cointet},
journal= {arXiv preprint arXiv:2511.07405},
year = {2026}
}