中文

SLAyiNG:面向酷语言处理的探索

计算与语言 2025-09-23 v1

摘要

了解俚语是 LLM 在用户交互中具有理想特征的关键,因为俚语往往反映个体的社会身份。已有工作在非正式语言处理领域定义并构建了诸如检测和识别俚语等任务的基准。本文聚焦酷语言俚语。酷语言俚语可能被误判为仇恨言论,或在用户交互中引发负面反应。迄今为止,针对酷语言俚语的研究工作并未专注于此领域,尤其是酷语言俚语的检测和处理尚未得到充分评估,原因在于缺乏高质量的标注基准。为填补这一空白,我们构建 SLAyiNG,这是第一个包含来自字幕、社交媒体帖子和播客节目中经标注的酷语言俚语数据集,反映真实世界的使用情境。我们描述了数据策展过程,包括收集俚语词汇和定义、爬取反映这些词汇使用场景的示例,以及正在进行的标注过程。作为初步结果,我们计算了人类标注者和 OpenAI 模型 o3-mini 之间的平均 Krippendorff's alpha 为 0.746,评估了 sense disambiguation 任务的性能。我们认为,虽然最先进的推理模型可作为预筛选工具,但酷语言数据的复杂性和常常敏感的特性仍需专家和社区驱动的标注努力。

关键词

引用

@article{arxiv.2509.17449,
  title  = {SLAyiNG: Towards Queer Language Processing},
  author = {Leonor Veloso and Lea Hirlimann and Philipp Wicke and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2509.17449},
  year   = {2025}
}

备注

To be presented at Queer in AI @ NeurIPS 2025 (non-archival)