JiraiBench:用于评估大语言模型检测人类自毁行为内容的双语基准数据集
计算与语言
2026-01-27 v3 计算机与社会
摘要
本文介绍了 JiraiBench,即首个针对评估大语言模型在中文和日文社交社区中检测自毁内容有效性的双语基准数据集。本数据集聚焦于跨国的“Jirai”(雷区)在线亚文化,涵盖包括药物过量、饮食失调和自伤等多种自毁行为形式。我们提出了综合性的评估框架,纳入语言和文化维度。该数据集包含 10,419 条中文帖子和 5,000 条日文帖子,沿三个行为类别进行多维标注,实现了显著的标注者间一致性。针对四个最先进模型的实验评估揭示了根据指令语言产生的性能存在显著差异,日文提示在处理中文内容时意外地优于中文提示。这一新兴的跨文化迁移现象表明,文化亲近性有时会超过语言相似性在检测任务中的作用。针对微调模型的跨语言迁移实验进一步表明,在无需显式目标语言训练的情况下,这些语言系统之间可以实现知识迁移。这发现了面向多语言内容监控和开发更有效检测系统的必要性,为在脆弱在线社区中考虑文化背景提供了实证依据。
引用
@article{arxiv.2503.21679,
title = {JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community},
author = {Yunze Xiao and Tingyu He and Lionel Z. Wang and Yiming Ma and Xingyu Song and Xiaohang Xu and Mona Diab and Irene Li and Ka Chung Ng},
journal= {arXiv preprint arXiv:2503.21679},
year = {2026}
}
备注
20 pages, 1 figures