SuiChat-CN:中文群聊语境自杀风险评估基准
人工智能
2026-05-28 v1
摘要
自杀是一个严峻的全球公共卫生挑战,每年导致约72万人死亡,亟需及时有效的预防策略。现有的计算研究主要关注基于帖子的社交媒体平台(如Twitter和微博),而像Telegram这样的即时通讯环境则鲜有探索。然而,群聊带来了独特的挑战:消息简短、碎片化、多方参与,且通常依赖于隐晦或特定文化的表达,这使得孤立的帖子级分析不够充分。我们引入了SuiChat-CN,一个用于语境自杀风险评估的中文群聊基准。我们收集了公开的Telegram群聊数据,通过信号词提取和双向上下文扩展构建连贯的对话片段,并采用经专家验证、LLM辅助的范式对用户风险等级进行标注。SuiChat-CN包含来自1406名用户的13312个上下文片段,涵盖了258228条原始聊天消息。使用PLM和超过40个LLM进行的广泛实验表明,上下文信息对于可靠的风险评估至关重要,而微调和部分上下文评估进一步揭示了多方对话中早期检测的挑战。出于伦理和敏感性考虑,该数据集不公开发布,但将根据合理请求与经认可的心理健康和自杀预防研究机构共享。
引用
@article{arxiv.2605.27911,
title = {SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats},
author = {Xiangyu Wang and Zhiwei Yu and Chengze Du and Dingchang Wang and Yuhan Ye and Fangyu Zheng},
journal= {arXiv preprint arXiv:2605.27911},
year = {2026}
}