利用心理语言学与道德基础理论分析开源软件交流中的毒性
软件工程
2025-01-28 v3
摘要
研究表明,有毒行为会导致贡献者离开,并阻碍新手(尤其是来自代表性不足群体的新手)参与开源软件(OSS)项目。因此,有毒语言的检测在 OSS 协作与包容性中起着至关重要的作用。现成的毒性检测器在应用于 OSS 交流时效果不佳,这是由于这些渠道中观察到的毒性具有独特性质(例如,在 GitHub 上比在 Reddit 或 Twitter 上更频繁地观察到特权感和傲慢)。在本文中,我们研究了一种基于机器学习的方法,用于自动检测 OSS 中的有毒交流。我们利用心理语言学词典和道德基础理论来分析两类 OSS 交流渠道中的毒性:问题评论和代码审查。我们的评估表明,与现有的特定领域毒性检测器相比,我们的方法可以实现显著的性能提升(F1 分数提高达 7%)。我们发现,使用道德价值观作为特征比语言线索更有效,在识别代码审查数据中的有毒实例时 F1 值达到 67.50%,在问题评论中达到 64.83%。尽管检测准确性尚远不够精确,但这一改进证明了将道德和心理语言学特征整合到毒性检测模型中的潜力。这些发现强调了特定上下文模型的重要性,这些模型考虑了 OSS 内独特的交流风格,其中人际和价值驱动的语言动态与一般社交媒体平台明显不同。未来的工作可以侧重于完善这些模型以进一步提高检测准确性,可能通过纳入社区特定规范和对话上下文来更好地捕捉 OSS 环境中有毒性的细微表达。
引用
@article{arxiv.2412.13133,
title = {Analyzing Toxicity in Open Source Software Communications Using Psycholinguistics and Moral Foundations Theory},
author = {Ramtin Ehsani and Rezvaneh Rezapour and Preetha Chatterjee},
journal= {arXiv preprint arXiv:2412.13133},
year = {2025}
}