中文

在线平台与 AI 系统中的有害行为:关于需求、挑战、缓解措施及未来方向的综述

计算机与社会 2025-10-01 v1 人工智能 计算与语言 人机交互 社会与信息网络

摘要

数字通信系统的演变以及在线平台的设计,无意中促进了有害行为的潜意识传播。引发对有害行为的反应性回应。在线内容和人工智能系统中的有害行为已成为全球个人和集体福祉的严重挑战。其危害远超我们所意识到的。以语言、图像和视频形式表达的有害行为,根据使用情境的不同,可被解释为各种方式。因此,建立全面的分类体系至关重要,以在积极方式检测和缓解在线内容、人工智能系统和/或大型语言模型中的有害行为。全面理解有害行为很可能有助于设计实用解决方案来检测和缓解有害行为。已发表文献中的分类仅聚焦于这一复杂问题的有限数量方面,呈现出对有害行为的反应性策略模式。本综述尝试从 various 角度生成有害行为的全面分类体系。本综述提供了一种整体方法,通过理解人工智能时代社会所面临的情境和环境来解释有害行为。本综述总结了与有害行为相关的数据集和研究,涵盖大型语言模型、社交媒体平台及其他在线平台,重点关注英文语言中的文本模式。最后,我们基于数据集、缓解策略、大型语言模型、适应性、可解释性和评估,提出了有害行为缓解的研究空白。

关键词

引用

@article{arxiv.2509.25539,
  title  = {Toxicity in Online Platforms and AI Systems: A Survey of Needs, Challenges, Mitigations, and Future Directions},
  author = {Smita Khapre and Melkamu Abay Mersha and Hassan Shakil and Jonali Baruah and Jugal Kalita},
  journal= {arXiv preprint arXiv:2509.25539},
  year   = {2025}
}