中文

基于毒性关联图揭示多模态数据中的隐蔽有害内容:一种图基指标与可解释检测框架

机器学习 2026-02-04 v1 人工智能 多媒体

摘要

检测多模态数据的毒性内容仍是一个重要挑战,因为有害意义往往隐藏在看似良好的单个模态之下,只有在模态组合激活语义关联时才会显现。为此,我们提出一种基于毒性关联图(Toxicity Association Graphs, TAGs)的新型检测框架,系统性地建模看似无害实体与潜在有害意涵之间的语义关联。借助 TAGs,我们引入了首个量化隐蔽毒性指标——多模态毒性隐蔽性(Multimodal Toxicity Covertness, MTC),衡量有害多模态表达的隐蔽程度。通过将检测框架与 MTC 指标集成,我们的方法实现了对隐蔽毒性的精准识别,同时保持决策过程的完整可解释性,大幅提升了多模态毒性检测的透明度。为验证该方法,我们构建了 Covert Toxic Dataset,这是第一个专为捕捉高隐蔽性毒性多模态实例而设计的基准数据集。该数据集编码了细致的跨模态关联,为评估所提指标和检测框架提供了严格的测试平台。大量实验表明,我们的方法在低隐蔽性和高隐蔽性毒性情境下均优于现有方法,同时提供清晰、可解释且可审计的检测结果。我们的贡献推动了可解释多模态毒性检测的前沿进展,为未来基于上下文和可解释的方法奠定了基础。内容警告:本文包含可能令人 offense 或扰动的毒性多模态内容示例,建议读者自行判断。

关键词

引用

@article{arxiv.2602.03268,
  title  = {Unveiling Covert Toxicity in Multimodal Data via Toxicity Association Graphs: A Graph-Based Metric and Interpretable Detection Framework},
  author = {Guanzong Wu and Zihao Zhu and Siwei Lyu and Baoyuan Wu},
  journal= {arXiv preprint arXiv:2602.03268},
  year   = {2026}
}