基于人类可解释归因分段的混合对抗文本AI检测框架
计算与语言
2026-01-06 v2
摘要
在先进大语言模型(LLM)时代,人类与AI生成文本之间的边界正变得越来越模糊。我们解决的是混合作者文本的分段问题,即识别文本中作者从人类转向AI或反之的转换点的挑战,这一问题对于保障内容真实性、建立信任并实现人类监督具有重要意义。我们引入一种新框架,称为Info-Mask,用于混合作者检测,通过整合体态线索、困惑驱动信号和结构化边界建模来准确分割协作人类-AI内容。为评估系统在对抗扰动下的鲁棒性,我们构建并发布了一个对抗基准数据集Mixed-text Adversarial setting for Segmentation(MAS),旨在探讨现有检测器的极限。除了分割准确度,我们引入人类可解释归因(HIA)叠加层,突出显示体态特征如何影响边界预测,并进行小规模人类研究评估其实用性。在多个架构上,Info-Mask在对抗条件下在跨度级别显著提升了鲁棒性,建立了新的基准,同时揭示了仍存挑战。我们的发现凸显了在对抗鲁棒、可解释混合作者检测方面的潜力与局限,以及这对人类-AI协作中的信任与监督的影响。
引用
@article{arxiv.2512.04838,
title = {DAMASHA: Detecting AI in Mixed Adversarial Texts via Segmentation with Human-interpretable Attribution},
author = {L. D. M. S. Sai Teja and N. Siva Gopala Krishna and Ufaq Khan and Muhammad Haris Khan and Atul Mishra},
journal= {arXiv preprint arXiv:2512.04838},
year = {2026}
}
备注
EACL 2026 Findings