从自动化到协作:面向安全可信 NLP 的人机协同方法综述
计算与语言
2026-05-26 v1
摘要
大型语言模型在高风险 NLP 任务中广泛部署,但仍存在偏见、幻觉、对抗性脆弱性和不可靠泛化等风险。探针式审计揭示了模型行为中的不一致性。对抗文本生成揭示了鲁棒性差距,尤其是在资源较少的语言方面基准测试有限。企业文本到 SQL 设置暴露了在私有大规模数据库上验证输出的困难。人类监督对于探针验证、对抗验证和特定领域标注至关重要,但成本高昂且难以规模化。本综述检阅了最近的人机协同方法,这些方法将 NLP 从自动化转向协作,以实现安全可信。我们综述了人类专长如何支持审计、鲁棒性评估、数据构建和模型驾驶。我们的发现突显了可扩展的探针、可持续的鲁棒性基准、低资源环境以及私有系统治理之间的差距。我们概述了针对自适应审计、协作评估和可负责任部署的实用研究方向。
引用
@article{arxiv.2605.25226,
title = {From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP},
author = {Most. Sharmin Sultana Samu and MD. Tanvir Ahmed Seum and Md. Rakibul Islam},
journal= {arXiv preprint arXiv:2605.25226},
year = {2026}
}
备注
Preprint, manuscript under review