中文

基于元学习的人类语言异常检测:一种少样本方法

计算与语言 2025-07-29 v1 人工智能

摘要

我们提出了一个元学习框架,用于在标注数据有限的情况下检测跨多个领域的人类语言异常。语言中的异常(从垃圾邮件和假新闻到仇恨言论)由于其稀疏性和多变性而构成重大挑战。我们将异常检测视为一个少样本二分类问题,并利用元学习来训练能够跨任务泛化的模型。使用 SMS 垃圾邮件、COVID-19 假新闻和仇恨言论等领域的数据集,我们评估了模型在具有最少标注异常的未见任务上的泛化能力。我们的方法将情景训练与原型网络和领域重采样相结合,以快速适应新的异常检测任务。实证结果表明,我们的方法在 F1 和 AUC 分数上优于强基线。我们还发布了代码和基准,以促进少样本文本异常检测的进一步研究。

关键词

引用

@article{arxiv.2507.20019,
  title  = {Anomaly Detection in Human Language via Meta-Learning: A Few-Shot Approach},
  author = {Saurav Singla and Aarav Singla and Advik Gupta and Parnika Gupta},
  journal= {arXiv preprint arXiv:2507.20019},
  year   = {2025}
}

备注

15 pages. PyTorch code for few-shot anomaly detection using meta-learning is available upon request or can be shared via GitHub