中文

用于讽刺检测的无分词模型

计算与语言 2025-05-05 v1

摘要

分词是大多数自然语言处理(NLP)流程中的基础步骤,但它也带来了词汇不匹配和集外词等问题。最近的研究表明,直接在字节或字符级别对原始文本进行操作的模型可以缓解这些限制。在本文中,我们评估了两种无分词模型 ByT5 和 CANINE 在社交媒体(Twitter)和非社交媒体(新闻标题)领域的讽刺检测任务上的表现。我们对这些模型进行了微调,并将其与基于分词的基线模型和当前最优方法进行了基准测试。结果表明,ByT5-small 和 CANINE 的性能优于基于分词的对应模型,并达到了新的最优性能,在新闻标题和 Twitter 讽刺数据集上的准确率分别提高了 0.77% 和 0.49%。这些发现凸显了无分词模型在社交媒体等嘈杂和非正式领域进行鲁棒 NLP 的潜力。

关键词

引用

@article{arxiv.2505.01006,
  title  = {Token-free Models for Sarcasm Detection},
  author = {Sumit Mamtani and Maitreya Sonawane and Kanika Agarwal and Nishanth Sanjeev},
  journal= {arXiv preprint arXiv:2505.01006},
  year   = {2025}
}