LinguaSynth:基于异构语言信号的新闻分类
计算与语言
2025-08-05 v3
摘要
深度学习已显著推动 NLP 领域发展,但其对大型黑箱模型的依赖引发了可解释性和计算效率的关键问题。本文提出 LinguaSynth,一种新型文本分类框架,通过战略性地整合五种互补语言特征类型:词汇、句法、实体级、词级语义和文档级语义,构建于透明的逻辑回归模型之上。不同于基于 Transformer 的架构,LinguaSynth 保持可解释性和计算效率,在 20 Newsgroups 数据集上实现了 84.89% 的准确率,显著超越 robust TF-IDF 基线 3.32%。通过严格的特征交互分析,我们展示句法和实体级信号提供关键消歧功能,有效补充分布式语义。LinguaSynth 为可解释、资源高效的 NLP 模型树立了新基准,挑战了深度神经网络必需实现高性能文本分类的主流假设。
引用
@article{arxiv.2506.21848,
title = {LinguaSynth: Heterogeneous Linguistic Signals for News Classification},
author = {Duo Zhang and Junyi Mo},
journal= {arXiv preprint arXiv:2506.21848},
year = {2025}
}