中文

基于文件名的文件分类

计算与语言 2025-03-07 v2

摘要

快速的文件分类在诸多时间敏感的应用中至关重要,例如数字取证和大规模媒体分类。传统方法依赖重型深度学习模型,在处理大规模输入数据集及分析整个文档所需的计算资源方面表现不足。本文提出一种方法,采用轻量级监督学习模型,结合基于 TF-IDF 的特征提取分词方法,能够准确且高效地仅依据文件名对文档进行分类,从而大幅降低推理时间。我们的结果表明,文件名分类器在测试两个数据集时,可处理超过 90% 的在域内文档,准确率分别达到 99.63% 和 96.57%,速度比诸如 DiT 等更复杂的模型快 442 倍。该方法为在关键场景下高效处理大规模文档数据集提供了关键解决方案,实现了快速且更可靠的文件分类。

关键词

引用

@article{arxiv.2410.01166,
  title  = {Document Classification using File Names},
  author = {Zhijian Li and Stefan Larson and Kevin Leach},
  journal= {arXiv preprint arXiv:2410.01166},
  year   = {2025}
}