基于文本块语义分类的模板内容检测
计算与语言
2022-03-10 v1 机器学习
摘要
我们提出一种称为 SemText 的层次化神经网络模型,基于 HTML 标签、类名与文本块的新颖语义表示来检测 HTML 模板内容。我们在三个已发布的新闻网页数据集上训练 SemText,并使用 CleanEval 与 GoogleTrends-2017 中的少量开发数据进行微调。我们展示 SemText 在这些数据集上达到了最先进的准确率。随后我们通过对基于社区的问答网页这一域外数据也有效检测模板内容,展示了 SemText 的鲁棒性。
引用
@article{arxiv.2203.04467,
title = {Boilerplate Detection via Semantic Classification of TextBlocks},
author = {Hao Zhang and Jie Wang},
journal= {arXiv preprint arXiv:2203.04467},
year = {2022}
}
备注
IJCNN 2021