中文

用于分类优惠贸易协定非结构化数据内容的关键信息检索

计算与语言 2024-01-24 v1 信息检索 机器学习

摘要

随着文本数据的迅速激增,预测长文本已成为自然语言处理领域的一项重大挑战。传统的文本预测方法在处理长文本时遇到巨大困难,这主要是由于存在冗余和无关信息,阻碍了模型从文本中捕捉关键见解的能力。为解决此问题,我们引入了一种新的长文本分类与预测方法。首先,我们采用嵌入技术来浓缩长文本,旨在减少其中的冗余。随后,利用基于 Transformer 的双向编码器表示(BERT)嵌入方法进行文本分类训练。实验结果表明,我们的方法在对优惠贸易协定的长文本进行分类时实现了显著的性能提升。此外,通过嵌入方法压缩文本不仅提高了预测精度,还大幅降低了计算复杂度。总体而言,本文提出了一种长文本预测策略,为自然语言处理领域的研究人员和工程师提供了有价值的参考。

关键词

引用

@article{arxiv.2401.12520,
  title  = {Key Information Retrieval to Classify the Unstructured Data Content of Preferential Trade Agreements},
  author = {Jiahui Zhao and Ziyi Meng and Stepan Gordeev and Zijie Pan and Dongjin Song and Sandro Steinbach and Caiwen Ding},
  journal= {arXiv preprint arXiv:2401.12520},
  year   = {2024}
}

备注

AI4TS Workshop@AAAI 2024 accepted publication