基于齐夫定律的文本生成方法用于解决实体抽取中的不平衡问题
计算与语言
2023-09-04 v3
摘要
实体抽取在多个领域的智能化进展中至关重要。然而,数据不平衡问题对其有效性构成了挑战。本文通过定量信息的视角提出一种新方法,认识到实体表现出一定程度的普遍性而另一些则稀少,这可反映于词语的可量化分布中。齐夫定律(Zipf's Law)呈现出一种恰如其分的采用方式,并且为了从词语过渡到实体,文档中的词语被分类为常见词与稀有词。随后,句子被分类为常见句与稀有句,并相应地由文本生成模型进一步处理。所生成句子中的稀有实体然后使用人工设计的规则进行标注,作为原始数据集的补充,从而缓解不平衡问题。该研究给出了一个从技术文档中抽取实体的案例,来自两个数据集的实验结果证明了所提方法的有效性。此外,讨论了齐夫定律在推动 AI 进展中的意义,拓宽了信息计量学(Informetrics)的触及范围与覆盖度。本文成功展示了通过齐夫定律将信息计量学扩展至与 AI 接口。
引用
@article{arxiv.2205.12636,
title = {A Zipf's Law-based Text Generation Approach for Addressing Imbalance in Entity Extraction},
author = {Zhenhua Wang and Ming Ren and Dong Gao and Zhuang Li},
journal= {arXiv preprint arXiv:2205.12636},
year = {2023}
}
备注
Journal of Informetrics