动态获取文本内容以实现较少知名实体的分类——面向实际任务
计算与语言
2026-04-27 v1
摘要
现有的自然语言处理 (NLP) 资源常常缺乏用于实际问题的任务特定信息,且对较少知名或新引入的实体覆盖有限。例如,商业组织和医疗保健提供者可能需要根据特定应用任务将其分类到各种不同的分类方案中。我们的目标是通过仅提供实体名称和黄金标签作为训练数据,使领域专家能够轻松创建针对实体的任务特定分类器。我们的框架随后动态获取每个实体的描述性文本,随后用作生成基于文本的分类器的依据。我们提出了一种新颖的文本获取方法,利用了 web 资源和大型语言模型 (LLM)。我们在两个不同领域的分类问题上评估了所提出的框架:(i) 将组织分类到标准产业分类 (SIC) 代码,这些代码基于组织的业务活动进行分类;(ii) 将医疗保健提供者分类到医疗保健提供者分类代码,这些代码代表了提供者的医学专长和实践领域。我们最佳的模型在 SIC 代码和医疗保健分类代码分类任务上分别实现了 82.3% 和 72.9% 的宏平均 F1 分数。
引用
@article{arxiv.2604.22325,
title = {Dynamically Acquiring Text Content to Enable the Classification of Lesser-known Entities for Real-world Tasks},
author = {Fahmida Alam and Ellen Riloff},
journal= {arXiv preprint arXiv:2604.22325},
year = {2026}
}