中文

面向冷启动场景的联合实例与 verbalizer 选择的数据多样性建模

计算与语言 2025-07-02 v1 信息检索

摘要

基于掩码语言模型目标训练的预训练语言模型 (PLM) 方法在模板、verbalizer 和少量样本选择方面较为敏感,尤其是在无标签数据的情况下的冷启动场景中。现有研究忽略了实例与 verbalizer 之间的依赖关系,即实例-标签概率取决于 verbalizer token 在嵌入空间中的距离。为此,我们提出了 COLDSELECT,一种建模数据多样性的联合 verbalizer 和实例选择方法。COLDSELECT 将 PLM 词汇表和 h[MASK]h_{[MASK]} 嵌入映射到共享空间,应用降维和聚类以确保高效且多样的选择。通过优化最小不确定性和最大多样性,COLDSELECT 能有效捕获数据关系。在八个基准数据集上的实验表明,COLDSELECT 在降低不确定性和提升泛化能力方面优于基线方法,在冷启动场景下的 verbalizer 和少量实例选择中表现突出。

关键词

引用

@article{arxiv.2507.00330,
  title  = {Modeling Data Diversity for Joint Instance and Verbalizer Selection in Cold-Start Scenarios},
  author = {Mohna Chakraborty and Adithya Kulkarni and Qi Li},
  journal= {arXiv preprint arXiv:2507.00330},
  year   = {2025}
}