中文

FUSE 语言模型:跨分词器的零样本适配器发现与提示优化

计算与语言 2024-08-12 v1 机器学习

摘要

大语言模型的广泛使用导致了大量分词器和嵌入空间的出现,使得提示发现任务中的知识迁移变得困难。在本工作中,我们提出 FUSE(Flexible Unification of Semantic Embeddings,语义嵌入的灵活统一),这是一种低成本的方法,用于近似一个适配器层,将一个模型的文本嵌入空间映射到另一个模型,即使跨不同分词器。我们引入了一种基于三阶张量的模型嵌入空间表示,用于对齐被不同分词器拆分的语义嵌入,并利用该表示推导一个模型的输出相对于另一个模型嵌入空间的梯度近似。我们通过在视觉语言模型和因果语言模型上进行多目标优化,验证了我们方法在图像描述和基于情感分析的图像描述任务上的有效性。

关键词

引用

@article{arxiv.2408.04816,
  title  = {FUSE-ing Language Models: Zero-Shot Adapter Discovery for Prompt Optimization Across Tokenizers},
  author = {Joshua Nathaniel Williams and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2408.04816},
  year   = {2024}
}

备注

Published as a Conference Paper at COLM 2024; 10 Pages; https://github.com/jnwilliams/FUSE_prompt_inversion.git