中文

Text-to-Model:基于文本条件的神经网络扩散用于一次训练全网个人化

机器学习 2025-03-27 v2

摘要

生成式人工智能(GenAI)在理解世界知识并跨多模态从人类语言生成内容方面取得了显著进展,包括文本到文本的大型语言模型、文本到图像的稳定扩散(stable diffusion)以及文本到视频的 Sora 等。本文探讨了 GenAI 是否能够理解 AI 参数中嵌入的超层次知识,即是否可以实现文本到模型(text-to-model)的生成。具体而言,我们研究了一种称为一次训练全网个人化(train-once-for-all personalization)的实际场景,旨在通过文本提示为不同终端用户和任务生成个性化模型。受最近神经网络扩散(neural network diffusion)兴起的启发,本文提出了 Tina,一种用于一次训练全网个人化的文本条件神经网络扩散模型。Tina 利用以 CLIP 模型嵌入任务描述的扩散变换器模型。尽管潜在的个性化任务数量天文数字(例如 1.73×10131.73\times10^{13}),但凭借设计,Tina 在小数据集(约 1000 条)上展现出惊人的分布内和分布外泛化能力。我们进一步通过分析其在零样本/少样本图像提示、不同数量的个人化类别、自然语言描述提示以及预测未见实体方面的能力,验证了 Tina 是否以及如何理解世界知识。

关键词

引用

@article{arxiv.2405.14132,
  title  = {Text-to-Model: Text-Conditioned Neural Network Diffusion for Train-Once-for-All Personalization},
  author = {Zexi Li and Lingzhi Gao and Chao Wu},
  journal= {arXiv preprint arXiv:2405.14132},
  year   = {2025}
}

备注

Preprint