中文

名何以称?通过CAD文件中用户提供的名称评估语言模型的装配-零件语义知识

计算与语言 2023-04-28 v1 机器学习

摘要

装配体中零件-零件及零件-整体关系的语义知识对从设计存储库搜索到工程知识库构建等多种任务颇有价值。本工作中,我们提出设计人员在计算机辅助设计(CAD)软件中使用的自然语言名称是此类知识的重要来源,且大型语言模型(LLMs)包含有助于处理该数据及其他CAD与工程相关任务的领域特定信息。具体而言,我们提取并清洗了大量自然语言零件、特征及文档名称语料,并借此定量证明:一个预训练语言模型在三项自监督任务上可超越众多基准,且从未见过这些数据。此外,我们展示在该文本语料上微调可进一步提升所有任务性能,从而证明了迄今被 largely 忽视的文本数据的价值。我们也指出了单独使用LLMs处理文本数据的关键局限,我们的发现为进一步的文本-几何多模态模型研究提供了强劲动机。为助益并鼓励该领域进一步工作,我们公开了所有数据与代码。

关键词

引用

@article{arxiv.2304.14275,
  title  = {What's in a Name? Evaluating Assembly-Part Semantic Knowledge in Language Models through User-Provided Names in CAD Files},
  author = {Peter Meltzer and Joseph G. Lambourne and Daniele Grandi},
  journal= {arXiv preprint arXiv:2304.14275},
  year   = {2023}
}