![]()
VLM通过提供解释性洞察和主动任务指导,增强传统机器视觉系统,推动工厂自动化转型,并为工人提供实时的专家级知识。 作者:Jim Tatum VisionSystem Design高级编辑
视觉语言模型正在为包括机器视觉和机器人在内的各类自动化应用带来新的机遇
能够真正思考和决策的机器人?不仅知道出了什么问题、还知道为什么出问题的检测系统? 尽管如此,Panigrahi指出,尽管该技术前景广阔,但业界对采用VLM技术仍存在初步的犹豫。 “每当有新事物出现时,我认为人类天生就抗拒改变,”Panigrahi说。“我将(VLM)视为一种工具。能够利用好这一工具的人将更高效,从长远来看,我认为他们会成为雇主最青睐的工人或操作员。” 什么是VLM,它是如何工作的? Panigrahi表示,VLM是一种人工智能模型,能够同时处理视觉数据和自然语言,学习给定场景的共享表征,从而使系统能够跨两种模态进行推理。 由于现实世界是多模态的,VLM在设计上也是多模态的——像人类一样结合视觉、文本和上下文线索来理解环境并在其中行动。 “VLM就是你用眼睛进行的整体理解,对吧?”Panigrahi说。 Panigrahi表示,VLM经过训练后,图像和文本在同一场景中对齐,使模型能够回答关于图像的问题、遵循视觉指令、生成描述,并进行基于视觉证据的推理。训练VLM的数据源可以包括真实传感器数据(如来自摄像头的数据)、来自数字孪生的合成数据,以及边缘案例和故障场景。 Panigrahi表示,VLM并非要取代传统机器视觉,而是对其的增强。例如,传统视觉系统自动化检测应用可能被设计用于判断焊缝是否存在缺陷,或钻孔尺寸是否符合产品规定,而VLM则能够分析该信息并针对焊缝为何存在缺陷或孔为何尺寸不对提供建议——因为它已经通过提示和上下文定义的信息进行了训练。换句话说,VLM学习的是人类如何描述和解读他们所看到的内容。 “你把所有指令输入VLM,给它提供专家执行该任务——无论是维修、装配、安装、拆卸,还是你在做的任何工作——时的视觉线索,”Panigrahi说。“模型现在完全理解它应该做什么了。” Panigrahi表示,VLM不仅为传统机器视觉系统增加了解释性功能,还能帮助人类员工提升工作能力水平,即使该员工在该岗位上的经验有限。 “现在,比如正在做装配工作的人,可以获得主动的任务指导,告诉TA:好的,这样做,”他说。 而且,如果操作员确实犯了错误,VLM可以标记该错误,并提供关于如何纠正错误并正确执行操作的指导信息。 “如果你在VLM中拥有了那类专家知识,它就为你提供了一种媒介,几乎任何技能水平的人——也许他们才入行一年,没关系——他们都可以随时获取那类专家知识,对吧?这就是它的美妙之处;它几乎能把每个人都变成专家。” 应对VLM挑战 Panigrahi表示,尽管随着技术进步和成本降低,VLM正变得更具可扩展性,但仍有一些挑战需要应对。首先,VLM需要海量数据,而这些数据通常需要针对特定工作环境进行定制。例如,GridRaster为美国空军和美国国防部等机构提供服务。 “这些环境中有很多都非常独特——现有的VLM并没有在那种环境中训练过,”Panigrahi说。“所以,挑战在于如何针对特定领域进行训练?” 他说,由于现实世界的数据(尤其是在此类环境中)可能有限,可以通过数字孪生从现实数据生成合成数据来训练VLM。 与获取数据训练VLM这一挑战相伴的,是提供足够计算能力以快速准确地处理数据、同时避免误报或产生延迟的挑战。 为了运行,VLM需要巨大的计算能力才能给出准确结果。“一个模型要消耗多少(算力)?在工业环境中要如何实现?如何在那种环境中部署那样的计算能力?” 他说,幸运的是,计算机技术正在进步,例如NVIDIA的DGX Spark——一款桌面级计算机,专为在本地构建、微调和运行大型AI模型而设计,并可轻松迁移至数据中心或云端。
版权声明: 《激光世界》网站的一切内容及解释权皆归《激光世界》杂志社版权所有,未经书面同意不得转载,违者必究! 《激光世界》杂志社。 |
||||||||||
![]() |
友情链接 |
