Article · AI translation
构建可靠执行任务的 AI:工业机器人领域的经验
在 Standard Bots 的 AI 技术栈中,预训练模型通过示范学习工厂任务,并借助实际部署中的纠正不断改进。
Richard MacManus
2026 年 10 月 10 日
分享
提到机器人与 AI,你首先想到的可能是 Figure 的 AI 驱动机器和 1X 的 NEO 家用机器人这类完整的人形机器人。它们很可能代表未来,但在 2026 年,工业机器人可以说更重要,而工业机器人通常并非人形。
Standard Bots 自称是“美国最大的原生 AI 工业机器人制造商”。该公司最近在由 General Catalyst 和专注于机器人领域的基金 RoboStrategy 领投的 C 轮融资中筹得 2 亿美元,估值达 10 亿美元。其客户包括 NASA、Amazon 和 Lockheed Martin。
我们采访了联合创始人兼首席执行官 Evan Beard 和 AI 负责人 Leif Jentoft,以进一步了解 Standard Bots 的 AI 技术栈及其模型的工作方式。
先介绍一下背景:Standard Bots 的工业机械臂专为机床上下料、焊接和装配等任务设计。以下是 Jentoft 所做的一段简短演示:
预训练模型与针对特定任务的适配
Beard 表示,Standard Bots 有一个共享的基础模型,客户可通过示范和微调使其适应自身需求。Jentoft 补充说,Standard Bots 运行着多种模型,其中包括用于机床上下料的零样本感知系统。
Beard 表示,该公司最大的模型拥有数十亿量级中偏低的参数量,因此按前沿实验室的标准来看并不算大。
“我们认为,数据质量远比单纯的数据量重要,”Jentoft 说,“我们专注于充分利用有针对性的数据,而不是追求尽可能大的数据集。”(这与 Jev 创建者 Diogo Almeida 所说的“最苦涩的教训”不谋而合。他最近告诉我们,合适的任务和合适的数据可能比算力更重要。)
“我们的市场触达能力让我们得以独特地获取价值最高的数据,”他补充说。“通过现场干预,只需几十个例子就能解决一个边缘情况。”
Beard 指出,Standard Bots 专注于短时程任务,以满足生产对节拍时间和可靠性的要求。对于工作流程中不需要习得行为的部分,该公司采用传统编程方式。
Beard 表示,模型训练在云端进行,但推理在本地运行。
模型具体做什么?
我问 Jentoft,在典型的机器人作业流程中,学习得到的模型负责什么,工作流程的哪些部分使用传统编程?
他以该公司面向多品种制造的机床上下料解决方案为例。
“我们构建了一个零样本系统,让用户能够告诉机器人在特定任务中寻找哪些零件。模型负责感知,即定位和识别零件;传统编程则负责运动及其周围的工作单元逻辑。”
以下是机床上下料的演示:
“我们用于这项任务的骨干模型基于超过 10 亿张图像训练,这使机器人能够区分不同的光照条件、材料类型,以及物体和其背景,”Jentoft 说。
完整的 AI 技术栈
今年 4 月,我们邀请 Applied Intuition 参加播客,讨论“物理 AI”及其与屏幕上的 AI 有何不同。其中一个收获是,物理 AI 所受的限制不只是模型智能:难点在于如何在安全性、延迟、功耗、成本和可靠性等约束下,将模型部署到真实硬件上。
但对 Standard Bots 来说,这也可能是一项优势,因为它掌控着从软件到硬件的“全栈”。Jentoft 指出,该公司掌控机械臂、末端执行器、控制系统和 AI。
“这让我们能够协同优化模型和控制策略,”他说。“尽管其他地方有不同的说法,但目前没有任何模型真正不受硬件限制。协同优化底层控制和更高层级的功能,在性能和迭代速度方面都是一项重大优势。”
一家旨在打造“通用机器人智能”的公司 Skild,可能会对“与硬件无关”这一说法提出异议——它的目标是实现跨硬件泛化。
本地推理:传感器、边缘 GPU 和“动作片段”
Beard 曾提到,推理在本地完成,这对其核心客户——工厂——尤为重要。
“对工厂来说——目前我们做的大部分业务都在工厂,我们也确实看到了那里的大量机会——推理必须在本地进行,”他说。
在机床上下料任务中,模型负责识别零件,运动则由传统编程控制。Jentoft 还介绍了模型如何生成动作,并将其输入机器人的控制系统。
“腕部摄像头和其他传感器通过内部千兆以太网将原始像素和信号送入系统,线路在内部布设,因此不会发生线缆缠绕,”他解释道。“边缘 GPU 处理这些数据,生成动作片段,再将其以流式方式传给底层控制系统。”
他重申,推理特意安排在本地运行。
“对机器人来说,使用云端算力在运营上极其困难——大多数工厂和仓库没有可靠的互联网连接,移动机器人面临的情况更是如此。正常运行时间对获得客户认可至关重要,所以我们让整个控制循环留在本地。”
生产中的故障与机器人群体学习
Standard Bots 会在可行时使用仿真,但 Beard 表示,有些生产任务——包括涉及液体、吸附或切割柔性材料的任务——很难在现有仿真器中复现。
真实环境中的演示也是学习过程的一部分。下面是一段使用手持触控设备教机器人的演示:
那么,它如何处理机器人执行任务时的失败?从这类失败中获得的经验会反馈给模型吗?
“我们从实际部署中收集失败信号和人工纠正信息,如何使用这些数据取决于客户,”Jentoft 回答说。
他指出,许多国防领域的客户“在物理隔离的环境中部署,任何数据都不会传回来”。但对于未进行物理隔离的客户,“机器人群体学习给他们自己的应用带来的收益足够大,因此我们通常不会遇到他们反对以贡献数据换取这种性能的情况”。
StandardOS:一个 AI 机器人开发平台
Standard Bots 已扩展其平台,供外部开发者使用。通过 StandardOS,它提供了一套 API 和 SDK。
Beard 表示,开发者可以使用 Standard Bots 的 API,按需选用其技术栈中的组件来构建机器人应用,也可以接入自己的模型。他以 NVIDIA Cosmos 为例;这是一个面向物理 AI 的开放式全模态世界模型家族(第 3 版于 5 月下旬发布)。
目前,这需要开发者自行编写集成代码。但 Standard Bots 计划让数据收集、模型训练以及将模型部署到其机器人上的过程变得更容易。
聚焦有针对性的数据
Standard Bots 并不是最吸引眼球的机器人公司,但它的产品已经部署在 NASA、Amazon、Lockheed Martin 等机构和公司的工业自动化场景中。
对 AI 工程师来说,也许最有用的经验是 Standard Bots 如何让 AI 适应特定工作。它将模型的职责保持在明确范围内,并利用实际部署中的纠正信息来解决边缘情况。当然,同样的方法也可以用于软件智能体。
正如 Jentoft 所说——这也是 Jev 最近得到的一条经验——关键在于“充分利用有针对性的数据,而不是一味追求尽可能大的数据集”。
分享
上一篇