双臂工业机器人:数据工厂
Contents
起因
先说一个行业里的事。很多机器人做出来了,演示视频惊艳,就是落不到产线上,卡住的不是机械、不是控制,是模型没有足够的数据训练。这不是努力问题,是结构问题。
传统工业机器人能满世界跑,恰恰因为它们不需要模型:治具、整列、固定姿态、固定节拍,环境被机械设计整理得干干净净,机器对着假设好的世界干活,不需要看见什么。可一旦活儿变成乱堆的软包、随机来件、面单乱朝——机器就必须看见,看见就要模型,模型就要数据。而数据在产线上。于是死循环来了:机器人没上线就没有数据,没有数据模型就不行,模型不行客户就不让上线。演示视频为什么惊艳?给演示收集的数据把演示那一个场景过拟合了,真上产线三个星期,堆型一变、光照一变,打回原形。
指望仿真补齐也不现实。软包的形变、塑料袋的反光、堆叠的物理,越非结构化,仿真和真实的差距越大,这个差距最后全变成现场的失败率。指望数据通用同样不现实:两个仓的件、包材、光照、堆法分布根本不是一回事,加上图像里有面单隐私和客户的商业数据,天生出不了车间。
我们能把这条路走通,有一个必要条件得先说:客户把几年的现场数据直接端过来了,成千上万的照片和视频。这篇就写这条数据链怎么运转——从一堆原始录像到一个能上岗的模型,中间的活比臂和立柱加起来还多。
客户给的不是许可,是存量
“允许你录像"和"把数据给你"是两个量级。前者是自己攒,一天产多少算多少;后者是客户几年的积累直接端过来,冷启动整个跳过去了。
更重要的是存量的分布宽度,这个宽度是时间给的。服装电商的件随季节换形:冬装的压缩袋厚实、夏装轻薄蓬松,模型没见过冬季的堆,冬季就没法干活——自录像,一年也录不齐春夏秋冬。各种包材、旺季淡季不同的堆法、破损件、各种反光角度,历史照片里现成全有。尤其值钱的是长尾:罕见堆型、埋掉面单的件、黏成一坨的退货——这些样本不用蹲在皮带边等它再发生一次,几年的数据里它早就发生过、被拍下来了。
为什么客户肯给,别家却拿不到:客户的数据不是不存在,是不会给——没有信任、没有订单、没有"机器越准我越受益"的绑定,凭什么把仓里的原始数据交出去。我们这里数据换效果是天然成立的:客户给数据,模型练准,顶班顶得稳,收益回流客户。写进合同的只有用途边界:数据用在哪家的模型上、脱敏之后能不能进通用的底模,一条一条谈清楚。
数据进来先过三道
客户给的是原始数据,不是训练集。进来先过三道。
第一道归一化。照片和视频来源五花八门:手机拍的、监控截的、不同相机产的,分辨率、帧率、色彩空间全不一样。先统一到一套规格再谈别的,否则后面的筛选和标注全在沙地上盖楼。
第二道筛选。抽帧出来的候选量是几万张级的,里面大半是废的:相邻帧几乎一样、运动拖影、遮挡。去重、去废、留多样——而最值钱的帧恰恰最少见,“少见但有代表性"和"少见且没意义"机器分不出来,最后还是要人过一遍。这道活枯燥,省不掉。
第三道脱敏,这道是硬合规,不是礼貌。跨境件的面单上是海外收件人的姓名地址,涉欧洲的件还顶着 GDPR 级别的敏感——图像出客户车间之前,面单区域一律打码,往外传的只有裁剪过的失败案例图。这条做在前头,客户才敢把数据链路开着。
标注是最贵的环节
预处理完,钱和时间主要烧在标注上。软包的分割要逐件画掩码,而软包的边缘全是模糊的:塑料袋反光、衣服褶皱、件黏连堆叠,轮廓本身就没有清晰边界。一张图画精细了几分钟,一万张就是几个月的人日。
比贵更麻烦的是错。标错的图比没标的还毒——模型把错的东西学进去,评估的时候看不出来,到了现场才炸。所以标注必须配质检:抽检、双人交叉标、拿两人掩码的重叠度当一致性指标卡门槛,标得分歧大的图整批退回重标。标注团队的规矩定在前面,比事后洗数据便宜十倍。
降成本的正路是预标飞轮:用现有模型先标一遍,人只负责改错——比从零画快好几倍;模型每迭代一轮,预标质量涨一截,标注成本降一截。所以第一版模型哪怕糙一点也要尽早转起来,它不光干活,还是标注工具,越用越好用,标注越标越便宜。
三类来源各管一段
到这里,数据的全貌可以拼出来了:三类来源,成本结构完全不同,各补各的。
| 来源 | 成本 | 补什么 |
|---|---|---|
| 客户的存量照片视频 | 谈来的,一次性 | 分布的宽度:季节件型、包材、堆法、长尾 |
| 现场回流的失败案例 | 白捡,机器自己攒 | 模型正在失败的地方 |
| 合成渲染图 | 电费 | 罕见堆型,标签免费 |
中间那行是常被忽略的一笔:机器上岗之后,抓偏的、漏检的、分割黏连的,自动存图回传——失败案例是机器自己攒给自己的教材,一分钱不花,还专挑模型不会的地方补。合成那行要克制:渲染图自带完美标注,标签免费,专补真实数据里罕见的堆型;但占比有上限,合成图喂多了,模型的判断会偏到渲染世界去,和现场的真实手感脱节——这个占比是试出来的数,不是想出来的数。
高质量模型是滚出来的
训练这一环反而是链上最轻的:算力按小时租云上的 GPU,训练管线自己写,上一篇写过,不重复。要在这里说的是节奏——高质量模型不是一次练出来的,是循环滚出来的:现场冒出新的失败模式,回流,重训,保留集上评估,影子模式跑一周比对,数字不落下风才切换上线。一轮接一轮,旺季前滚得密,淡季滚得稀。
配套的是版本纪律,三样东西永远对得上:这批数据是什么时候哪来的、这个模型是哪批数据训的、它在现场验证过没有。半年后现场掉点,要能顺着这三样回溯到源头——记的是来历,出了问题能查到出身。
接下来
到这篇,眼睛这一侧算是闭环了:相机、推理、数据工厂。闭环之前还得补一篇原则:不追求纯视觉解决所有问题——能开关量回答的、能物理量直读的,都不压给眼睛,降算力和冗余兜底的机制必须要有。下一篇就把传感器怎么配、每种坏法怎么兜底写透。之后才轮到手——软包没有形状、里面装的什么不知道、不能使劲夹、面单还娇气,立项就点了名的第一难题:吸盘阵列、柔性夹、力控怎么配。压缩袋装的小硬块和蓬松的散衣得分两种抓法,这个差异怎么消化,在抓手篇说。
参考链接
- 本站:双臂工业机器人:立项、视觉链(训练与推理分工、租 GPU、影子模式在那篇)、零点与自检
Author 软件开发大郭
LastMod 2026-09-13