起因

系列写到上一篇,机器齐了:立柱、关节、零点、执行器、视觉、数据、传感器、抓手、两条臂的配合。但客户买的不是一台开起来惊艳的机器,是一台天天开着的机器。立项第一篇就把调子定了:演示要惊艳一次,工程要第二万次和第一次一样。回头看,前面每一篇都在给这句话打地基——选型按可靠性选、每种坏法有预案、开机自证清白、坏了伤害小。这篇把这些线全收拢:机器放到客户的仓里之后,怎么验收、怎么维护、坏了怎么兜底、模型怎么一直变好。

先把坏法列成表

这张表前面好几篇都预告过,这里正经建起来。它不是给认证看的文件,是日常用的工具:每个坏法一行——怎么被发现、那一刻机器干什么、修要多久。行不用一次列全,前面各篇其实一直在往里填:

坏法 怎么发现的 那一刻机器干什么 修多久
编码器丢零 上电校验位姿对不上 不开工,停在校验流程 按流程恢复,分钟级
灯慢慢变暗 标准色块每天一比 报警,视觉降速或停 换灯条,十分钟
吸盘唇老化 真空度到不了基准值 提示换唇,活照干 换唇,几分钟
碰撞、卡住 关节电流突变 立即停,保持位置 现场检查复位
共抬中一臂故障 两臂电流互检 好臂缓放件到台面 视故障,件先保住
相机支架被碰 标定校验超差 停视觉,等人复标 重标,小时内
模型认件变差 首抓率日统计下滑 切影子模式比对 远程重训下发

这张表是活的。现场每出一个没料到的新坏法,处理完就加一行——机器在客户仓里跑一年,这张表比出厂那天厚一倍,这一年的厚度就是这台机器的可靠性本身。

到了现场,先调再验

机器装好不等于能验收,中间还有一段调机的活,这段时间别压缩——现场实施真正的坑,大半都埋在这一段。

先是节拍调试。图纸上的节拍是预算,客户的件流才是现实:皮带上的件忽密忽疏,托盘切换有自己的节奏,有些件翻面就是慢半拍。调法从慢起:先半速跑几百件,什么参数都不动,先看清件流的真实分布;然后一段一段加速,每段几百件,盯两个数——节拍的最差百分位和首抓率。节拍上去了首抓率掉了,就退半档,这两个数是拴在一起的。提速提的主要不是臂的速度,是那些隐形停顿:停稳等待、段间停顿、视觉串行——立项篇点过名的三大杀手,最后都是在现场一段一段磨掉的。件流峰值涌进来跟不上,就加皮带缓冲让件排队,别让机器追着件跑。

然后是稳定性调试,这个急不来,靠时间。短跑好不等于长跑好:电机热透了零点会不会漂,下午的车间比早上热两度,气源在别的设备用气的高峰掉不掉压——这些图纸阶段想不全,只有连跑才冒得出来。阶梯着来:八小时、二十四小时、七十二小时,盯的不是结果数是曲线——电流曲线随时间的走势、节拍分布有没有慢慢变宽、首抓率有没有慢慢往下掉。七十二小时跑完,节拍最差百分位不漂、首抓率不衰减、日志不爆盘、误停趋零,稳定性才算磨出来。头几天还有一件必做的事:整机螺栓按点位表复紧一遍,运输和头几天的振动会把松动震出来,这功夫不下,后面全是莫名其妙的问题。

验收按最坏情况出题

验收不考好情况,好情况谁都好。出题的单子提前拟好,每题的及格线提前写死,不到了现场再商量:挑最冷的天去(低温对气路、对硅胶唇都是难关);故意关掉一路灯,看视觉降不降得住;专挑面单朝下的件、最软最黏的一坨退货;气源故意掉一把压,看真空罐保持那几十秒够不够臂把件放稳;拉一次电闸再合上,看断电续跑——码到一半的托盘不推倒,接着码。三十天连续跑,稼动率、首抓率、每件循环时间的最差百分位、掉件数、误停次数,天天记。验收看的是这三十天的曲线,不是验收日那天的演示。

黑灯是分期点亮的

黑灯不是一个开关,是分三段走的路。第一段,人在旁边盯着干:机器干活,人看失败——每一次抓偏、认错都录下来回传,喂给模型,一个摆法一个摆法地消,首抓率那三步爬坡就是在这一段里走的。第二段,人在场不盯:异常自停、报警推送,人只在报警的时候过来。第三段才是真的没人:夜班交出去,第二天早上看头天的曲线。每往前挪一段,靠的不是胆子大,是前一段的数字过了线。

模型在客户的仓里长大

机器装完不是结束,是服务的开始。每个仓的件型、堆法、光照都不一样,模型是跟着这一个仓长的:现场失败的图自动存下来,出仓前脱敏,定期回流,重训,影子模式跑一周,数字不落下风才切换,哪批数据训的哪个模型在哪个现场验证过,三样永远对得上。节奏跟着客户的旺季走——客户的旺季在黑五和圣诞,赶在十一月前把训练加密度,淡季放缓。这件事是我们当主要服务内容来做的,不是赠品:多数厂商到交机器为止,模型那层给个工具包让客户自己调;我们把一对一的场景训练做成正经的长期服务。这也是客户留得住的原因——模型长在客户的仓里,换一台机器容易,这些数据和版本换不走。

跟客户的系统说话

机器不是孤岛,活干没干、干得怎么样,客户的系统得知道。仓里那套系统有的叫 MES,仓储的叫 WMS,道理一样:它要的不是图,是结构化的记录——每件一条:什么时候抓的、条码是什么、结果码是什么、放去了哪个格口;再加周期汇总:班次产量、首抓率、失败类型分布、稼动率。上报在业务层做,不碰实时层,1kHz 循环里没有网络这个概念;事件先进本地队列落盘,网络断了先攒着,通了续传,车间网络断半天,一条记录不许丢。

再往深一层,方向得是双向的。客户现场除了我们的机器,还有主控系统和一堆外围设备,全在一张网上,我们的机器在里面是一个节点,不是一座孤岛。对外接口按三个方向设计齐:主动上传——事件和周期数据我们推出去;被动查询——客户的系统随时连上来问状态、要历史,Modbus、TCP 报文、Web 接口都开着;反向触发——客户的系统来指挥我们,触发一张高清单据照、动一个 IO、启动暂停。多数做设备的只想了第一个方向,把数据交出去完事;真到了现场,客户的主控要的是一个指挥得动的节点,不只是一个被喂的节点。反向触发的边界同时立好:能触发的是白名单里的动作,臂怎么动轨迹怎么走这个指令进不来,到不了实时层。拍照留存也挂在这套接口上——走识别相机、存原图,纠纷的时候照片就是证据。这些展开写在数据对接那篇:三个方向各自怎么落、Modbus 寄存器怎么分区、怎么让客户的上位机工程师十来行代码对接上。

日常自检和维护

每天开工前,机器自己过一遍:走校验姿态核对零点,看一眼标准色块查灯,读一次躯干倾角计顺带把地坪沉降也查了——几分种的事,天天自证清白。维护按小时数排:吸盘唇按月换,谐波减速器五千小时两三年一换,灯条按年,备件按这个节奏备,货期长的先备着。日志环形存着,出了事能把当场的数调出来回放——不靠人回忆。

远程和现场的分寸也定好。远程能干的:看数、看曲线、发新模型(先影子)、调参数。远程不能干的:机械的活,得人到。装机首月驻场,稳定之后转巡检。所有出仓的诊断数据先脱敏,面单打码——这一条是客户敢让你接他网络的前提,第一天就守。

收个尾

从立项写到这里十二篇:先想清楚替谁干什么活,再选身体的形状,然后立柱、关节、零点、执行器,一层一层往上加眼睛、加数据、加传感器原则、加手、加两条臂的配合——每一篇其实都在回答同一个问题:怎么让第二万次和第一次一样。答案凑起来也朴素:不是不出错,是错了看得见、停得下、修得快,还越用越好。

写完不等于做完,机器还没开始造。下一步是首站的那几个数:典型件重分布、托盘规格、码放规则、节拍终验——这几个数从客户的仓里拿回来,图纸就落到地上。等机器真站在皮带边上那一天,这个系列会接着写第二段,写现场的事。

参考链接