Part III: 배포 전략

Chapter 10: 생산 데이터 — 배포가 만드는 개선 순환

집필일: 2026-07-22 최종수정일: 2026-07-22

개요

생산 데이터 순환은 학습 데이터가 많다는 말로 끝나지 않는다. 진짜 순환은 로봇이 현장에 들어간 뒤 시도, 실패, 복구, 품질 판정, 작업자 개입, 재학습과 배포 승인 기록이 하나의 추적 가능한 단위로 쌓일 때 생긴다. Covariant, Dexterity, Chef Robotics 같은 공급자는 서로 다른 작업 분포에서 운영 데이터를 자산으로 삼지만, 이들의 공개 자료는 어디까지나 제품 방향을 보여 주는 1차 당사자 근거다 [1], [2], [3]. 고객 공정의 개선은 고객이 보유한 재현 시험으로 별도 입증해야 한다.

제조사가 주의해야 할 점은 "공급자가 데이터를 많이 갖고 있다"와 "우리 공정이 더 좋아진다" 사이의 간격이다. [4]의 QT-Opt부터 [5], [24], [7]까지 대규모 로봇 데이터는 조작 학습을 밀어 왔다. 그러나 공장에서는 모델 손실보다 개입 사유, 불량 코드, 사이클타임의 꼬리 분포, 위생 보류, 복구 경로가 더 직접적인 개선 신호다. 이 장의 논지는 간단하다. 배포는 데이터 수집의 끝이 아니라, 무엇을 기록하고 누가 업데이트를 승인하는지에 따라 비로소 학습 자산이 되는 실험 단계다.

이 장을 읽고 나면... - 배포 전 데이터셋과 배포 후 운영 기록의 차이를 설명할 수 있다. - 로봇 시도, 작업자 개입, 복구, 지연 품질 판정을 하나의 작업 회차로 결합하는 스키마를 설계할 수 있다. - 개입 데이터의 가치를 교정 구간 수가 아니라 관찰·인계·리셋·라벨링·재검증의 총비용으로 계산할 수 있다. - 고객사가 잃지 말아야 할 실패 로그, 품질 추적 기록, 재현 시험 세트, 업데이트 승인과 되돌리기 권한을 정의할 수 있다. - 공급자 발표, 논문 실험, 고객 현장 검증을 서로 다른 증거 층으로 구분할 수 있다.

운영 순환의 네 층

남겨야 할 기록 학습에 주는 값 릴리스 게이트
실행 센서 관측, 명령, 제어 모드, 안전 상태, 시작·종료 시각 정책이 실제로 방문한 상태와 행동을 복원한다. 시간 동기화와 소프트웨어·하드웨어 버전을 고정한다.
개입과 복구 경보 시점, 인계 전후 상태, 작업자 행동, 리셋과 폐기 사유 실패 경계와 사람이 보충한 전략을 드러낸다 [25], [26]. 개입 없는 성공과 개입 후 성공을 분리한다.
품질 검사 코드, 측정값, 재작업, 추후 반품·공정 보류 즉시 성공과 제조 수용성의 차이를 라벨링한다. 지연 라벨의 귀속 규칙과 최대 대기 시간을 정한다.
변경 관리 데이터셋·정책·제어기 버전, 승인자, 재현 시험 결과, 되돌리기 사유 개선이 어떤 변경에서 왔는지 감사할 수 있게 한다. 고정 회귀 세트, 비작동 평가, 단계적 승격을 통과한다.

생산 운영 기록의 해부

생산 데이터 순환을 말할 때 가장 흔한 실수는 "데이터가 자동으로 쌓인다"는 표현을 너무 쉽게 쓰는 것이다. 실제로는 카메라 프레임, 행동 명령, 로봇 상태, PLC 사건, 작업자 메모, 품질 검사 결과가 서로 다른 시스템에 흩어져 있다. 이 조각이 하나의 시도 식별자로 묶이지 않으면 데이터는 많아도 학습 가능한 운영 기록이 되지 않는다. 시도 식별자에는 셀·로봇·말단장치·도구·제품 로트·레시피·소프트웨어 버전이 연결되어야 하며, 원본 흐름의 시각이 어긋났을 때 적용한 보정도 남아야 한다.

신뢰할 수 있는 생산 순환의 최소 조건은 고객이 볼 수 있는 운영 기록이 로봇의 개별 시도, 작업자 개입, 실패와 복구, 하류 품질 판정, 모델 업데이트를 끊김 없이 연결하는 것이다 [26], [27], [4]. 이 주장은 특정 논문의 공장 준비도를 뜻하지 않는다. QT-Opt는 대규모 실물 집기 시도에서 오프폴리시 학습의 가능성을, RoboCat은 제한된 로봇·과제 혼합 안에서 자기 생성 데이터의 재투입을, 실행 중 감시 연구는 소수 조작 과제에서 개입 기반 실패 예측을 보여 주었다. 이들을 제조 전반으로 일반화하려면 셀별 센서, 제어기, 리셋 절차와 평가 분모를 다시 고정해야 한다.

QT-Opt는 많은 실물 집기 시도와 오프폴리시 학습이 어떻게 규모의 이점을 만들 수 있는지 보여 준 초기 사례다 [4]. RoboNet과 BridgeData는 여러 로봇과 환경을 묶어 사전학습용 선행 지식을 만드는 흐름을 넓혔다 [5], [6]. RT-1과 RT-X는 이 계보를 언어 조건 정책과 서로 다른 로봇 몸체의 데이터 쪽으로 끌고 갔다 [7], [8]. 그러나 이 연구 흐름은 공장 운영 기록의 모든 문제를 해결하지 않는다.

생산 현장에서는 시도가 끝난 뒤에야 중요한 판정값이 생기는 경우가 많다. 집기는 성공했지만 하류 검사에서 흠집이 발견될 수 있고, 팔레트 적재는 완료됐지만 운송 중 무너질 수 있다. 식품 정량 담기는 그 순간에는 좋아 보여도 무게 검사나 위생 보류에서 실패할 수 있다. 따라서 생산 순환은 로봇 측 사건과 품질 시스템을 늦게라도 연결하는 지연 판정 설계를 포함해야 한다.

로봇의 과제 성공은 흠집·과도한 힘·재작업·사이클타임 꼬리·지연 검사 결과가 빠져 있으면 제조 수용성과 크게 어긋날 수 있다 [26]. 개입 기반 연구나 오프라인 반복 개선은 학습 순환의 구성 요소를 보여 주지만, 그 실험의 성공 판정이 고객의 불량·보증·위생 기준을 자동으로 포함하지는 않는다. 따라서 즉시 판정은 motion_complete, 하류 판정은 process_accept, 일정 시간이 지난 판정은 field_accept처럼 분리하고, 늦게 도착한 불량을 원래 시도에 역결합해야 한다.

지연 판정에는 귀속 오류도 있다. 한 부품이 여러 셀을 거치면 최종 불량이 어느 동작에서 생겼는지 모호할 수 있다. 이때 모든 선행 작업 회차를 실패로 바꾸면 정책이 정상 행동까지 회피하고, 아무것도 바꾸지 않으면 품질 신호가 사라진다. 제조사는 공정 지식으로 후보 원인을 좁히고, 불확실한 판정에는 신뢰도와 검토자를 기록해야 한다. 생산 데이터의 품질은 판정의 즉시성보다 원인과 불확실성을 얼마나 정직하게 보존하는가에 달려 있다.

다수 현장 학습과 고객 현장의 간극

공급자 순환은 여러 고객에서 모은 데이터를 공통 모델 개선에 돌리는 구조다. 이 구조는 강력하다. RoboNet은 7개 로봇 플랫폼에서 모은 약 1,500만 프레임으로 이질적 몸체를 묶는 문제를 연구했고, MT-Opt는 보고된 설정에서 12개 기술과 80만 작업 회차 이상의 경험을 과제 그래프로 공유했다 [5], [24]. 이런 연구는 다수 현장 데이터가 경험의 폭을 넓힐 수 있음을 보여 주지만, 공개 실험의 과제 그래프나 데이터 혼합이 임의의 제조 공정으로 전이된다는 뜻은 아니다.

과제 정의와 다중 로봇 수집, 데이터 공유 학습을 순환하는 MT-Opt 개요

그림 10.1. MT-Opt의 그림 2는 원하는 결과 예시로 성공 판별기를 정의하고, 여러 로봇이 수집한 작업 회차를 과제별로 확장·재균형해 정책을 반복 학습하는 순환을 보여 준다. 판별기가 만든 0/1 성공은 논문 과제의 파생 판정이며, 고객 품질 판정·실패 재현 시험·독립 생산 운영 기록을 뜻하지 않는다. 출처: Kalashnikov et al. (2021), arXiv:2104.08212, 그림 2, 3쪽.

다수 현장의 규모는 학습 범위를 넓힐 수 있지만, 비공개 실패 로그와 선택 편향 때문에 외부에서는 실제 생산 분포를 독립적으로 평가하기 어렵다 [24], [5]. 자율 리셋–실행–검증 순환도 같은 경계를 가진다. 로봇 유휴 시간, 검증 기반시설, 선별에서 탈락한 실패가 공개되지 않으면 궤적 수만으로 순환의 경제성과 안전성을 판단할 수 없다. 고객은 공통 선행 모델을 사더라도 자기 셀의 유보 평가 세트와 실패 재현 시험을 별도로 유지해야 한다.

고객 순환은 다른 목표를 가진다. 고객은 공통 모델이 좋아지는 것보다 자기 공정의 폐기, 비가동 시간, 수동 보조, 품질 반려가 줄어드는지 봐야 한다. 공급자가 공통 모델을 업데이트했는데 고객의 특정 SKU에서 실패가 늘면, 고객은 그 실패를 재현하고 되돌리기를 요구할 수 있어야 한다. 공급자 순환이 강할수록 고객 순환의 권한을 계약에 명확히 남겨야 한다.

이 차이는 데이터 소유권 논쟁을 더 구체적으로 만든다. 고객이 모든 원본 로봇 데이터를 외부 반출하지 않겠다고 할 수도 있고, 공급자가 모델 개선을 위해 일부 데이터를 필요로 할 수도 있다. 현실적인 절충은 원본 영상, 비식별 영상, 파생 특징, 집계 실패 코드, 재현 시험 결과, 모델 업데이트 지표를 구분하는 것이다. 무엇을 공유하고 무엇을 내부에 남기는지 계층화하면, 공급자 학습과 고객 공정 학습을 동시에 유지할 수 있다.

개입은 무료 라벨이 아니다

DAgger는 학습자가 실제로 방문한 상태에 전문가 판정을 다시 붙여 행동복제의 분포 이동을 줄이는 원리를 정식화했다 [23]. 이후 ThriftyDAgger는 새로움과 위험 추정을 이용해 감독자 제어를 요청하는 시점을 예산과 연결했고, 모델 기반 실행 중 감시는 예측된 미래 실패를 바탕으로 인간 감시를 선택적으로 요구했다 [25], [26]. HIL-SERL은 시연, 학습된 보상, 오프폴리시 강화학습, 온라인 개입을 결합해 소수의 실제 접촉 과제에서 빠른 개선을 보고했다 [28]. 이 연구들은 개입을 데이터로 바꾸는 강력한 방법을 보여 주지만, 모두 숙련 감독, 리셋, 보상·실패 모델과 시스템 공학에 의존한다.

보상 판별기와 시연, 정책 전이, 사람 개입을 재현 메모리로 잇는 HIL-SERL 학습 절차

그림 10.2. HIL-SERL의 그림 3은 원격조종 성공·실패 표본으로 이진 보상 판별기를 만들고, 20–30개 시연과 온라인 정책 전이·사람 개입을 두 재현 메모리에 축적하는 학습 절차를 그린다. 오른쪽 성공률·사이클타임·개입률 선은 정량 시계열이 아니라 기대 학습 동향을 나타내는 도식이므로, 공장 인건비나 품질 개선의 실측값으로 읽을 수 없다. 출처: Luo et al. (2025), arXiv:2410.21845, 그림 3, 8쪽.

따라서 개입 경제성은 교정된 궤적 조각의 길이만 세면 안 되며, 작업자가 화면을 관찰한 시간, 위험을 판단하고 제어를 넘겨받은 시간, 셀을 안전 상태로 되돌린 리셋 시간, 원인을 판정한 시간, 수정 정책을 다시 검증한 시간을 모두 포함해야 한다 [25], [28], [26]. 해당 연구의 성공률과 인간 노력 지표는 각 논문이 사용한 로봇, 과제, 기준선, 평가 분모 안에서만 유효하다. 이를 공장 총비용 절감으로 옮기려면 감독자의 대기 시간과 생산 중단, 폐기 부품, 재인증 비용까지 다시 계산해야 한다.

개입 로그도 유형을 나눠야 한다. preventive는 충돌이나 불량 전에 사람으로 넘긴 경우, corrective는 진행 중 동작을 수정한 경우, recovery는 실패 뒤 셀을 정상 상태로 되돌린 경우다. 세 유형을 하나의 성공 작업 회차로 합치면 정책이 스스로 해결한 비율을 과대평가한다. 반대로 모두 실패로 폐기하면 사람이 보여 준 희귀 복구 전략을 잃는다. 학습 데이터에는 전환 전후의 상태와 행동을 보존하고, 운영 지표에는 자율 성공·보조 성공·안전 종료를 분리하는 것이 적절하다.

개입 비용 항목 측정 단위 누락할 때 생기는 착시
감시와 판단 작업자 감시 분/가동 시간, 경보당 판단 초 교정 구간이 짧아 사람이 거의 들지 않는다고 보인다.
인계와 교정 인계 지연, 교정 동작 시간, 제품 손실 위험 상태까지 기다린 비용과 폐기를 숨긴다.
리셋과 판정 리셋 분, 원인 코드 작성 분, 불확실 판정 비율 로봇 점유와 데이터 정제 노동을 무료로 계산한다.
재검증 재현 시험 수, 실물 시험 수, 승인자 시간 수정된 정책이 곧바로 생산 가능하다고 오해한다.

부정적 결과도 가치가 있다. 개입 빈도가 줄었지만 발견하지 못한 품질 유출이 늘 수 있고, 위험 모델이 보수적이어서 생산성이 떨어질 수 있으며, 작업자가 경보에 익숙해져 인계가 늦어질 수 있다. 개입 정책을 업데이트할 때는 단순한 개입률뿐 아니라 놓친 개입, 오경보, 인계 지연, 작업자 부담, 후속 품질 반려를 함께 본다. 이것이 인간을 데이터 수집 장치로만 취급하지 않고 안전 책임의 일부로 다루는 방법이다.

배포 전 데이터와 배포 후 데이터

사전학습 데이터는 모델의 시작점을 만든다. Open X-Embodiment와 DROID처럼 여러 로봇과 환경에서 수집된 데이터셋은 새로운 과제에 대한 선행 지식을 준다 [8], [9]. 그러나 생산 셀의 개선 순환은 배포 이후에 결정된다. 실패 구간이 쌓이는 것만으로는 부족하고, 왜 실패했는지, 누가 개입했는지, 품질 검사에서 어떤 판정을 받았는지까지 연결되어야 한다.

따라서 생산 개선 순환의 최소 단위는 영상-행동 쌍이 아니라 "시도"다. 시도에는 SKU 또는 레시피, 고정구 상태, 로봇 모드, 제어기 대체 동작, 작업자 교정, 품질 판정, 재작업 여부가 들어간다. 이 단위가 유지되면 모델 업데이트가 공정 KPI를 움직였는지 볼 수 있다. 유지되지 않으면 공급자는 더 좋은 모델을 만들 수 있어도 고객사는 왜 처리량이나 폐기가 변했는지 설명하지 못한다.

배포 전 데이터는 "어떤 일을 처음부터 할 수 있게 하는가"에 답한다. 배포 후 데이터는 "현장에서 무엇을 계속 고쳐야 하는가"에 답한다. 전자는 로봇 정책의 선행 지식이고, 후자는 운영 정책의 교정 신호다. 제조사는 이 둘을 같은 데이터 저장소에 넣더라도 배포 결정에서는 분리해야 한다. 사전학습에서 본 물체 다양성이 커도 현장 고정구 공차가 바뀌면 실패는 새롭게 생긴다.

또한 배포 후 데이터는 실패 데이터의 품질이 중요하다. 실패가 드문 작업일수록 실패 하나의 설명력이 커진다. 라인 정지, 비상 정지, 작업자 개입, 품질 반려는 데이터셋에서 제거할 잡음이 아니라 다음 배포를 막거나 수정하게 만드는 기준점이다. 생산 개선 순환의 성숙도는 성공 구간 수가 아니라 희귀 실패를 얼마나 빨리 식별하고 재현하는지로 판단해야 한다.

데이터 단계 핵심 질문 고객이 보존할 증거
배포 전 새 작업을 시작할 만큼 일반화했는가 데이터 출처, 기준 평가, 알려진 실패 범위
배포 중 어느 상태에서 사람과 안전장치가 개입했는가 시도 식별자, 인계 전후 상태, 정지·복구 사유
배포 후 변경이 품질과 운영을 실제로 개선했는가 지연 품질 판정, 고정 재현 세트, 승인·되돌리기 기록

Covariant: 물류 분포를 모델 자산으로 만들기

Covariant의 RFM-1 주장은 물류 조작이 왜 개선 순환에 유리한지 보여 준다 [1]. 물류 셀은 SKU가 많고 포장이 자주 바뀌지만, 성공과 실패가 비교적 빠르게 판정되고 같은 집기·분류 계열 작업 회차가 대량으로 나온다. 이는 [4]의 대규모 실물 로봇 집기, [5]의 다중 로봇 데이터, [6]의 교차 영역 데이터가 이어 온 흐름과 잘 맞는다.

하지만 물류 성공이 곧 제조 전체 성공은 아니다. 제조 셀은 부품 공차, 표면 처리, 고정구 정렬, 하류 검사가 더 엄격하다. Covariant식 개선 순환을 제조에 가져오려면 물체 분류보다 실패 분류체계가 먼저 설계되어야 한다. "집지 못했다"는 로그 하나로는 부족하고, 미끄러짐, 가림, 포장 눌림, 잘못된 상자, 과도한 힘, 하류 반려가 분리되어야 한다.

Covariant식 접근이 특히 강한 곳은 긴 꼬리 물체 변동이다. 포장, 조명, 상자 안 혼잡, 부분 가림처럼 지각과 집기 계획이 계속 바뀌는 영역에서는 여러 현장의 데이터가 빠르게 도움이 된다. 제조사가 이 구조를 평가할 때는 SKU 수가 많은 셀을 무작정 고르기보다 실패가 빠르게 판정되는 셀을 고르는 편이 좋다. 실패 판정이 늦거나 모호하면 개선 순환은 느리게 돈다.

반대로 정밀 조립이나 외관 민감 취급에서는 물류 선행 모델만으로 부족할 수 있다. 작은 긁힘, 거스러미, 삽입력, 부품 변형은 물류 집기 성공과 다른 판정을 요구한다. 이 경우 Covariant류 공급자를 배제할 필요는 없지만, 추가 힘·촉각 계측과 하류 품질 시스템 연동을 요구해야 한다. 생산 개선 순환은 공급자의 기본 영역을 넘어설 때 더 엄격한 측정 설계가 필요하다.

Dexterity: 작업 셀 추상화와 복구 흐름

Dexterity는 모델 하나보다 작업 셀 전체를 제품으로 제시한다 [2]. 이 접근은 제조 친화적이다. 실제 현장에서는 로봇 팔, 말단장치, 고정구, 컨베이어, PLC, 안전 스캐너, 작업자 조작대가 함께 움직이며, 정책 모델은 그중 한 구성요소일 뿐이다. 작업 셀 추상화가 좋으면 실패가 발생했을 때 사람에게 넘길지, 보호된 재시도를 할지, 라인을 정지할지 결정하기 쉽다.

Dexterity식 접근의 핵심 평가 항목은 복구다. 로봇이 한 번 성공하는 영상보다 실패 후 어떤 상태로 돌아오고 어떤 데이터를 남기는지가 중요하다. 특히 트럭 적재, 혼합 상자 팔레트 적재, 산업용 상자 취급처럼 접촉과 형상이 복잡한 작업에서는 재시도가 새로운 위험을 만들 수 있다. 그러므로 고객사는 복구 정책과 안전 경계를 공급자만 아는 비공개 영역으로 두지 말고, 적어도 재현 가능한 로그와 업데이트 승인권을 가져야 한다.

작업 셀 공급자의 장점은 통합 부담을 줄이는 데 있다. 제조사는 로봇 학습보다 라인 균형, 안전 인증, MES 연동, 유지보수 교육을 더 걱정하는 경우가 많다. Dexterity류 접근은 모델과 셀 구조를 함께 제공하므로 초기 배포 속도를 높일 수 있다. 대신 고객은 공급자가 정의한 추상화 밖에서 문제를 고치기 어려워질 수 있다.

따라서 작업 셀 개선 순환에서는 "누가 복구를 수정할 수 있는가"가 핵심이다. 작업자 인계가 자주 발생한다면 이것이 정책의 약점인지, 고정구 문제인지, 상류 자재 변동인지 분리해야 한다. 복구가 공급자 논리 안에만 있으면 고객은 수동 보조가 늘어도 원인을 찾기 어렵다. 반대로 복구 상태를 내보낼 수 있으면 고객은 배치 변경, 고정구 개선, 정책 업데이트 중 어디에 투자할지 결정할 수 있다.

Chef Robotics: 식품 제조의 까다로운 데이터

Chef Robotics는 제조와 서비스의 중간처럼 보이는 식품 제조를 겨냥한다 [3]. 이 영역은 데이터 관점에서 독특하다. 재료는 젖고, 미끄럽고, 변형되며, 정량 담기 기준은 시각뿐 아니라 무게와 위생 규칙에 연결된다. 같은 뜨기 동작도 온도, 점도, 용기 깊이, 알레르겐 전환, 세척 상태에 따라 다른 분포가 된다.

따라서 식품 개선 순환은 영상만으로 잰 성공률보다 품질 판정 설계가 더 중요하다. 담은 무게, 흘림, 번짐, 재료 누락, 오염 보류, 작업자 교정이 작업 회차에 붙어야 한다. 이 데이터를 공급자만 소유하면 제조사는 레시피나 공정 개선의 원인을 잃는다. 반대로 고객사가 이 판정을 소유하면 로봇 셀은 단순 자동화 장비가 아니라 품질 개선 센서가 된다.

식품 영역은 접촉이 많은 조작의 극단 사례다. 재료가 흐르고, 뭉치고, 달라붙고, 시간이 지나면 상태가 바뀐다. 영상 모델은 표면을 볼 수 있지만 점도와 끈적임을 직접 보지 못한다. 따라서 무게 센서, 힘·토크, 도구 상태, 용기 형상, 위생 일정이 정책 데이터와 연결되어야 한다. ChefOS 같은 플랫폼의 주장은 이 운영 데이터를 얼마나 잘 묶는지로 평가해야 한다.

또한 식품 제조는 작업자 수용성과도 연결된다. 사람 작업자는 맛, 모양, 위생, 속도를 동시에 판단하고 작은 조정으로 품질을 맞춘다. 로봇이 이 작업을 대체하려면 작업자 교정을 실패로만 보지 말고 교육 신호로 남겨야 한다. 작업자가 "이 정도는 담지 말라"거나 "이 재료는 더 천천히 긁어라"라고 수정한 순간이 레시피별 정책 업데이트의 출발점이 된다.

비미국 규모 비교: AgiBot World

AgiBot World는 미국 생산 공급자와는 다른 형태의 규모 기준이다 [10]. 대규모 조작 플랫폼은 많은 로봇 몸체와 과제를 한꺼번에 다룰 수 있다는 점에서 유용한 비교축이다. 그러나 공개 데이터셋 규모는 생산 운영 기록과 다르다. 고객 현장의 예외, 라인 정지, 작업자 재정의, 보증 청구는 대개 공개 데이터셋에 들어가지 않는다.

이 차이를 이해하면 "많은 궤적"과 "닫힌 개선 순환"을 구분할 수 있다. 궤적 수는 모델 사전학습의 힘을 말해 주지만, 개선 순환은 어떤 궤적이 다음 배포를 막거나 승인했는지까지 기록할 때 닫힌다.

그래도 AgiBot World류 규모는 제조사에게 중요한 기준선을 준다. 공급자가 "우리는 많은 데이터를 갖고 있다"고 말할 때, 제조사는 그 데이터가 공개 데이터셋 규모인지, 독점 생산 운영 기록인지, 모의실험 실행인지 구분할 수 있어야 한다. 각각은 다른 장점과 다른 위험을 가진다. 공개 데이터셋은 비교 가능성이 있고, 독점 운영 기록은 현장성이 있으며, 모의실험은 변형 생성 속도가 빠르다.

하지만 세 종류 모두 품질 판정과 연결된 공장 재현 시험을 대체하지 못한다. 모의실험은 접촉 충실도에 한계가 있고, 공개 데이터셋은 고객 지식재산과 라인 정지를 담기 어려우며, 공급자 운영 기록은 고객별 가시성이 제한될 수 있다. 그러므로 규모 비교의 목적은 공급자 주장을 깎아내리는 것이 아니라 어떤 데이터 출처가 어떤 빈칸을 남기는지 찾는 것이다.

데이터 규모와 사람 검토, 수집 장면, 로봇 플랫폼, GO-1을 요약한 AgiBot World Colosseo Figure 1

그림 10.3. AgiBot World Colosseo의 그림 1은 저자들이 보고한 100만+ 궤적, 100+ 로봇, 사람 검토 흐름과 GO-1 비교 결과를 한 장에 요약한다. 수집 규모와 막대값은 논문 저자의 자료·평가에서 나온 값이며, 고객 셀의 라인 정지·품질 판정·업데이트 재현 시험을 포함한 독립 생산 근거가 아니다. 출처: AgiBot-World-Contributors et al., 2025, arXiv:2503.06669, 그림 1, 1쪽.

데이터 권리와 운영 KPI

생산 공급자와 계약할 때 가장 중요한 문장은 모델 성능표가 아니라 데이터 권리 조항일 수 있다. 고객사는 자기 셀에서 생성된 작업 회차, 품질 판정, 정지 사유, 작업자 메모, 업데이트 결과를 최소한 집계·분석·내보낼 수 있어야 한다. 공급자가 공통 모델 개선을 위해 데이터를 가져가더라도, 고객 공정의 개선 원인은 고객이 설명할 수 있어야 한다.

공급자의 배포 성능 주장은 고객이 실패를 독립적으로 재현하고, 업데이트 전후 효과를 검사하며, 필요한 데이터를 내보내고, 악화 시 되돌리기를 실행할 수 있기 전까지 1차 당사자 주장으로 남는다 [29], [2], [3]. 예를 들어 Dexterity가 Instinct 소개 글에서 공개한 854회 배치 표본과 성공률·시간 통계는 해당 회사가 보고한 트레일러 적재 로봇군의 관측 범위를 알려 준다. 외부 감사, 표본 추출 틀, 비교 대조군이 공개되지 않은 상태에서 이 수치를 다른 공정의 보편적 준비도로 읽어서는 안 된다.

운영 KPI도 모델 KPI와 다르다. 성공률이 올라가도 사이클타임 꼬리가 길어지거나, 재작업이 하류로 밀리거나, 작업자 개입이 늘면 제조 관점에서는 실패다. 따라서 생산 개선 순환의 현황판은 집기 성공, 복구 성공, 수동 보조 시간, 폐기·재작업, 품질 반려, 안전 정지, 업데이트 되돌리기를 함께 봐야 한다.

데이터 권리는 원본 영상을 모두 복제하는 권리와 같지 않다. 개인정보나 고객 제품 정보 때문에 영상 반출을 제한하더라도 시도 색인, 사건 코드, 동기화된 궤적, 품질 판정, 모델·제어기 버전, 재현 판정은 고객이 보존할 수 있다. 반대로 영상만 넘겨받고 사건 스키마와 버전 정보가 없다면 정책 악화를 재현하기 어렵다. 계약은 원본, 비식별, 파생, 집계 층을 나누고 각 층의 보존 기간, 사용 목적, 삭제와 공급자 전환 절차를 정해야 한다.

안전·품질·재현 시험을 하나의 릴리스 게이트로 묶기

생산 업데이트는 학습 작업이 끝났다고 배포해서는 안 된다. 첫 단계는 고정 재현 시험 세트다. 정상 사례뿐 아니라 과거 라인 정지, 수동 개입, 품질 유출, 센서 표류, 도구 마모, 공급자 로트 변경을 포함한다. 둘째는 비작동 평가다. 새 정책이 같은 관측을 받되 실제 구동 권한을 갖지 않게 하여 명령 차이와 안전 경계 접근을 본다. 셋째는 제한된 셀·교대·제품군에서의 시험 배포다. 마지막으로 품질팀과 안전 책임자가 공정 KPI와 사건 로그를 함께 검토해 승격 또는 되돌리기를 결정한다.

재현 시험은 비디오를 다시 보는 일이 아니다. 정책 입력, 내부 상태, 행동 후보, 저수준 제어기, 안전 인터록, PLC 전이를 같은 버전 조합으로 재구성해야 한다. 완전한 결정론을 얻기 어려운 확률 정책은 동일 난수 초기값뿐 아니라 여러 초기값에서 실패 확률과 행동 분산을 본다. 접촉 작업은 모의실험 재현과 실물 고정구 재현을 구분한다. 전자는 많은 변형을 빠르게 거를 수 있지만, 마찰·컴플라이언스·센서 표류가 다른 실제 접촉을 최종 승인하지 못한다 [11].

품질 게이트는 평균을 통과시키는 장치가 아니라 위험 등급별 하한을 지키는 장치다. 안전 정지와 충돌 근접은 낮을수록 좋지만, 특정 작업에서 정지 감소가 위험 감지 둔화 때문일 수도 있다. 오정지, 놓친 위험, 제품 손상, 인명 접근 시 감속, 복구 중 재시도 횟수를 함께 본다. 품질 역시 전체 반려율뿐 아니라 외관, 치수, 조립, 오염 같은 불량 등급과 제품 로트별 신뢰구간을 본다. 표본이 작은 희귀 실패는 통계적 승리를 주장하기보다 "미해결이므로 승격 금지" 상태로 남기는 편이 안전하다.

업데이트의 단위도 분리해야 한다. 지각 부호화기, 행동 정책, 저수준 제어기, 집기 계획기, 안전 임계값, 도구 보정을 한꺼번에 바꾸면 개선 원인을 알 수 없다. 긴급한 보안·안전 패치를 제외하면 변경 묶음을 작게 유지하고, 각 변경에 데이터셋 계보와 승인자를 연결한다. 되돌리기는 이전 모델 파일만 복원하는 것이 아니라 호환되는 전처리, 제어 파라미터, 도구 보정, PLC 상태기계까지 함께 되돌려야 한다.

릴리스 단계 주 책임 통과 증거 즉시 중단 조건
고정 재현 시험 ML·공정 엔지니어 기존 성공과 실패군에서 비열화, 원인별 결과 과거 안전·품질 실패의 재발
비작동 평가 제어·안전 엔지니어 명령 차이, 인터록 접근, 지연이 허용 범위 안전 경계 초과 또는 로그 불완전
시험 배포 생산·품질 책임자 제한된 로트에서 처리량과 불량 등급 동시 충족 품질 유출, 보조 시간, 정지 꼬리 악화
승격·감시 변경 승인 위원회 서명된 계보, 재현 시험 보고서, 되돌리기 연습 책임자·복구본·관측 현황판 중 하나라도 부재

PoC 설계 예시: 세 공급자를 같은 셀에서 보기

한 제조사가 다품종 포장 부품을 상자에서 꺼내 검사기로 보내는 셀을 자동화한다고 하자. Covariant류 공급자는 SKU 다양성과 물류 집기 경험을 근거로 빠르게 후보가 될 수 있다. Dexterity류 공급자는 컨베이어, 로봇, 안전, 작업자 인계가 포함된 작업 셀 설계로 접근할 수 있다. Chef Robotics류 공급자는 식품 작업이 아니므로 직접 후보가 아닐 수 있지만, 변형되는 포장이나 끈적한 재료가 있다면 품질 판정과 작업자 교정을 다루는 방식에서 배울 점이 있다.

첫 주에는 로봇을 고르기보다 기록 방식을 고정한다. SKU, 로트, 상자 자세, 그리퍼 모드, 로봇 시도, 작업자 개입, 검사 결과를 하나의 키로 묶는다. 기존 사람이 하던 작업에서도 같은 스키마를 일부 적용해 기준선을 만든다. 사람이 실패를 어떻게 회복하는지 모르면 공급자 로봇의 복구가 좋은지 나쁜지도 평가할 수 없다.

둘째 주에는 공급자별로 같은 재현 시험 묶음을 준다. 성공 30개, 실패 30개, 희귀 실패 10개 정도면 충분히 시작할 수 있다. Covariant류 후보에게는 긴 꼬리 물체 변동과 반려 연계를 묻고, Dexterity류 후보에게는 복구 상태와 PLC 인계를 묻는다. 모든 후보에게 업데이트 전후 재현 시험 결과와 고객 데이터 반출 범위를 요구한다.

셋째 주에는 KPI 현황판을 나눈다. 로봇 성공, 셀 처리량, 수동 보조, 하류 반려, 안전 정지, 업데이트 되돌리기를 서로 다른 그래프로 본다. 하나의 평균 성공률로 합치지 않는다. 생산 현장에서는 어떤 KPI가 좋아지고 어떤 KPI가 나빠졌는지 보는 것이 중요하다. 특히 처리량이 좋아졌지만 하류 반려가 늘면 개선 순환은 잘못 돌고 있는 것이다.

이 예시는 공급자별 장단점을 더 공정하게 만든다. Covariant류 후보는 물체 변동에서 강하고, Dexterity류 후보는 복구와 셀 통합에서 강하며, 식품류 플랫폼은 재료 변동과 품질 판정 설계에 강할 수 있다. 제조사는 자기 셀의 실패 구조를 먼저 드러내야 어떤 강점이 실제로 필요한지 알 수 있다.

PoC 종료 시점에는 "어느 공급자가 이겼는가"만 기록하지 않는다. 어떤 실패 코드가 아직 설명되지 않았는지, 어떤 필드를 내보낼 수 없는지, 어떤 KPI가 개선됐지만 다른 KPI를 악화시켰는지 남긴다. 이 기록은 다음 공급자 협상에서 더 중요하다. 첫 PoC의 가치는 최종 선택보다 공장 운영 기록 요구사항을 선명하게 만든 데 있을 수 있다.

또 하나의 종료 조건은 내부 운영팀의 독립성이다. 공급자 팀이 옆에 있을 때만 문제가 해결된다면 생산 개선 순환은 아직 고객 자산이 아니다. 현장 엔지니어가 재현 시험 결과를 읽고, 품질팀이 불량 코드 변화를 해석하며, 유지보수팀이 센서 표류를 데이터 스키마에 반영할 수 있어야 다음 셀로 확장할 수 있다.

마지막으로 재무 관점도 포함해야 한다. 로봇이 성공률을 높여도 수동 보조가 줄지 않거나, 재작업 위치가 하류로 이동하거나, 위생 작업 시간이 늘면 ROI가 흔들린다. 생산 개선 순환의 경제성은 모델 학습 곡선이 아니라 노동 대체, 품질 유출 감소, 비가동 시간 감소, 공학 지원 비용 감소가 함께 움직일 때 생긴다.

제조 셀 적용 체크포인트

체크포인트 Covariant류 물류 개선 순환 Dexterity류 작업 셀 개선 순환 Chef Robotics류 식품 개선 순환
시도 스키마 SKU, 상자 상태, 집기 결과, 하류 반려가 연결되는가 PLC 상태, 복구 경로, 작업자 인계가 연결되는가 레시피, 무게, 위생, 재료 상태가 연결되는가
업데이트 게이트 SKU 변동과 긴 꼬리 실패의 재현 시험이 있는가 보호된 재시도와 안전 경계의 재현 시험이 있는가 정량 품질과 오염 보류의 재현 시험이 있는가
고객 권리 고객별 실패를 내보낼 수 있는가 복구 로그와 셀 상태를 내보낼 수 있는가 품질 판정과 작업자 교정을 내보낼 수 있는가
KPI 연결 집기 성공이 폐기·재작업과 연결되는가 처리량이 수동 보조와 함께 보고되는가 속도가 무게·외관·위생 품질과 함께 보고되는가

이 표는 공급자 범주별로 같은 질문을 다르게 묻는 방법이다. 물류 개선 순환은 물체 분포와 예외 발굴이 핵심이고, 작업 셀 개선 순환은 복구와 라인 통합이 핵심이며, 식품 개선 순환은 재료 변동과 품질 판정이 핵심이다. 같은 "생산 데이터"라는 표현을 쓰더라도 필요한 필드와 권리는 다르다.

열린 질문과 실패 모드

첫째, 공급자의 공통 모델이 좋아지는 것과 고객 셀의 KPI가 좋아지는 것을 혼동한다. 둘째, 실패 사유가 비어 있는 성공·실패 이진값만 남기면 재학습 데이터는 쌓여도 공정 원인은 사라진다. 셋째, 업데이트가 자동으로 배포되면 일시적 성능 개선과 장기적 품질 악화를 구분하지 못한다. 넷째, 식품이나 제조처럼 위생·품질·안전 규칙이 강한 영역에서 카메라 로그만 믿으면 접촉과 검사 실패가 사후에 발견된다.

열린 질문은 생산 운영 기록이 대부분 회사의 비공개 자료라는 데서 생긴다. 공개 논문은 로봇 학습의 방향을 설명하지만, 실제 재정의, 재작업, 비가동 시간, 안전 정지 분포는 거의 공개되지 않는다. 제조사는 이 빈칸을 이유로 모든 공급자를 의심하는 데서 멈추면 안 된다. 대신 계약, PoC 설계, 내부 계측으로 자기 셀의 운영 기록을 먼저 확보해야 한다.

배포·로깅·개입·수용 또는 되돌리기의 생산 개선 게이트

그림 10.4. 배포·로깅·개입·수용 또는 되돌리기의 생산 개선 게이트. 이 도식은 성능 주장이 아니라, 능력 근거가 재현과 품질 판정을 거쳐 배포 권한으로 넘어가는 운영 책임 체인을 요약한다. 출처: 저자 제작 SVG.

다음에 배울 것

다음 장은 개선 순환을 만드는 손과 센서의 문제로 들어간다. 같은 운영 로그라도 2지 그리퍼, 흡착, 커스텀 툴, 5지 손이 남길 수 있는 실패 신호는 다르다.

참고문헌

  1. Covariant (2024). RFM-1: Robotics Foundation Model. Company technical post.
  2. Dexterity (2025). Dexterity Foresight: AI Platform for Industrial Robot Workcells. Company product page.
  3. Chef Robotics (2025). ChefOS: AI Robotics Platform for Food Manufacturing. Company product page.
  4. Kalashnikov, Dmitry (2018). QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. arXiv.
  5. Dasari, Sudeep (2019). RoboNet: Large-Scale Multi-Robot Learning. arXiv.
  6. Ebert, Frederik (2021). Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets. arXiv.
  7. Brohan, Anthony (2022). RT-1: Robotics Transformer for Real-World Control at Scale. arXiv.
  8. O'Neill, Abby (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv.
  9. Khazatsky, Alexander (2024). DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset. arXiv.
  10. Team AgiBot-World (2025). AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems. arXiv.
  11. Li, Xingyu (2024). Evaluating Real-World Robot Manipulation Policies in Simulation. arXiv.
  12. Toyota Research Institute (2024). Large Behavior Models for Robot Manipulation. Company technical post.
  13. Physical Intelligence (2024). pi0: A Generalist Robot Policy. Company research post.
  14. Black, Kevin (2024). pi0: A Vision-Language-Action Flow Model for General Robot Control. arXiv.
  15. Octo Model Team (2024). Octo: An Open-Source Generalist Robot Policy. arXiv.
  16. Zhao, Tony Z. (2023). Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. arXiv.
  17. Chi, Cheng (2023). Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. arXiv.
  18. Mandlekar, Ajay (2021). What Matters in Learning from Offline Human Demonstrations for Robot Manipulation. arXiv.
  19. Yu, Jiawen (2025). ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation. arXiv.
  20. Ha, Huy (2024). Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots. arXiv.
  21. Choi, Hojung (2026). In-the-Wild Compliant Manipulation with UMI-FT. arXiv.
  22. Figure AI (2025). Helix: A Vision-Language-Action Model for Generalist Humanoid Control. Company announcement.
  23. Ross, Stéphane, Gordon, Geoffrey J., and Bagnell, J. Andrew (2011). A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. AISTATS.
  24. Kalashnikov, Dmitry et al. (2021). MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale. arXiv.
  25. Hoque, Ryan et al. (2021). ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning. arXiv.
  26. Liu, Huihan et al. (2023). Model-Based Runtime Monitoring with Interactive Imitation Learning. arXiv.
  27. Bousmalis, Konstantinos et al. (2023). RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation. arXiv.
  28. Luo, Jianlan et al. (2025). Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning. Science Robotics.
  29. Dexterity (2026). Introducing Instinct. Company engineering report.
  30. Aravind Rajeswaran et al. (2018). Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations. Robotics: Science and Systems.
  31. Tongzhou Mu et al. (2021). ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations. NeurIPS Datasets and Benchmarks.
  32. Suraj Nair et al. (2022). R3M: A Universal Visual Representation for Robot Manipulation. CoRL.
  33. Jiayuan Gu et al. (2023). ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills. ICLR 2023.
  34. Yongchao Chen et al. (2025). Code-as-Symbolic-Planner: Foundation Model-Based Robot Planning via Symbolic Code Generation. IROS.
  35. Zhongxuan Li et al. (2026). UniBiDex: A Unified Teleoperation Framework for Robotic Bimanual Dexterous Manipulation. arXiv preprint.
  36. Javier Romero et al. (2017). MANO: A Hand Model with Articulated and Non-rigid Deformations. SIGGRAPH Asia 2017.