Part I: 데이터 문제

Chapter 1: 데이터 규모 — 제조 적용 범위의 조건

집필일: 2026-06-18 최종수정일: 2026-07-22

개요

제조 매니퓰레이션에서 "대규모 데이터"는 더 많은 시연 영상을 뜻하지 않는다. 같은 집기, 삽입, 닦기처럼 보여도 품목, 치구, 표면 상태, 공구 마모, 작업자 개입과 검사 판정이 달라지면 학습 분포가 달라진다. Open X-Embodiment와 DROID는 로봇 데이터가 로봇 형상과 과제군을 넓힐 수 있음을 보여주지만 [1] [2], 제조 셀은 그 데이터를 품질 결과와 운영 기록에 묶을 때에만 개선 순환을 얻는다.

이 장의 핵심 단위는 "성공한 동작"이 아니라 검사 가능한 시도 단위(episode) 다. 이후에는 이를 시도 단위라고 부른다. 시도 단위는 관측, 요청 행동과 실제 실행 행동, 접촉 상태, 제어기 모드, 작업자 인수, 결함 코드, 재작업 여부와 되돌리기 조건을 함께 보존해야 한다. Bridge Data와 RoboNet 계열은 여러 영역 데이터의 장점을 보여주지만 [3] [4], 제조에서는 데이터셋의 행보다 그 시도가 어떤 공정 상태에서 태어났고 어떤 품질 결과로 끝났는지가 더 중요하다.

이 장을 읽고 나면... - 제조 매니퓰레이션을 모델 점수가 아니라 시도 단위와 품질의 연결 문제로 설명할 수 있다. - 성공률 평균보다 실패 분포, 재현성과 재생 시험 집합이 먼저 필요한 이유를 말할 수 있다. - 영상만 있는 데이터와 힘·촉각이 풍부한 데이터의 차이를 구분할 수 있다. - 첫 실증에서 제조사가 소유해야 할 최소 기록과 공급자에게 요구할 내보내기 항목을 정의할 수 있다.

제조 조작은 왜 일반 로봇 데이터보다 엄격한가

범용 로봇 데이터셋은 다양한 로봇, 장면과 지시를 섞어 정책의 외삽 능력을 키우려 한다. 제조 셀은 반대로 변화가 작아 보이는 반복 작업 안에서 작은 차이가 불량으로 이어지는 영역이다. 뚜껑 체결에서는 나사산 시작점, 병목의 미세 변형, 토크 제한과 누설 검사 코드가 시도 단위의 의미를 바꾼다. 식품 트레이 집기에서는 재료의 수분, 트레이 홈의 오염, 흡착 패드의 마모와 라인 속도가 같은 행동을 다른 결과로 만든다.

RoboNet은 여러 기관과 로봇의 행동 조건부 영상을 모았고 [4], MIME은 사람 영상과 운동감각 로봇 궤적을 짝지어 사람에서 로봇으로의 모방을 연구했다 [25]. 이 연구들은 한 연구실의 한 과제를 넘어서는 중요한 전환이지만, 짧은 밀기나 가정 과제의 범위와 힘이 동등하지 않은 시연이라는 경계가 있다. 최신 RoboTacDex도 다중 시점 영상, 깊이, 촉각과 로봇 상태를 동기화하지만 단일 플랫폼, 중간 규모 과제와 아직 제한된 공개 재현성이 남는다 [26].

따라서 데이터셋의 규모만으로는 공장 적용 범위를 입증할 수 없으며, 각 시도에 실패와 최종 결과의 맥락이 남아 있어야 한다 [4] [25] [26]. 적용 범위는 과제 이름의 수가 아니라 품목, 로트, 치구 판본, 접촉 단계, 검사 기준과 허용 주기 시간의 조합 가운데 실제로 수집하고 평가한 영역이다. 백만 개의 성공 영상도 특정 나사산 손상이나 밀봉 불량을 한 번도 표지하지 않았다면 그 결함에 대해서는 적용 범위가 없다. 이는 이 장이 제안하는 제조 인수 기준이다. 인용 자료는 로봇 간 또는 다중 감각 연구 범위를 보여줄 뿐, 독립 감사된 공장 적용 범위를 입증하지 않는다.

제조 데이터 개선 순환

그림 1.1. 제조 데이터 개선 순환. 생산 시도, 실패 기록, 재생 시험 집합과 모델 갱신이 닫힌 고리를 이룰 때 데이터가 누적 자산이 된다. 출처: 저자 제작 SVG.

큰 모델은 이 순환의 한 부품이다. RT-1, RT-2와 π0 계열은 넓은 과제 사전 지식을 제공하지만 [7] [8] [15], 제조사는 그 지식이 어떤 셀에서 어떤 결함 코드를 줄였는지 추적해야 한다. 따라서 이 책의 관점은 "어떤 모델이 가장 큰가"가 아니라 "어떤 시도가 다음 개선을 설명할 수 있는 데이터로 남는가"다.

반복 수집이 만든 역사적 전환

고전적인 조작 연구는 기하, 동역학과 접촉 모델을 명시하고 계획기와 제어기를 설계했다. 이 계보는 힘과 위치의 관계를 해석하고 안전 한계를 지정하는 데 여전히 중요하다. 다만 마찰, 물체 변형, 가림과 파지 결과를 모두 정확히 모델링하기 어려운 장면에서는 경험에서 정책을 학습하려는 동기가 커졌다. 모방학습 연구는 시연 획득, 사람과 로봇 사이의 대응, 정책 추출과 개선을 독립 문제로 정리했고 [28], 대규모 자기지도 수집은 로봇이 실패를 포함한 시도를 반복하여 영상 기반 파지를 배우는 길을 열었다.

대규모 실제 로봇 수집은 중요한 확장 계보를 만들었지만, 각 성능 향상은 사용한 로봇, 과제 분포와 평가 절차 안에서 해석해야 한다 [5] [27] [6]. Levine 등은 여러 로봇이 모은 파지 경험으로 영상 피드백 제어를 학습했고, QT-Opt는 오프폴리시 강화학습과 분산 수집을 결합하여 파지 중심의 실제 로봇 학습을 확장했다 [6] [5]. 이 결과는 반복 수집의 효용을 보여주지만 삽입, 조립, 닦기, 연성 물체 처리와 후공정 품질까지 자동으로 일반화하지 않는다.

특히 5만 회 시도와 700 로봇 시간으로 알려진 파지 결과는 2016년 자기지도 수집의 경계를 보여주는 사례이지, 모든 생산 과제에 필요한 보편적 데이터 양이 아니다 [27]. 그 실험의 이진 파지 결과는 물체를 들어 올렸는지 알려주지만, 다음 공정에 올바른 자세로 놓았는지, 표면을 손상했는지, 허용 주기 시간을 지켰는지는 말하지 않는다. 숫자를 데이터 예산으로 복사하는 대신, 어떤 변화 요인과 실패 양식이 학습 곡선을 움직였는지 다시 측정해야 한다.

역사적 결론은 “많이 모으면 된다”가 아니다. 규칙 기반 시스템이 명시한 상태와 제약을 버리지 않고, 반복 수집이 드러낸 미모델링 변화를 기록 구조에 포함해야 한다. 제조 현장에서는 기존 제어기와 안전 감시가 보낸 명령, 학습 정책이 제안한 명령, 실제 관절에 전송된 명령을 구분해야 한다. 그렇지 않으면 학습 정책의 오류와 안전 제어기의 수정 효과를 서로 바꿔 해석한다.

공장 시도 단위의 최소 구조

첫 실증에서 시도 단위의 자료 구조는 연구용 시연 형식보다 좁고 단단해야 한다. 카메라, 로봇 명령, 힘 센서, 검사기와 작업자 기록은 서로 다른 시계와 버퍼를 쓰므로 시작과 종료 시각만 맞춰서는 드문 실패를 복원하기 어렵다. 안전 정지나 작업자 인수는 기록이 가장 지저분해지는 순간이지만 학습에는 가장 비싼 표지다.

제조 시도 단위는 요청 행동과 실제 실행 행동을 작업자 개입, 초기화, 공정 결과, 결함 판정, 보정 및 판본 상태에 연결해야 한다 [29] [30] [26]. SOTER는 인증되지 않은 고성능 제어기와 인증된 저성능 안전 제어기를 안전 명세 아래 조합하는 실행 중 보증 구조를 제시했다 [30]. 상호작용 모방학습의 실행 중 감시 연구는 잠재 동역학 예측과 개입 표지로 위험한 미래를 가려 사람의 감시를 선택적으로 요청했다 [29]. 두 접근 모두 정책 출력과 현장에서 허용된 실행을 같은 값으로 저장하면 원인을 잃는다는 점을 보여준다. 이 분리는 실행 중 보증과 개입 연구에서 도출한 제조 기록 처방이다. 인용된 드론 및 연구용 조작 실험은 전체 시도 단위 스키마를 검증하거나 공장 안전 보증을 부여하지 않는다.

아래 표는 캡 체결, 트레이 집기, 압입 삽입처럼 반복되는 수작업을 자동화할 때 빠지면 안 되는 최소 항목이다.

시도 단위 필드 왜 필요한가 빠졌을 때의 실패
품목, 로트, 치구 판본 같은 작업처럼 보이는 분포를 나눈다 다른 로트의 실패를 모델 오류로 오진한다
도구 식별자와 보정 판본 파지 형상과 센서 편차를 추적한다 하드웨어 변경 뒤 성능 하락 원인을 잃는다
제안·전송·실행 행동 정책과 제어기, 구동기의 차이를 보존한다 안전 제한의 수정 효과를 정책 성능으로 센다
힘·토크 또는 촉각 사건 미끄러짐, 걸림과 과도한 힘을 관측한다 영상상 성공이 실제 불량을 숨긴다
개입·초기화·복구 코드 실패 주변의 운영 비용을 남긴다 사람 노동이 늘어도 자동화 성공으로 기록한다
제어기 모드와 보호 상태 학습 행동과 결정론적 대체 동작을 분리한다 정책 갱신이 안전 정지를 늘려도 설명하지 못한다
검사 결과와 결함 코드 학습 목표를 공정 KPI에 묶는다 성공 영상은 늘지만 폐기와 재작업이 줄지 않는다
자료·모델·보정 판본 재현과 되돌리기를 가능하게 한다 어떤 갱신이 셀을 바꿨는지 설명할 수 없다
재생 시험 집합 포함 여부 다음 배포의 회귀 시험을 만든다 같은 실패가 판본마다 되살아난다

이 스키마는 공급자 종속 문제이기도 하다. 데이터 권리가 로봇 공급자에게만 있으면 제조사는 "모델이 좋아졌다"는 말을 검증할 수 없다. Covariant, Dexterity, Chef Robotics처럼 운영 데이터가 곧 제품 개선 루프가 되는 회사의 주장은 중요하지만 [16] [17] [18], 제조사가 내보내기 가능한 시도 단위와 배포 판본 관문을 요구하지 않으면 개선의 원인은 외부 블랙박스 안에 남는다.

실패 분포가 성공률보다 먼저다

제조 셀에서 평균 성공률은 늦게 보는 지표다. 초기에는 어떤 실패가 반복 가능하고, 어떤 실패가 센서 사각지대에서 나오며, 어떤 실패가 하드웨어 편차에서 오는지를 먼저 나누어야 한다. QT-Opt와 대규모 파지 계열은 반복 수집의 힘을 보여주었지만 [5] [6], 공장에서는 실패가 검사 코드와 연결되지 않으면 재학습 대상이 흐려진다.

실패 분포를 먼저 보는 이유는 되돌리기 때문이다. 새 정책이 전체 성공을 2% 올려도 특정 SKU의 긁힘 결함을 늘리면 배포할 수 없다. 반대로 평균 성공이 그대로여도 라인 정지를 만드는 드문 실패가 줄면 현장 가치는 크다. 그래서 재생 시험 집합은 기준 시험이 아니라 배포 안전장치다. 생산 배포 판본마다 "지난 주 안전 정지, 과도한 힘, 집기 실패, 잘못된 토크, 작업자 인수"를 재현하고 통과 여부를 기록해야 한다.

접촉 신호는 선택 사항이 아니다

카메라만으로 충분한 작업도 있다. 그러나 삽입, 닦기, 식품 집기, 케이블 배선과 연성 포장 취급은 접촉 상태가 성패를 가른다. Billard와 Kragic은 로봇 조작의 진전에도 일반화와 접촉이 많은 과제가 계속 남아 있음을 정리했다 [31]. DIGIT 계열은 손끝 접촉을 영상과 같은 촉각장으로 만들 수 있음을 보여주고 [14], RH20T는 영상, 힘, 음향, 행동과 언어를 동기화한 다중 감각 자료 설계를 제시했다 [32].

자세와 RGB 영상만으로는 접촉이 많은 실행을 충분히 규정하지 못할 수 있다. 시각적으로 비슷한 궤적도 힘, 촉각, 순응성과 후공정 품질이 다를 수 있기 때문이다 [26] [33] [31]. RoboTacDex는 다중 시점 영상과 깊이, 촉각, 로봇 상태와 의미 표지를 동기화한 인간형 로봇 자료를 제시한다 [26]. DexForce는 운동감각 시연 중 두 손끝의 6축 힘·토크 센서로 측정한 힘을 힘 정보가 반영된 행동 목표로 변환한다 [33]. 어느 연구도 보편적인 공장 전이를 입증하지 않는다. RoboTacDex는 단일 플랫폼과 19개 과제, 공개 예정 상태에 묶여 있고, DexForce는 한 손 플랫폼, 두 힘·토크 센서, 과제별 순응성 조정과 준정적 스프링 가정에 의존한다.

접촉이 많은 데이터를 만드는 촉각 손끝

그림 1.2. 접촉이 많은 데이터를 만드는 촉각 손끝. 접촉 위치, 압력 무늬와 미끄러짐의 변화는 외부 영상 기록만으로 복원하기 어렵다. 출처: Meta AI Research Digit 360 GitHub, MIT License.

제조 관점에서 촉각 센서의 가치는 더 인간 같은 손을 만드는 데 있지 않고 실패 원인을 나누는 데 있다. 과도한 힘으로 눌렀는지, 치구에 먼저 닿았는지, 물체가 회전했는지, 표면 오염 때문에 미끄러졌는지를 시도 단위 안에 남긴다. 이 정보가 있어야 같은 실패를 하드웨어, 제어기, 정책과 공정 조건 문제로 나눌 수 있다. 다만 센서는 보정, 오염, 교체 주기, 케이블 단선과 시간 동기화 비용을 만든다. 센서 도입은 양식을 늘리는 일이 아니라 현재 구분하지 못하는 비싼 실패를 안정적으로 분리하는지로 판단해야 한다.

의사결정 검토: 캡 체결 셀

캡 체결 셀을 처음 자동화한다고 하자. 사람 작업자는 병목에 캡을 올리고, 살짝 눌러 나사산 시작점을 찾고, 회전하면서 걸리는 느낌을 확인하고, 토크가 이상하면 바로 풀었다가 다시 시작한다. 영상으로 보면 이 과정은 "집고 돌린다"에 가깝지만, 제조 데이터로 보면 나사산 시작, 축방향 힘, 토크 기울기, 캡 기울어짐, 누설 검사 결과가 분리되어야 한다. 이 구분이 없으면 정책은 "성공한 회전"만 배우고 나사산 어긋남을 만든 순간을 모른다.

첫 번째 실험은 큰 파운데이션 모델을 고르는 일이 아니다. 기존 수작업 200-300 주기를 시도 단위 구조로 기록해 어떤 결함이 비용을 만드는지 먼저 확인한다. 토크 부족이 주된 문제라면 토크 추적 기록과 최종 검사가 중요하고, 긁힘이 문제라면 접촉 경로와 파지 힘이 중요하다. 누설 결함이 뒤 공정에서 늦게 발견된다면 시도 단위 ID가 후공정 검사까지 살아 있어야 한다. 이 단계에서 DROID나 Open X-Embodiment 같은 광범위한 데이터 사전 지식은 도움이 되지만 [1] [2], 실제 학습 목표는 해당 셀의 결함 분류에서 나온다.

두 번째 실험은 로봇이 만든 실패를 재생 시험 집합으로 고정하는 일이다. 초기 정책이 나사산 어긋남을 만들면 그 시도 단위는 단순 실패 기록이 아니라 다음 배포 판본을 막는 시험 사례가 된다. 같은 SKU, 같은 치구, 같은 토크 한계에서 새 모델이 실패를 줄였는지 확인해야 한다. 반대로 모델이 성공률을 올렸지만 작업자 인수를 늘리거나 주기 시간 편차를 키우면 현장 가치는 낮다. 그래서 시도 단위에는 "성공/실패"뿐 아니라 배포 판본 판단에 필요한 운영 지표가 함께 들어간다.

데이터 레이크가 시도 단위를 뭉갤 때 생기는 문제

제조사가 흔히 빠지는 함정은 모든 센서 흐름을 데이터 레이크에 넣고 나중에 맞추면 된다고 생각하는 것이다. 그러나 타임스탬프만으로는 충분하지 않다. 카메라 프레임, 로봇 명령, 힘 사건, 검사 결과, 작업자 메모가 서로 다른 시계와 버퍼를 쓰면 드문 실패의 원인을 나중에 복원하기 어렵다. 특히 안전 정지나 작업자 인수는 사람이 개입하는 순간이라 로그가 더 지저분해진다.

데이터가 뭉개지는 지점 현장 증상 수집 설계에서 막는 방법
센서 시계 불일치 접촉 사건과 영상이 어긋난다 시도 단위 시작/종료와 하드웨어 시계 오프셋을 함께 저장
검사 지연 나중에 발견된 불량이 학습 시도 단위와 분리된다 후공정 QA 결과가 원 시도 단위 ID로 되돌아오게 설계
작업자 메모 자유서술 같은 실패가 여러 이름으로 기록된다 자유서술과 표준 결함 코드를 동시에 저장
모델 배포 판본 기록 누락 어떤 갱신이 개선했는지 설명할 수 없다 모델, 데이터셋, 재생 시험 집합 해시를 배포 판본 기록에 고정

이 표는 데이터 엔지니어링 세부사항처럼 보이지만 실제로는 학습 가능성의 조건이다. 실패 원인이 시도 단위에 묶이지 않으면 다음 수집은 "더 많이 모으기"가 되고, 학습 시스템은 가장 비싼 결함이 아니라 가장 많이 보이는 패턴에 끌린다. Bridge Data와 RoboNet이 보여준 교차 영역 일반화는 중요하지만 [3] [4], 제조에서는 영역을 넓히는 힘과 결함을 좁히는 힘이 동시에 필요하다.

작은 셀에서 큰 데이터 전략으로 넘어가는 순서

첫 셀에서 곧장 범용 정책을 배포하려고 하면 데이터가 왜 필요한지 흐려진다. 더 안전한 순서는 좁은 셀, 강한 기록, 범위가 제한된 정책, 배포 판본 재생 시험 순서다. 먼저 작업군을 좁혀 시도 단위 구조를 안정화하고, 그다음 실패 분류를 만든다. 이후 더 넓은 사전 지식을 가져오더라도 셀별 재생 시험 집합을 통과하지 못하면 배포하지 않는다.

이 순서는 회사 전략을 평가할 때도 유용하다. Covariant나 Dexterity처럼 생산 작업 셀을 강조하는 회사는 운영 데이터 루프의 언어를 사용하고 [16] [17], Chef Robotics는 식품 제조처럼 반복성과 변이가 동시에 있는 영역을 겨냥한다 [18]. 하지만 제조사가 보아야 할 것은 회사의 용어가 아니라 내보내기 가능한 근거다. 어떤 결함이 줄었는지, 어떤 데이터 원천이 그 개선을 만들었는지, 되돌리기는 어떻게 실행되는지 확인해야 한다.

사람 시연은 힘을 관측해야 한다

UMI와 DROID는 사람 중심 수집 인터페이스가 로봇 데이터 병목을 완화할 수 있음을 보여준다 [10] [2]. 하지만 제조 작업은 사람이 잘하는 동작을 영상으로 많이 모으는 것만으로 닫히지 않는다. 사람이 "약간 비틀며 넣는" 동작, "걸리는 순간 힘을 빼는" 동작, "미끄러지기 전에 다시 잡는" 동작은 힘과 순응성이 기록되지 않으면 로봇에게 전달되지 않는다.

힘 정보를 보존하는 시연

그림 1.3. 힘 정보를 보존하는 시연. 접촉이 많은 작업에서는 사람 시연도 힘과 순응성을 포함해야 학습 단위가 된다. 출처: Chen et al. 2025, arXiv:2501.10356 Fig. 1.

UMI-FT처럼 힘을 포함하는 인터페이스는 이 공백을 줄이는 방향이다 [11]. 제조사는 시연 수보다 "시연이 어떤 접촉 사건을 남기는가"를 더 엄격히 봐야 한다. 특히 작업자 교정은 버릴 잡음이 아니다. 인수 시점, 이유, 복구 행동은 다음 정책이 피해야 할 영역을 알려주는 고가치 표지다.

연구 결과의 불일치와 증거 계층

역사적 연구와 최신 자료는 서로 다른 질문에 답한다. 대규모 파지 연구는 반복 수집의 효용을 보여주고, 다기관 자료는 분포 확장의 가능성을 보여준다. 촉각 자료는 관측의 누락을 줄이며, 실행 중 감시는 개입을 고가치 표지로 바꾼다. 어느 하나도 단독으로 생산 준비를 증명하지 않는다. 특히 논문 성능, 공식 기술 발표, 제품 시연과 독립적인 현장 검증은 같은 증거 등급이 아니다.

증거 원천 직접 뒷받침하는 것 직접 뒷받침하지 않는 것 제조 해석
대규모 실제 로봇 수집 특정 로봇·과제에서 수집 확대의 효과 모든 공정의 보편적 필요량 학습 곡선을 셀별로 다시 측정한다
다기관·다과제 자료 넓은 사전 지식과 전이 가능성 특정 결함과 주기 시간의 개선 사전 학습과 현장 인수를 분리한다
힘·촉각 자료 접촉 상태와 힘 의도의 추가 관측 센서 내구성이나 생산 신뢰성 고가치 실패를 분리하는지 시험한다
실행 중 감시·개입 자료 위험 상태와 복구 행동의 표지 모든 새로운 실패의 탐지 보장 개입 누락과 작업자 지연을 함께 기록한다

여기에는 실제 논쟁이 있다. 한쪽은 폭넓은 사전 학습이 적은 현장 시연으로 빠른 적응을 가능하게 한다고 본다. RT-1과 Open X-Embodiment의 흐름은 이 가설을 시험할 근거를 제공한다 [7] [1]. 다른 쪽은 로봇 형상, 행동 공간과 접촉 양식의 차이가 커서 공통 표현이 현장에 중요한 세부를 지울 수 있다고 지적한다. 현재 근거로는 둘 중 하나를 보편 법칙으로 선택할 수 없다. 넓은 사전 지식이 초기 탐색을 줄였는지와 현장 결함을 닫는 데 필요한 실제 시도가 얼마나 남는지는 분리해 보고해야 한다.

또 다른 논쟁은 실패 자료를 얼마나 적극적으로 수집할 것인가다. 실패는 정책 경계를 알려주지만 장비 손상과 폐기 비용을 만든다. ThriftyDAgger는 새롭거나 위험한 상태에서 사람에게 제어를 요청해 자료 효율을 높이려 하지만, 위험 추정기의 보정과 작업자의 지속적 가용성이 필요하다 [34]. 그러므로 실패를 많이 모으자는 구호 대신, 안전 한계 안에서 어떤 근접 실패와 개입을 기록하고 실제 위험 시도는 어떻게 차단할지 설계해야 한다.

이 책에서는 참고문헌을 같은 무게로 읽지 않는다. 논문은 방법과 실험 조건을 비교하기 좋고, 회사 기술 페이지는 제품 방향과 제공자가 보고한 운영 주장을 알려주며, 보도성 발표는 관찰 목록으로 둔다. Toyota Research Institute의 대형 행동 모델 발표는 로봇 교육 방향을 보여주지만 [19], 제조 배포의 기준은 여전히 셀 단위 품질검사, 작업자 인수, 되돌리기 권한과 자료 내보내기다.

이 구분은 구매 의사결정에서 중요하다. "대규모 데이터 기반"이라는 말이 있어도 공개된 근거가 기준 시험 성공인지, 원격조작 데이터셋인지, 생산 셀의 결함 감소인지가 다르면 위험이 다르다. 제조사는 공급자 시연을 볼 때 모델 이름보다 다음 네 가지를 물어야 한다. 첫째, 실패 시도 단위를 우리 결함 분류로 내보낼 수 있는가. 둘째, 모델 갱신 전후 재생 시험 결과를 비교할 수 있는가. 셋째, 힘/촉각/원본 영상의 보존 기간과 권리는 누구에게 있는가. 넷째, 되돌리기는 공급자가 아니라 현장 책임자가 실행할 수 있는가.

근거 등급을 운영 지표로 번역하기

논문에서 보고된 과제 성공은 방법론 비교에는 좋지만, 현장 구매 결정에는 한 번 더 번역이 필요하다. 예를 들어 RT-1, RT-2나 π0 계열의 광범위한 사전 지식은 새로운 지시를 이해하고 다양한 상황에 반응하는 능력을 보여준다 [7] [8] [15]. 그러나 캡 체결 셀에서는 그 능력이 나사산 손상, 누설 불합격, 작업자 재체결, 안전 정지를 줄이는지로 다시 읽어야 한다. 같은 모델이 한 셀에서는 유용하고 다른 셀에서는 과도한 범용성일 수 있다.

회사 기술 페이지도 마찬가지다. "생산 준비"라는 표현은 배포 경험을 암시하지만, 공개 페이지가 결함 분포와 되돌리기 권한을 자세히 보여주는 경우는 드물다. 따라서 제조사는 근거 등급을 내부 운영 지표로 번역하는 표를 만들어야 한다. 논문 결과는 어떤 가설을 검증하는가. 공급자 시연은 어떤 실패 모드를 가렸는가. 공식 제품 페이지는 어떤 내보내기와 지원 계약을 약속하는가. 이 질문들이 합쳐질 때 참고문헌이 단순 문헌 목록이 아니라 구매 위험 분석이 된다.

구축·구매 검토서: 데이터 소유권을 어떻게 계약할 것인가

첫 셀의 기술 검토가 끝나면 구축·구매 결정은 모델 성능표가 아니라 데이터 소유권 검토서로 넘어간다. 내부 구축을 선택하면 원본 시도 단위와 재생 시험 집합을 직접 소유하지만, 초기 모델과 운영 도구를 만드는 비용이 크다. 공급자 해법을 선택하면 배포 속도와 지원을 얻지만, 실패 원인 규명과 모델 갱신의 설명권이 외부에 남을 수 있다. 이 절충은 추상적인 전략 문제가 아니라 계약 조항으로 내려와야 한다.

검토서에는 최소 다섯 항목이 들어간다. 첫째, 원본 영상, 힘, 촉각, 로봇 명령, QA 표지의 보존 기간과 내보내기 형식. 둘째, 모델 갱신 때마다 제공되는 데이터셋 차이와 재생 시험 결과. 셋째, 작업자 인수와 안전 정지의 원인 코드. 넷째, 공급자가 만든 파생 특징을 제조사가 감사할 수 있는 범위. 다섯째, 긴급 되돌리기와 장기 되돌리기의 실행 권한. 이 항목이 없으면 제조사는 데이터를 냈지만 공정 학습은 소유하지 못한다.

결정 항목 내부 구축을 택할 신호 외부 해법을 택할 신호 어느 경우에도 남길 증거
원본 자료와 계보 공정 지식과 센서 원본을 직접 통제해야 한다 계약된 형식으로 완전한 시도 단위를 내보낼 수 있다 자료 구조, 보정 판본, 보존·삭제 기록
갱신과 회귀 내부 팀이 학습·평가 판본을 운영할 수 있다 공급자가 갱신 차이와 재생 시험 결과를 제공한다 자료·모델 해시, 결함별 전후 결과
운영과 안전 현장이 제어기·감시·복구를 직접 통합한다 공급 범위와 현장 안전 권한이 명확히 분리된다 개입·안전 정지 원인, 긴급 되돌리기 절차
종료와 이전 다음 셀로 구조와 시험을 재사용하려 한다 계약 종료 때 자료와 운영 지식을 이전받을 수 있다 종료 인수표, 미해결 실패, 재현 가능한 시험 묶음

개인정보와 공정 IP도 같은 검토서에서 다뤄야 한다. 작업자 영상은 작업자의 신체와 현장 노하우를 담고, 공정 영상은 치구와 순서 같은 영업비밀을 담는다. 따라서 대규모 데이터 전략은 거버넌스 전략이기도 하다. 어떤 데이터는 현장 내부에 남겨야 하고, 어떤 데이터는 특징으로만 공유해야 하며, 어떤 데이터는 학습 뒤 삭제해야 한다. 이 기준을 먼저 정하지 않으면 실증이 성공할수록 법무와 보안 위험이 커진다.

마지막 항목은 종료 조건이다. 실증이 끝났을 때 "성공률이 올랐다"가 아니라 "어떤 결함이 줄었고, 어떤 기록이 그 원인을 설명했으며, 다음 셀에도 재사용할 수 있는 구조가 무엇인가"를 남겨야 한다. 종료 조건이 불명확하면 시험 도입은 계속 늘어나지만 제조 학습은 남지 않는다. 반대로 결함별 개선과 내보낼 수 있는 시도 단위 구조가 남으면, 작은 셀 하나가 다음 셀의 데이터 표준이 된다.

이 기준은 연구와 제품을 연결한다. 논문은 가능한 방법을 보여주고, 공급자는 구현과 지원을 제공하며, 제조사는 공정 손실과 책임을 안다. 세 층을 하나로 묶는 단위가 시도 단위다. 그래서 이 장의 대규모 데이터 문제는 단순히 규모 문제가 아니라 "어떤 시도를 회사의 운영 기억으로 남길 것인가"의 문제다.

제조 셀 적용 체크포인트

첫 실증은 가장 화려한 과제가 아니라 기록이 닫히는 과제로 시작한다. 캡 체결이라면 토크 추적 기록, 나사산 시작, 누설 시험, 작업자 재체결을 시도 단위에 붙인다. 트레이 집기라면 흡착 압력, 집기 실패 복구, 재료 변형과 검사 불합격을 붙인다. 이 정보 없이 성공 영상만 모으면 모델 학습 곡선은 올라가도 공정 KPI는 움직이지 않을 수 있다.

데이터 파이프라인은 다음 순서로 검토한다. 먼저 시도 단위 ID가 모든 센서, 제어기, 검사 기록을 연결하는지 본다. 다음으로 실패 코드가 재생 시험 집합과 연결되는지 본다. 마지막으로 모델 배포 판본이 현장 되돌리기와 연결되는지 본다. 이 세 고리가 끊기면 대규모 데이터 전략은 제조 자산이 아니라 외부 시연 소비가 된다.

열린 문제와 실패 모드

첫째, 작업자 영상과 공정 IP는 학습 자산이면서 개인정보와 영업비밀 위험이다. 둘째, 촉각과 힘 센서는 보정, 세척, 내구성 비용을 만든다. 셋째, 시뮬레이션-현실 전이 처리량은 실제 QA 표지와 연결되지 않으면 공장 성능을 보장하지 않는다. 넷째, 기업 주장은 생산 원격 측정 자료를 충분히 공개하지 않는 경우가 많다.

가장 흔한 실패는 "데이터는 많지만 원인 설명이 없는 상태"다. 같은 집기 실패가 손 마모, 품목 변경, 조명 편차, 정책 퇴행 중 무엇 때문인지 모르면 다음 수집도 같은 곳을 반복한다. 이 책에서 대규모 데이터 매니퓰레이션은 이 원인 설명 능력을 키우는 운영 설계로 정의된다.

데이터 범위에서 업데이트 승인까지 연결하는 제조 릴리스 게이트

그림 1.4. 데이터 범위에서 업데이트 승인까지 연결하는 제조 릴리스 게이트. 이 도식은 성능 주장이 아니라, 능력 근거가 재현과 품질 판정을 거쳐 배포 권한으로 넘어가는 운영 책임 체인을 요약한다. 출처: 저자 제작 SVG.

다음에 배울 것

다음 2장은 이 시도 단위 관점을 말단장치 선택으로 옮긴다. 어떤 셀은 흡착기나 2지 그리퍼가 더 좋은 데이터 장치이고, 어떤 셀은 다지 손과 힘·촉각 관측 없이는 실패 원인을 볼 수 없다. 자유도가 많을수록 좋다고 가정하지 않고, 말단장치가 상태 공간, 수집 비용, 접촉 관측과 인수 시험을 어떻게 바꾸는지 비교한다.

참고문헌

  1. O'Neill, Abby (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv.
  2. Khazatsky, Alexander (2024). DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset. arXiv.
  3. Ebert, Frederik (2021). Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets. arXiv.
  4. Dasari, Sudeep (2019). RoboNet: Large-Scale Multi-Robot Learning. arXiv.
  5. Kalashnikov, Dmitry (2018). QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. arXiv.
  6. Levine, Sergey (2016). Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection. arXiv.
  7. Brohan, Anthony (2022). RT-1: Robotics Transformer for Real-World Control at Scale. arXiv.
  8. Brohan, Anthony (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv.
  9. AgiBot-World Contributors et al. (2025). AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems. arXiv.
  10. Ha, Huy (2024). Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots. arXiv.
  11. Choi, Hojung (2026). In-the-Wild Compliant Manipulation with UMI-FT. arXiv.
  12. Feng, Ruoxuan (2025). AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-Tactile Sensors. arXiv.
  13. Shaw, Kenneth (2023). LEAP Hand: Low-Cost, Efficient, and Anthropomorphic Hand for Robot Learning. arXiv.
  14. Lambeta, Mike (2020). DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor with Application to In-Hand Manipulation. arXiv.
  15. Black, Kevin (2024). π₀: A Vision-Language-Action Flow Model for General Robot Control. arXiv.
  16. Covariant (2024). RFM-1: Robotics Foundation Model. Company technical post.
  17. Dexterity (2025). Dexterity Foresight: AI Platform for Industrial Robot Workcells. Company product page.
  18. Chef Robotics (2025). ChefOS: AI Robotics Platform for Food Manufacturing. Company product page.
  19. Toyota Research Institute (2024). Large Behavior Models for Robot Manipulation. Company technical post.
  20. NVIDIA (2025). Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning. NVIDIA Research.
  21. Mandlekar, Ajay (2021). What Matters in Learning from Offline Human Demonstrations for Robot Manipulation. arXiv.
  22. Chi, Cheng (2023). Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. arXiv.
  23. Zhao, Tony Z. (2023). Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. arXiv.
  24. Yu, Wenhao (2025). ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation. arXiv.
  25. Sharma, Pratyusha et al. (2018). Multiple Interactions Made Easy (MIME): Large Scale Demonstrations Data for Imitation. CoRL.
  26. Wang, Xinyi et al. (2026). RoboTacDex: A Dexterous Visual-Tactile-Action Dataset for Humanoid Manipulation. arXiv.
  27. Pinto, Lerrel and Gupta, Abhinav (2016). Supersizing Self-Supervision: Learning to Grasp from 50K Tries and 700 Robot Hours. ICRA.
  28. Argall, Brenna D. et al. (2009). A Survey of Robot Learning from Demonstration. Robotics and Autonomous Systems.
  29. Liu, Huihan et al. (2023). Model-Based Runtime Monitoring with Interactive Imitation Learning. arXiv.
  30. Desai, Ankush et al. (2019). SOTER: A Runtime Assurance Framework for Programming Safe Robotics Systems. DSN.
  31. Billard, Aude and Kragic, Danica (2019). Trends and Challenges in Robot Manipulation. Science.
  32. Fang, Hao-Shu et al. (2023). RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot. arXiv.
  33. Chen, Claire et al. (2025). DexForce: Extracting Force-Informed Actions from Kinesthetic Demonstrations for Dexterous Manipulation. RA-L. 한국어 해설 · English note.
  34. Hoque, Ryan et al. (2021). ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning. CoRL.
  35. Corey Lynch et al. (2020). Learning Latent Plans from Play. CoRL.
  36. Tony Z. Zhao et al. (2024). ALOHA Unleashed: A Simple Recipe for Robot Dexterity. Conference on Robot Learning (CoRL).
  37. Kailin Li et al. (2025). ManipTrans: Efficient Dexterous Bimanual Manipulation Transfer via Residual Learning. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025.
  38. Roland S. Johansson et al. (2009). Coding and Use of Tactile Signals from the Fingertips in Object Manipulation Tasks. Nature Reviews Neuroscience.
  39. Chelsea Finn et al. (2017). Deep Visual Foresight for Planning Robot Motion. IEEE ICRA.
  40. Luis Sentis et al. (2005). Synthesis of Whole-Body Behaviors through Hierarchical Control of Behavioral Primitives. International Journal of Humanoid Robotics.
  41. Matthew T. Mason (1986). Mechanics and Planning of Manipulator Pushing Operations. International Journal of Robotics Research.
  42. Wenzhen Yuan et al. (2017). GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force. Sensors (MDPI).