Chapter 3: 데이터 순환 — 학습 자산의 축적
개요
제조 매니퓰레이션의 데이터 순환(data flywheel)은 데이터를 많이 쌓는 창고가 아니라 개선이 다시 수집과 배포 판단으로 돌아오는 운영 체계다. 사람은 드문 사례와 복구 의도를 보여주고, 로봇은 실제 장비의 반복성과 고장을 드러내며, 시뮬레이션은 조건을 체계적으로 변형하고, 품질 검사는 어떤 실패가 생산 손실인지 판정한다. UMI와 UMI-FT는 현장 사람 작업과 힘을 포함한 시연의 가능성을 보여주고 [1] [2], DEXOP와 DexUMI는 사람 손 데이터를 정교한 로봇 실행으로 옮기는 경로를 넓힌다 [3] [4].
순환이 닫히려면 네 데이터원이 같은 에피소드 식별자로 만난다. 사람 시연은 의도와 복구를 남기고, 로봇 실행은 실제 셀 동역학을 남기며, 합성 환경은 경계 사례를 증폭하고, 품질 기록은 어떤 실패가 생산 손실인지 알려준다. 이 장은 “더 많은 로봇 데이터”보다 “어떤 실패가 다음 배포를 막는가”를 중심으로 데이터 수집을 재구성한다. 직접 원격조작, 로봇 없는 수집, 선택적 교정, 합성 증폭은 대체재가 아니라 서로 다른 신호를 맡는 도구다.
이 장을 읽고 나면... - 사람, 로봇, simulation, QA log가 서로 다른 label을 제공한다는 점을 설명할 수 있다. - UMI/DROID/OXE/AgiBot 같은 대규모 수집 흐름을 제조 episode 관점에서 비교할 수 있다. - failure mining, replay set, rollback gate가 flywheel의 마지막 고리인 이유를 말할 수 있다. - 첫 production PoC에서 데이터 수집 순서를 어떻게 배치할지 설계할 수 있다.
직접 원격조작은 로봇 고유 신호를 보존한다
GELLO는 목표 팔과 같은 운동학 구조를 가진 저가 리더 장치를 3차원 인쇄 부품과 범용 모터로 구성하여 관절 공간 원격조작(teleoperation)을 직관적으로 만든다 [25]. 이 구조는 사람 자세를 로봇 자세로 바꾸는 문제를 단순화하지만 팔 계열이 바뀌면 리더를 다시 만들고 보정해야 한다. ALOHA 계열은 양손 리더-팔로 정밀한 두 손 시연을 모았고, Mobile ALOHA는 이동과 양손 작업을 함께 가르치는 방향을 보여주었다 [26]. 수집 중 목표 로봇과 셀을 점유한다는 비용, 작업자 피로, 재설정 시간은 그대로 남는다.
Open-TeleVision은 머리와 손 움직임을 추적하고 능동 입체 시각 피드백을 제공해 휴머노이드의 전신·양손 조작 범위를 넓힌다 [27]. 고차원 동작을 자연스럽게 지시하는 데 유용하지만 몰입감이 물리적 동일성을 뜻하지는 않는다. 통신 지연, 시야 가림, 로봇 관절 제한, 충돌 회피기가 작업자의 행동을 바꾼다. 영상으로 성공을 보더라도 실제 체결 토크, 미끄럼 직전의 접선력, 재료 내부 손상은 별도 센서와 검사 없이는 알 수 없다.
직접 원격조작의 장점은 목표 로봇의 카메라, 관절, 그리퍼, 제어 주기에서 관측과 행동을 함께 기록한다는 것이다. 힘·토크와 촉각 센서가 있으면 접촉도 같은 시계에 맞출 수 있다. 그러나 이것은 자동으로 “정답 행동”이 되는 것이 아니다. 시연자 간 편차, 안전 제어의 개입, 장비 마모, 불완전한 복구를 포함하기 때문이다. 오프라인 시연 연구가 보여주듯 학습 결과는 개수만이 아니라 시연 품질, 작업 다양성, 관측 양식에 좌우된다 [11].
| 수집 경로 | 강하게 보존되는 신호 | 다른 단계로 옮겨지는 비용 | 실제 셀에서 확인할 것 |
|---|---|---|---|
| GELLO·ALOHA식 직접 조작 | 목표 로봇의 관절 행동, 카메라, 실행 주기 | 장비 점유, 리더 제작, 작업자 피로 | 접촉력, 장주기 안정성, 공구 마모 |
| Open-TeleVision식 몰입 조작 | 전신·양손 의도, 능동 시야 | 지연, 시야 가림, 안전 감시 | 충돌 여유, 힘 제한, 통신 이상 |
| UMI·FastUMI식 휴대 수집 | 현장 장면, 상대 궤적, 넓은 작업 범위 | 추적, 보정, 시간축 정렬, 실행 가능성 검사 | 목표 로봇의 동작·접촉 재현 |
| 착용형·일인칭 수집 | 사람 손 다양성, 대량 작업 문맥 | 손-로봇 대응, 가림, 주석 오류 | 형태 차이, 촉각·힘, 제품 품질 |
로봇 없는 수집은 점유 비용을 변환 비용으로 바꾼다
UMI는 카메라와 추적 장치를 붙인 휴대형 그리퍼로 사람이 실제 환경에서 작업하고, 상대 자세 행동과 지연 일치를 이용해 로봇 정책으로 옮기는 경로를 제시했다 [1]. FastUMI는 장비 결합을 줄이고 범용 추적 부품을 활용해 배치 복잡도를 낮추려 한다 [28]. 목표 로봇을 여러 현장으로 옮기지 않아도 되고, 사람이 데이터를 모으는 동안 로봇을 생산이나 검증에 쓸 수 있다는 점이 경제적 장점이다.
그러나 로봇이 없다는 말은 변환 비용이 없다는 뜻이 아니다. 카메라 궤적은 누적 오차를 갖고, 상대 동작은 목표 팔의 작업공간과 특이점을 만족해야 하며, 사람의 빠른 손놀림은 로봇의 속도·가속도 한계와 제어 주기에 맞춰야 한다. 질감이 적거나 반사되는 장면에서는 추적이 흔들리고, 그리퍼 폭이 비슷해도 팔의 충돌 여유와 접근 방향은 달라질 수 있다. 필터링과 실제 재현을 생략하면 로봇 점유 시간만 줄고 실행 불가능한 데이터가 늘어난다.
DexCap은 휴대형 위치 추정과 전자기 손 추적을 이용해 정교한 손 조작을 모으고, 역기구학과 점군 기반 모방학습으로 연결한다 [29]. DexUMI는 착용형 외골격으로 사람 손 움직임을 로봇이 실행 가능한 범위에 가깝게 제한하고 영상에서 사람 손을 로봇 손으로 바꾸는 처리를 사용한다 [3]. RealDexUMI는 수집과 배포에서 같은 경량 손, 손 안 카메라, 손끝 촉각 모듈을 쓰는 접근으로 말단장치 차이를 줄이려 한다 [30]. 이런 공동설계도 팔 전체 동역학, 카메라 배치, 접촉 재료, 작업 속도까지 같게 만들지는 않는다.
로봇 없는 수집은 목표 장비의 점유 시간을 줄일 수 있지만 비용을 자세 추적, 행동 대응, 실행 가능성 검사, 시간축 정렬, 실제 로봇 검증으로 옮긴다. 이 결론은 각 연구의 작업·장비·센서·평가 범위 안에서 해석해야 하며, 총 데이터 비용이나 범용 전이를 자동으로 낮춘다는 뜻은 아니다 [28] [3] [30].
EgoDex 같은 일인칭 영상은 실제 물체를 다루는 사람 손의 다양성과 작업 문맥을 대규모로 담을 수 있다 [31]. 하지만 가림과 빠른 운동은 자세 주석을 불안정하게 만들고, 사람 손과 로봇 그리퍼의 자유도는 다르며, 내부 힘과 미끄럼 여유는 보이지 않는다. 대규모 영상은 물체·행동 의미를 배우는 사전학습 자산일 수 있지만 정밀 접촉 제어의 측정 행동은 아니다.
순환은 일회성 절차가 아니라 배포 운영이다
많은 실증은 시연 수집, 정책 학습, 로봇 배포라는 직선 절차로 시작한다. 제조에서는 배포 뒤 발견된 실패가 다음 시연 요청, 가상 변형, 동결 재현 세트, 배포 판단으로 돌아와야 한다. 그렇지 않으면 수집은 한 번의 주석 사업이 되고 모델 갱신은 현장 성과와 분리된다.
그림 3.1. 사람 시연, 로봇 실행, 합성 변형, 품질 판정이 같은 실패 분류와 에피소드 식별자로 돌아올 때 데이터 순환이 닫힌다. 출처: 저자 제작 SVG.
Open X-Embodiment와 AgiBot World 같은 대규모 로봇 자료는 여러 작업의 사전 지식을 넓히는 데 중요하다 [7] [8]. 그러나 제조사는 규모보다 데이터원별 편향을 본다. 사람 영상은 작업 문맥을 넓게 담지만 접촉력이 약하고, 로봇 실행은 목표 장비와 맞지만 위험한 실패를 충분히 탐색하기 어렵다. 가상 자료는 경계 조건을 빠르게 늘리지만 실제 불량과의 상관을 따로 확인해야 한다.
사람 시연의 강점은 성공 궤적뿐 아니라 왜 자세를 바꾸었는지, 걸림에서 어떻게 회복했는지를 담는 데 있다. UMI-FT는 현장 시연에 힘 신호를 더해 순응 조작의 접촉 조정을 보존하려 한다 [2]. 영상 자세만 있으면 삽입 결과는 보여도 작업자가 끼임을 느끼고 힘을 줄인 순간은 사라질 수 있다.
그림 3.2. 사람의 작업 의도와 접촉 조정을 함께 남길 때 시연은 제조 학습 자산이 된다. 영상·자세 기록과 힘·촉각 실측은 서로 대체되지 않는다. 출처: Choi et al. 2026, arXiv:2601.09988 Fig. 1.
로봇 고유 실행은 실제 구동기, 카메라, 공구, 치공구에서 나오므로 현장 분포를 드러낸다. DROID와 Bridge Data는 실제 로봇 자료가 일반화에 기여할 수 있음을 보여준다 [6] [10]. 제조에서는 여기에 제품 묶음, 치공구, 보전, 검사 상태를 연결해야 한다. 그리퍼 패드 마모, 흡착컵 오염, 카메라 노출 변화, 치공구 편차는 사람 시연에 없던 실패를 만든다. 실행 에피소드에는 모델뿐 아니라 공구, 보정, 교대조, 작업자, 보전 사건의 버전을 남겨야 한다.
선택적 개입은 성공보다 실패 경계를 모은다
초기 시연으로 학습한 정책은 훈련 분포를 벗어난 상태에서 오류를 키운다. 모든 실행을 사람이 계속 조작하면 안전하지만 확장성이 떨어지고, 완전 자율로 두면 위험한 실패와 값비싼 재설정이 늘어난다. 선택적 개입은 정책이 낯설거나 위험한 상태에 들어갈 때만 사람이 이어받고 그 교정 구간을 다음 학습에 넣는다. 데이터의 가치는 길이보다 정책이 실제로 방문한 약점과 가깝다는 데 있다.
ThriftyDAgger는 새로움과 완료 위험을 추정해 제한된 감독 예산 안에서 제어권을 요청하는 규칙을 학습한다 [32]. 모델 기반 실행 감시는 잠재 동역학으로 가까운 미래를 예측하고, 개입 데이터로 학습한 실패 분류기가 위험할 때 사람 감시를 부른다 [33]. 사람 개입 강화학습은 초기 시연, 학습된 보상, 온라인 교정, 재설정과 제어 설계를 함께 사용해 정밀 작업을 개선한다 [34]. 이 연구들은 성공 시연을 무작정 더 모으는 대신 실패 경계에 감독을 집중하는 가능성을 보여준다.
선택적 개입은 정책이 스스로 만든 실패 상태를 겨냥하지만 효율을 평가할 때는 교정 구간 길이뿐 아니라 사람의 관찰 시간, 인수 지연, 안전 감독, 위험 판정의 누락, 재설정 비용을 함께 세야 한다. 제한된 실제 과제와 감독 조건에서 얻은 결과이므로 상시 생산 감시의 총비용이나 모든 제조 작업의 안전성을 입증하지 않는다 [32] [33] [34].
개입 레이블도 절대적 진실이 아니다. 숙련자는 미세한 소리와 진동을 듣고 일찍 개입하지만 초보자는 영상상 실패가 보인 뒤에야 멈출 수 있다. 통신과 안전 제어기의 지연 때문에 기록된 개입 시작은 실제 위험 발생보다 늦다. 정책이 한 번도 방문하지 않은 새로운 실패는 감시 모델이 예측하지 못할 수 있다. 감독자, 이유 코드, 개입 전 관측 구간, 인수 지연, 안전 정지 여부를 함께 기록해야 하는 이유다.
시뮬레이션은 실제 실패 주변을 흔드는 장치다
시뮬레이션은 현실을 대체하는 공장이 아니다. 현실에서 위험하거나 드문 조건을 낮은 비용으로 변형하고 후보 정책을 걸러내는 데 가치가 있다. RoboNet 이후 연구는 여러 로봇과 장면의 포괄범위를 넓혔고 [9], 정책의 가상 평가와 Isaac Lab 계열은 배포 전 회귀검증 수단을 제공한다 [15] [16].
제조에서는 가상 변형이 실제 품질 레이블과 연결될 때 의미가 커진다. 삽입 작업의 틈새, 마찰, 초기 자세를 무작위화해도 실제 라인의 걸림·흠집·작업자 복구와 연결되지 않으면 가상 성공이 공정 성공을 보장하지 않는다. 목표는 궤적 수가 아니라 다음 배포 전에 어떤 실제 실패 주변을 흔들어볼지 정하는 것이다.
궤적과 세계 모델은 실제 씨앗을 증폭한다
합성 증폭은 서로 다른 세 경로를 포함한다. DemoGen은 3차원 장면을 편집하고 행동 궤적을 맞춰 하나의 실제 시연에서 공간 변형을 만든다 [35]. DexMimicGen은 양손 시연을 구간으로 나누고 조합해 시뮬레이션에서 새로운 협응 궤적을 만든다 [36]. 이 방법은 이미 알려진 기술을 다른 배치에 반복하는 데 강하지만 시연에 없던 접촉 전략을 자동으로 발명하지 않는다. 장면 분할, 복원, 생성 성공률, 필터링 비용도 실제 시연 수와 함께 계산해야 한다.
학습된 세계 모델은 행동에 따른 다음 영상을 만들거나 목표 영상에서 행동 후보를 역산한다. DreamGen은 로봇 모습에 맞춘 영상 궤적을 생성하고 역동역학(inverse dynamics) 또는 잠재 행동 모델로 의사 행동을 얻는다 [37]. 이는 기존 영상과 적은 로봇 씨앗을 더 넓은 시각 조건에 연결할 수 있다. 그러나 같은 영상 결과를 만드는 관절 토크와 접촉력은 여러 가지일 수 있다. 카메라에 보이지 않는 법선력, 마찰 상태, 촉각 분포, 공구 진동, 재료 내부 변형은 RGB 프레임만으로 유일하게 복원되지 않는다.
사용자가 제시한 Cosmos 3 행동 사후학습 영상은 순방향 동역학, 역동역학, 정책 모드라는 작업 구성을 보여주는 NVIDIA의 일차 자료다 [41]. 그 영상은 가능한 인터페이스와 튜토리얼 흐름을 설명하지만, 특정 예제의 시연 수를 여러 작업과 장비에 통하는 표본 효율 결과로 일반화할 근거는 아니다. 생성된 다음 프레임과 행동 묶음도 힘·토크·촉각의 실측값이 아니다. 이 장은 해당 설정을 일반 성능 주장으로 사용하지 않는다.
| 합성 경로 | 직접 관측되는 것 | 추정되거나 빠지는 것 | 실제 셀 적격성 확인 |
|---|---|---|---|
| 직접 원격조작 | 로봇 관측과 명령 행동 | 인터페이스 밖의 작업자 의도 | 목표 공구·치공구·안전 제어기에서 재현 |
| 착용형·일인칭 영상 | 사람의 작업 문맥과 보이는 복구 | 로봇 행동, 접촉력, 실행 가능한 시간축 | 행동 대응 검사와 제한된 로봇 재현 |
| 역동역학·세계 모델 | 보이는 상태 전이 | 행동 후보, 숨은 힘과 접촉의 모호성 | 실행 가능성 필터, 접촉 실측, 품질 결과 |
| 물리 시뮬레이션 | 장면에 명시한 매개변수와 상태 | 모델 밖의 마모·오염·재료 거동 | 매개변수 보정과 동결 실제 실패의 상관 확인 |
| 선택적 개입 | 정책이 방문한 위험 상태와 사람 교정 | 방문하지 않은 위험과 감독 부담 | 지연 감사, 안전 검토, 재설정 비용, 재현 포괄범위 |
이 표는 우열표가 아니라 관측 가능성 지도다. 영상 중심 경로는 문맥을 넓히고, 시뮬레이션은 통제된 실패 주변을 흔들며, 개입은 정책의 약점에 감독을 집중한다. 어느 경로도 행동·접촉·품질 변수를 모두 직접 제공하지 않는다. 따라서 대체하기 가장 어려운 실제 자료는 추정 변수가 목표 셀에서 유효한지를 판정하는 증거다.
합성 궤적과 학습된 영상 전개는 실제 씨앗 분포를 확대하지만 실제 접촉과 결과 증거의 필요를 없애지 않는다. 이 주장은 각 연구가 다룬 장면 구조, 작업, 역동역학 모델, 필터링, 실제 시험 범위 안에서만 유효하며 생성 영상에서 숨은 힘·토크·촉각 상태가 복원된다고 해석해서는 안 된다 [35] [36] [37].
RoboCat은 새 작업의 사람 시연으로 정책을 적응시킨 뒤 성공적인 자체 생성 경험을 다시 훈련 혼합물에 넣는 자기개선 구조를 제시했다 [38]. 여기서 “자율 데이터”도 씨앗, 성공 판정, 필터링, 재학습 혼합비가 필요하다는 교훈을 얻는다. 정책이 잘하는 상태만 되풀이하면 데이터는 늘어도 약점은 줄지 않는다. 실패와 불확실성을 별도 자산으로 보존해야 순환이 편향을 스스로 강화하는 것을 막을 수 있다.
NVIDIA 피지컬 AI 전략은 책임 계층으로 읽어야 한다
NVIDIA의 전략은 하나의 거대한 시뮬레이터보다 장면 작성, 물리·센서 실행, 병렬 학습, 생성적 증폭, 로봇 모델 학습을 연결하는 계층으로 읽는 편이 정확하다. OpenUSD는 장면의 기하, 재료, 관절, 의미 정보를 여러 도구가 교환하고 조합하는 기반이다. Omniverse 라이브러리와 연결기는 기존 3차원 제작 도구 안에서 이 자산을 준비하고 검증하는 경로를 제공한다. 사용자가 제시한 Blender 영상은 “시뮬레이션 준비 장면” 작업 흐름을 보여주는 일차 자료이지, Blender 장면이 현실과 물리적으로 동일해졌음을 입증하는 독립 평가가 아니다 [42].
NVIDIA 발표는 ovphysx, ovrtx, 장면 검증 구성 요소를 기존 응용프로그램에 넣고 인공지능 에이전트가 물리 속성과 의미 정보의 누락을 찾는 방향을 소개했다 [39] [40]. 장면의 구조적 완결성과 물리 매개변수의 진실성은 다르다. 질량 필드가 채워졌다는 사실은 값이 실제 부품과 같다는 뜻이 아니며, LiDAR 영상이 그럴듯하다는 사실은 실제 센서의 온도 변화, 반사체, 오염까지 보정되었다는 뜻이 아니다.
Isaac Sim은 로봇·센서·장면·물리 실행과 합성 자료 생성을 담당하고, Isaac Lab은 그 위에서 병렬 환경, 학습 과제, 무작위화, 정책 훈련과 평가 절차를 조직한다 [43] [16]. Newton은 접촉과 변형체를 포함한 물리 계산 범위를 넓히려는 계층이다. 이들은 후보 경험을 만들고 반복 시험하는 기반이지만 실제 공정의 마찰계수와 재료 거동을 자동으로 알아내거나 정책의 안전성을 승인하지 않는다. 매개변수 식별, 센서 보정, 실제-가상 상관 분석은 별도 업무다.
Cosmos 계열은 시각·행동 분포를 생성하고 평가하는 층에 놓이고, GR00T 계열은 실제·합성 자료 혼합에서 로봇 정책을 학습하는 층에 놓인다. 생성과 정책 학습이 같은 생태계에 있다는 이유로 장면 작성, 접촉 물리, 행동 변환, 안전 제어, 품질 판정을 한 구성 요소의 성능으로 합치면 안 된다.
OpenUSD·Omniverse의 장면 작성, Isaac의 시뮬레이션과 학습, Cosmos의 시각·행동 증폭, 로봇 정책 훈련, 실제 셀 보증은 서로 다른 틈을 메우며 하나의 “시뮬레이터 성능”으로 축약할 수 없다. NVIDIA의 공식 발표와 기술 블로그는 발표된 기능과 작업 흐름만 뒷받침하며 독립적인 공장 규모 성능 증거가 아니다 [39] [40]. Gao et al.[2]의 Isaac Sim 논문은 제3자 survey이며, 실제 배포에는 보정된 물리, 실제 재현, 품질 기록, 안전·복귀 기준이 별도로 필요하다.
| 빈틈 | NVIDIA 계층의 역할 | 만들어지는 자산 | 보증하지 않는 것 |
|---|---|---|---|
| 장면 상호운용·작성 | OpenUSD, Omniverse 라이브러리 | 버전 장면, 의미 정보, 재사용 자산 | 실제 질량·마찰·공차 정확성 |
| 로봇·센서 실행 | Isaac Sim | 센서 자료, 가상 실행, 장면별 시험 | 실제 센서 열화, 접촉 상관, 안전 승인 |
| 병렬 학습·평가 | Isaac Lab | 무작위화 과제, 훈련·회귀 결과 | 작업 정의 타당성, 실제 품질 합격 |
| 접촉·변형 물리 | Newton과 지원 물리 기반 | 접촉 후보, 변형체 거동 | 공정별 매개변수 식별과 실물 일치 |
| 시각·행동 증폭 | Cosmos 계열 | 생성 영상, 의사 행동, 후보 전개 | 숨은 힘·촉각 복원, 실패 확률의 진실성 |
| 정책 학습 | GR00T 계열 | 사전학습·사후학습 정책 | 셀별 제어 한계, 품질·안전 책임 |
제조 셀 사례: 커넥터 삽입의 수집 순서
한국어판의 커넥터 삽입과 영어판의 트레이 피킹은 서로 다른 접촉·불량 메커니즘으로 같은 순서, 즉 실패 분류, 로봇 고유 증거, 합성 압박, 품질 관문 배포를 시험하는 보완적 현장 사례다. 공통 교훈은 어느 셀도 보편 양식으로 삼지 말고, 변환이나 생성으로 적격성을 확인할 수 없는 변수에 실제 로봇 시간을 집중하는 것이다.
커넥터 삽입 셀의 첫 단계는 시연 수 목표가 아니라 실패 분류를 정하는 일이다. 작업자는 정상 삽입, 비스듬한 접근, 핀 걸림, 잠금 미완료, 케이블 장력, 하우징 손상의 징후와 복구를 정의한다. 성공도 로봇 동작 종료가 아니라 삽입 깊이, 최대 힘, 잠금 확인, 외관 검사, 주기 시간의 조합으로 판정한다. 목표 장비와 맞는 직접 원격조작으로 소수의 기준 궤적과 접촉 기록을 확보한다.
둘째 단계에서는 여러 제품 변형의 접근 경로와 작업 문맥을 UMI식 휴대 수집이나 일인칭 영상으로 넓힌다. 목표 로봇에서만 나타나는 케이블 탄성, 그리퍼 유격, 카메라 노출, 힘 제한은 실제 실행으로 모은다. 사람-로봇 변환이 만든 궤적은 충돌, 관절 한계, 속도, 접근 방향을 검사한 뒤 제한된 실제 재현을 통과해야 학습 후보가 된다.
셋째 단계에서는 초기 정책을 낮은 속도와 힘 한계 안에서 실행하고 필요한 순간에 개입한다. 개입 전후 관측, 위험 이유, 인수 지연, 복구 궤적, 재설정 시간을 기록한다. 핀 걸림이 반복되는 상태는 다음 합성 증폭의 중심이 된다. 초기 자세, 마찰, 케이블 강성, 치공구 오차를 바꾸되 실제로 관찰된 범위와 불량 코드에 우선순위를 둔다. 영상 생성은 가림과 외관 다양성에 쓰고 접촉 궤적은 보정된 물리와 실제 재현으로 확인한다.
마지막 단계는 동결 재현 세트다. 정상 제품뿐 아니라 핀 걸림, 잠금 미완료, 케이블 장력, 보정 오차, 센서 노출 변화가 포함되어야 한다. 후보 모델은 가상 회귀, 제한된 실제 실행, 후속 품질 검사를 모두 통과하고 이전 모델로 돌아갈 수 있어야 한다. 이 순서에서 로봇 시간은 모든 다양성을 모으는 데 쓰이지 않고, 변환과 합성이 놓치기 쉬운 접촉·품질 경계를 판정하는 데 집중된다.
| 실패 종류 | 사람에게 얻을 것 | 로봇에서 얻을 것 | 가상 변형 | 배포 기준 |
|---|---|---|---|---|
| 핀 걸림 | 감지 징후와 후퇴 복구 | 힘 상승, 자세 오차, 공구 유격 | 틈새·마찰·초기 각도 | 최대 힘과 손상 없는 복구 |
| 잠금 미완료 | 재삽입 판단 | 깊이, 소리, 잠금 센서 | 부품 공차와 케이블 장력 | 잠금 검사와 후속 전기 검사 |
| 하우징 흠집 | 접근 변경 요령 | 접촉 위치와 속도 | 조명·표면·치공구 편차 | 외관 불량률과 재작업 |
| 안전 정지 | 작업자 인수 이유 | 제어 상태와 정지 원인 | 알려진 위험 상태 재현 | 중단 기준과 이전판 복귀 |
제조 데이터 계약은 책임 경계다
제조 데이터 순환은 사람 시연, 로봇 고유 실패, 교정, 생성, 후속 품질 레이블을 하나의 에피소드 식별자 아래 연결해야 한다. RoboNet·Bridge Data·RoboCat은 이 구성 요소의 일부를 연구 규모에서 보여주지만, 비공개 훈련 혼합물이나 제한된 과제 결과가 제품 불량·재작업·안전 정지까지 연결된 독립 공장 검증을 대신하지는 않는다 [9] [10] [38].
데이터 순환이 무너지기 쉬운 지점은 식별자다. 사람 시연 파일, 로봇 기록, 가상 실행, 품질 문서가 서로 다른 식별자를 쓰면 실패 원인을 추적할 수 없다. 데이터 계약은 문서 양식이 아니라 누가 원본을 보존하고, 누가 학습 표현을 만들며, 누가 배포를 막고, 누가 이전판 복귀를 실행하는지 정하는 책임 경계다.
그림 3.3. 에피소드 식별자가 센서, 제어기, 품질 검사, 배포 판단을 잇지 못하면 데이터 순환은 닫히지 않는다. 출처: 저자 제작 SVG.
오프라인 시연 연구는 시연 품질과 작업 다양성이 성능에 영향을 준다는 점을 보여준다 [11]. 제조에서는 학습에 넣는 에피소드와 배포 기준에 쓰는 에피소드를 분리하고, 불량별 재현 세트를 버전 자산으로 관리해야 한다. 그래야 모델 갱신이 현장 개선인지 최근 수집분에 대한 과적합인지 구분할 수 있다.
배포 권한과 품질 교정
데이터 계약에서 가장 중요한 문장은 누가 배포를 멈출 수 있는가이다. 로봇 공급자가 모델을 갱신하고 통합사가 셀을 설치하며 제조사가 품질 책임을 지는 구조에서는 데이터 열람권과 배포 권한이 갈라지기 쉽다. 제조사는 최소한 불량별 재현 결과, 모델 버전 차이, 이전판 복귀 수단, 작업자 개입, 안전 정지 기록을 받아야 한다. 외부 플랫폼을 쓰더라도 제조사 품질 분류로 배포 기준을 실행할 수 있어야 한다.
가상 환경도 품질 기록을 통해 현실로 돌아와야 한다. 가상 커넥터 삽입이 성공해도 실제 외관 불량이 늘었다면 장면이나 접촉 모델이 중요한 실패를 빠뜨린 것이다. 반대로 실제 셀에서 반복하기 위험한 정지는 가상 환경에서 주변 조건을 재생해 후보를 탈락시키는 데 쓸 수 있다. Isaac Lab과 정책 가상평가 연구는 이 교정 수단을 제공하지만 [15] [16], 어떤 매개변수를 흔들지는 실제 불량에서 정해야 한다.
실패 분석은 배포 뒤의 마지막 단계가 아니라 다음 수집의 시작점이다. 품질 불합격, 작업자 인수, 라인 정지, 안전 정지, 재작업은 무엇을 더 관측해야 하는지 알려준다. Touch-and-Go와 AnyTouch는 사람 수집에서 접촉 신호의 역할을 보여주고 [13] [12], ForceVLA는 힘 정보를 정책 구조에 넣으려 한다 [14]. 모든 실패가 힘 문제인 것은 아니므로 센서 부족, 장비 편차, 검사 분류, 작업 절차를 나누어야 한다.
제조 셀 적용 체크포인트
첫째, 관측, 요청 행동, 실행 행동, 힘·토크·촉각, 안전 상태, 재설정, 제품·치공구 버전, 검사 결과를 한 에피소드로 연결한다. 영상에서 추정한 행동에는 추정기 버전, 신뢰도, 실행 가능성 검사, 실제 재현 여부를 덧붙인다.
둘째, 데이터원별 개수 대신 실패별 포괄범위를 정한다. 각 상위 불량에 사람의 복구 지식, 목표 로봇의 실제 실패, 합성 변형, 동결 재현 사례, 후속 품질 판정이 있는지 확인한다. 이미 설명되는 정상 상태는 덜 모으고 원인이 불명확하거나 손실이 큰 실패에 로봇 시간을 쓴다.
셋째, 시연 시간뿐 아니라 장비 점유, 수집 장치 제작, 보정, 자세·행동 변환, 필터링, 감독자 대기, 개입, 재설정, 안전 검토, 실제 검증, 불량 검사, 재학습 연산을 센다. 한 단계의 데이터가 줄어도 전체 비용은 늘 수 있다.
넷째, 누가 재현 세트를 소유하고, 누가 합격 기준을 바꾸며, 누가 모델 승격을 중단하고, 누가 이전판으로 돌아갈 수 있는지 정한다. 새 모델이 평균 성공률을 높여도 중요한 불량 하나를 악화시키면 승격하지 않는 규칙이 필요하다.
운영 주기와 남은 논쟁
매일은 정지, 작업자 개입, 상위 불량을 보고, 매주는 불량별 에피소드에서 빠진 데이터원을 찾으며, 배포 때는 가상 압박 시험, 제한된 실제 실행, 후속 품질 검사, 복귀 계획을 함께 본다. 유용한 지표는 같은 실패가 발견된 뒤 재현 세트와 교정을 거쳐 안정적으로 줄어드는 시간이다. 시간이 길다면 자료 수보다 책임 연결이 끊겼을 수 있다.
| 검토 관문 | 검토에 들어오는 증거 | 결정 또는 산출물 |
|---|---|---|
| 일일 운영 | 정지, 인수, 재설정, 당일 불량 코드 | 진단 책임자와 보존할 에피소드 지정 |
| 주간 포괄범위 | 실패 표본, 센서 공백, 데이터원 계보 | 다음 수집 목표와 동결·축소할 데이터원 |
| 모델 배포 | 동결 재현, 가상 압박, 제한된 실제 실행, 품질 판정 | 권한자를 명시한 승격·보류·복귀 |
| 공정·보전 변경 | 공구, 치공구, 보정, 재료, 검사 개정 | 낡은 증거 폐기와 영향받은 재현 사례 재구축 |
이 주기는 실패 분석을 사후 보고에서 다음 수집의 입력으로 바꾼다. 월요일에 불량이 늘고 수요일에 공구가 교체되었다면 금요일 모델만 탓하기 전에 장비 사건과 에피소드 계보를 확인해야 한다. 반대로 장비 변화가 없는데 특정 제품에서만 실패가 늘면 사람 복구 수집이나 가상 변형의 범위를 다시 설계한다. 주기는 사람, 로봇, 시뮬레이션, 품질 기록을 같은 질문으로 묶는 운영 리듬이다.
실패가 한 번 발견된 뒤 안정적으로 줄어들 때까지의 시간을 추적하면 순환의 느린 연결을 찾을 수 있다. 시간이 길다고 해서 반드시 데이터가 부족한 것은 아니다. 사람의 복구가 로봇 실행으로 전달되지 않았거나, 시뮬레이션의 실패가 품질 코드와 맞지 않거나, 공급자 모델 갱신에 재현 증거가 빠졌을 수 있다. 각 상위 실패에는 공정, 제어·데이터, 품질 가운데 한 명의 책임자를 지정하고 다음 검토 때 어떤 불확실성을 줄였는지 확인해야 한다.
책임자는 무엇을 더 모을지만 보고하지 않는다. 원인이 설명된 뒤 어떤 고빈도 기록을 동결하거나 축소할지도 말해야 한다. 같은 정상 자료가 계속 쌓이면 순환은 학습 체계가 아니라 저장 비용이 된다. 수집 축소는 대규모 데이터 전략의 후퇴가 아니라 하나의 불확실성을 공학 규칙과 재현 시험으로 바꾸었다는 증거다. 반대로 설명되지 않은 희귀 실패는 양이 적다는 이유로 폐기하지 않고 다음 주의 관측·재현·합성 예산을 우선 배정한다.
첫 번째 논쟁은 로봇 없는 수집이 전체 비용을 낮추는가이다. 장비 점유는 줄 수 있지만 자세 추정, 행동 대응, 장치 제작, 필터링, 실제 재현이 늘어난다. 시각적으로 명확하고 접촉이 단순한 작업일수록 유리하며, 마찰·탄성·미세 힘 조절이 성공을 좌우할수록 실제 검증 비중이 커진다. 공개 연구만으로 모든 작업의 손익분기점을 제시할 수 없다.
두 번째 논쟁은 세계 모델이 행동 자료를 대체할 수 있는가이다. 생성과 역산은 장면과 행동 후보를 빠르게 늘리지만 관측되지 않은 접촉 상태의 비식별성과 모델 편향이 남는다. 특정 튜토리얼의 적은 사후학습 예시는 연구 방향을 보여줄 뿐 다양한 로봇·재료·주기 시간에서 같은 절감이 재현된다는 증거가 아니다.
세 번째 논쟁은 순환이 스스로 좋아지는가이다. 성공 경험만 다시 넣으면 정책은 쉬운 상태를 반복하고 희귀 실패를 잊을 수 있다. 생성 모델과 시뮬레이터가 같은 잘못된 가정을 공유하면 그릇된 세계를 일관되게 재생할 수도 있다. 독립된 실제 재현 세트, 후속 품질 레이블, 새 조건을 찾는 시험이 자기확신을 깨는 장치다.
공개 자료에서 특히 부족한 것은 여러 교대조, 제품 변경, 공구 마모, 보정 교체, 장기 유지보수를 포함한 공장 규모의 독립 검증이다. 따라서 완전 무인화나 원격조작의 대폭 제거 같은 결론은 현재 공개된 과제별 증거보다 강하다.
그림 3.4. 관측·분류·교정·재검증을 연결한 생산 데이터 순환. 이 도식은 성능 주장이 아니라, 능력 근거가 재현과 품질 판정을 거쳐 배포 권한으로 넘어가는 운영 책임 체인을 요약한다. 출처: 저자 제작 SVG.
다음에 배울 것
데이터 순환은 무엇을 모으고 어떻게 되돌릴지를 정했지만, 접촉이 많은 작업에서 어떤 가상 경험을 믿을 수 있는지는 아직 남는다. 4장 「접촉 모델링 — 제어와 전이의 기반」은 접촉 모델, 제어 경계, 실제-가상 전이를 다룬다. 이 장의 에피소드 계보와 동결 재현 세트가 4장의 물리 매개변수 보정과 안전한 정책 시험에 입력된다. 다음 질문은 “더 많은 데이터를 만들 수 있는가”가 아니라 “어떤 물리 가정 아래 만든 데이터가 실제 접촉과 품질을 예측하는가”이다.
참고문헌
- Chi, Cheng et al. (2024). Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots. arXiv. #35 Terry의 해설.
- Choi, Hojung (2026). In-the-Wild Compliant Manipulation with UMI-FT. arXiv.
- Xu, Mengda (2025). DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation. arXiv. #8 Terry의 해설.
- Fang, Hao-Shu (2025). DEXOP: A Device for Robotic Transfer of Dexterous Human Manipulation. arXiv. #10 Terry의 해설.
- Si, Zilin (2025). ExoStart: Efficient learning for dexterous manipulation with sensorized exoskeleton demonstrations. arXiv. #9 Terry의 해설.
- Khazatsky, Alexander (2024). DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset. arXiv.
- O'Neill, Abby (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv.
- AgiBot-World Contributors et al. (2025). AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems. arXiv.
- Dasari, Sudeep (2019). RoboNet: Large-Scale Multi-Robot Learning. arXiv.
- Ebert, Frederik (2021). Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets. arXiv.
- Mandlekar, Ajay (2021). What Matters in Learning from Offline Human Demonstrations for Robot Manipulation. arXiv.
- Feng, Ruoxuan (2025). AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-Tactile Sensors. arXiv.
- Yang, Fengyu (2022). Touch and Go: Learning from Human-Collected Vision and Touch. arXiv.
- Yu, Wenhao (2025). ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation. arXiv.
- Li, Xingyu (2024). Evaluating Real-World Robot Manipulation Policies in Simulation. arXiv.
- Mittal, Mayank et al. (2025). Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning. arXiv.
- Toyota Research Institute (2024). Large Behavior Models for Robot Manipulation. Company technical post.
- Covariant (2024). RFM-1: Robotics Foundation Model. Company technical post.
- Dexterity (2025). Dexterity Foresight: AI Platform for Industrial Robot Workcells. Company product page.
- Chef Robotics (2025). ChefOS: AI Robotics Platform for Food Manufacturing. Company product page.
- Black, Kevin (2024). pi0: A Vision-Language-Action Flow Model for General Robot Control. arXiv.
- Octo Model Team (2024). Octo: An Open-Source Generalist Robot Policy. arXiv. #55 Terry의 해설.
- Brohan, Anthony (2022). RT-1: Robotics Transformer for Real-World Control at Scale. arXiv.
- Brohan, Anthony (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv.
- Wu, Philipp et al. (2023). GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators. CoRL.
- Fu, Zipeng et al. (2024). Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation. arXiv.
- Cheng, Xuxin et al. (2024). Open-TeleVision: Teleoperation with Immersive Active Visual Feedback. CoRL.
- Zhaxizhuoma et al. (2024). FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset. arXiv.
- Wang, Chen et al. (2024). DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation. RSS.
- Xu, Chaoyi et al. (2026). RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning. arXiv. #36 Terry의 관련 해설.
- Hoque, Ryan et al. (2025). EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video. arXiv. #76 Terry의 해설.
- Hoque, Ryan et al. (2021). ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning. CoRL.
- Liu, Huihan et al. (2023). Model-Based Runtime Monitoring with Interactive Imitation Learning. arXiv.
- Luo, Jianlan et al. (2025). Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning. Science Robotics.
- Xue, Zhengrong et al. (2025). DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning. arXiv.
- Jiang, Zhenyu et al. (2024). DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning. arXiv.
- Jang, Joel et al. (2025). DreamGen: Unlocking Generalization in Robot Learning through Video World Models. arXiv.
- Bousmalis, Konstantinos et al. (2023). RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation. arXiv.
- NVIDIA (2026a). NVIDIA Agent Toolkit Expands With New Omniverse Libraries, Putting AI Agents to Work Building Simulation-Ready Worlds. 공식 발표.
- NVIDIA (2026b). Integrate Physical AI Capabilities into Existing Apps with NVIDIA Omniverse Libraries. NVIDIA 기술 블로그.
- NVIDIA (2026c). How to Post-Train NVIDIA Cosmos 3 for Robot Action Prediction. 공식 기술 영상.
- NVIDIA (2026d). Bringing Agent-Ready Simulation Into Blender. 공식 기술 영상.
- Gao, Sicong et al. (2026). NVIDIA Isaac Sim: Enabling Scalable, GPU-Accelerated Simulation for Robotics. 제3자 survey, arXiv.
- Fan, Jiacheng et al. (2026). RoboPaint: From Human Demonstration to Any Robot and Any View. arXiv. #15 Terry의 해설.
- Zheng, Ruijie et al. (2026). EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data. arXiv.
- π0.6 Team (2025). π0.6: A Vision-Language-Action Model with Experience. Terry의 논문 해설 [#4].
- ENPire Team (2026). ENPire: Robot Policy Self-Improvement. Terry의 논문 해설 [#69].
- Jeffrey Mahler et al. (2017). Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics. Robotics: Science and Systems.
- Various (2024). DexH2R: Task-oriented Dexterous Manipulation from Human to Robots. arXiv preprint.
- Sungjae Park et al. (2025). Learning to Transfer Human Hand Skills for Robot Manipulations. arXiv preprint.
- Marc Peter Deisenroth et al. (2011). PILCO: A Model-Based and Data-Efficient Approach to Policy Search. ICML / Artificial Intelligence.
- Ankur Handa et al. (2020). DexPilot: Vision-Based Teleoperation of Dexterous Robotic Hand-Arm System. ICRA 2020.
- Jeannette Bohg et al. (2014). Data-Driven Grasp Synthesis: A Survey. IEEE Transactions on Robotics.
- David J. Montana (1988). The Kinematics of Contact and Grasp. International Journal of Robotics Research.