Chapter 9: 파운데이션 모델 — 범용 정책의 데이터 전략
개요: 범용성보다 먼저 물어야 할 것
로봇 파운데이션 모델의 핵심 약속은 하나의 정책이 더 많은 작업, 환경, 로봇 몸체에 재사용될 수 있다는 것이다. 그러나 제조 현장에서 범용성은 모델의 속성만으로 결정되지 않는다. 장면을 누가 만들고, 물리 변수를 누가 보정하며, 실제 행동을 어떤 인터페이스로 기록하고, 생성 데이터의 오류를 누가 걸러 내고, 배포 후 품질 판정을 누가 다시 학습 데이터로 돌려보내는지가 함께 결정한다. 따라서 이 장의 질문은 “가장 강한 모델은 무엇인가”가 아니다. 어떤 데이터 책임 사슬이 범용 정책을 생산 셀에서 검증 가능하게 만드는가가 질문이다.
이 관점에서 NVIDIA의 피지컬 AI(Physical AI) 전략은 중요한 사례다. OpenUSD와 Omniverse는 장면의 작성·교환을, Isaac Sim은 로봇과 센서의 시뮬레이션을, Isaac Lab은 학습·평가 실험을, Newton은 접촉과 변형 물리를, Cosmos는 시각·행동·미래 예측을, GR00T는 범용 로봇 정책을 맡는다. 이 구성은 하나의 거대한 시뮬레이터라기보다 서로 다른 현실 격차에 대응하는 연결형 데이터 공장에 가깝다. 다만 구성요소가 잘 연결된다는 사실과 실제 공정의 정확도·안전·수율이 검증됐다는 사실은 다르다.
역사적으로 로봇 학습은 사람이 시연한 동작을 한 로봇에 복제하는 단계에서 시작했다 [1]. 이후 여러 로봇의 궤적을 공동 학습하는 RoboNet과 Open X-Embodiment가 데이터의 폭을 넓혔고 [2], [3], Octo·OpenVLA·π0 같은 범용 정책이 그 혼합물을 재사용 가능한 정책 사전분포로 바꾸려 했다 [4], [5], [6]. 2025~2026년의 전선은 한 단계 더 나아간다. 실제 시연만 모으는 대신 명시적 물리 시뮬레이션, 인간 영상, 비디오 월드 모델, 역동역학, 선택적 개입을 결합해 데이터의 범위와 정보 밀도를 높이려 한다 [7], [8].
이 장을 읽고 나면... - 논문·프리프린트, 공개 구현, 공식 문서·영상, 파트너 데모, 독립 재현 결과를 서로 다른 증거 등급으로 읽을 수 있다. - OpenUSD/Omniverse, Isaac Sim, Isaac Lab, Newton, Cosmos, GR00T가 각각 어떤 데이터 격차를 맡고 무엇을 보장하지 않는지 설명할 수 있다. - 범용 정책을 데이터 접근권, 로봇 몸체, 행동 인터페이스, 공개성, 평가 방식, 배포 증거의 축으로 비교할 수 있다. - 시뮬레이션과 월드 모델이 텔레오퍼레이션을 어디에서 줄이고, 접촉·실패·품질 데이터가 왜 실제 셀에 남아야 하는지 판단할 수 있다. - 모델 업데이트를 생산에 승인하기 위한 보정, 재생 평가, 안전, 품질 권한을 설계할 수 있다.
증거의 사다리: 데모를 성능으로 승격하지 않기
범용 모델을 비교할 때는 심사된 논문 또는 프리프린트의 실험, 공개 산출물, 기업의 1차 발표, 외부 팀이 같은 조건에서 재생한 결과를 분리해야 한다. 이 구분은 형식적인 각주가 아니다. OpenVLA와 Octo는 코드·가중치·학습 절차의 상당 부분을 검사할 수 있지만, 그 공개성이 공장 접촉 작업의 성능을 증명하지는 않는다 [5], [4]. GR00T N1 논문과 공개 모델은 휴머노이드 범용 정책의 구조와 보고된 평가를 보여주지만, 저자 통제 환경의 결과를 여러 공장의 장기 운영 지표로 바꿔 읽을 수는 없다 [10].
이 장에서는 네 층을 사용한다. 첫째, 학술 근거는 실험 조건·대조군·분모가 드러난 논문과 프리프린트다. 프리프린트는 동료심사가 끝났다는 뜻이 아니므로 그대로 표기한다. 둘째, 공개 산출물 근거는 코드, 가중치, 데이터 형식, 재생 스크립트다. 재현 가능성을 높이지만 숨은 학습 자료와 하드웨어 차이를 없애지는 않는다. 셋째, 공식 기능 근거는 문서, 기술 블로그, 제품 발표, 공식 영상이다. 무엇이 제공되고 어떤 흐름을 지향하는지는 설명하지만 일반 성능을 증명하지 않는다. 넷째, 독립 배포 근거는 외부 운영자가 실제 셀에서 같은 정의로 측정한 수율, 정지, 재작업, 손상, 개입, 갱신 전후의 결과다. 현재 가장 빈약한 층이 바로 넷째다.
표현도 증거 층에 맞춰야 한다. 공식 페이지에 “지원한다”고 쓰여 있으면 지원 인터페이스를 기술할 수 있다. 파트너 영상에 조립 장면이 있으면 그 구성에서 기능이 시연됐다고 쓸 수 있다. 하지만 “접촉 정확도가 향상됐다”, “실제 데이터가 크게 줄었다”, “생산 준비가 끝났다”라고 쓰려면 비교 기준, 표본 수, 작업 분포, 실패 정의가 필요하다. 특히 플랫폼 공급자가 선택한 성공 영상과 고객이 보유한 연속 생산 기록은 같은 근거가 아니다.
그림 9.1. 범용 모델 범위와 생산 데이터 소유권을 두 축으로 삼은 저자 작성 편집 지도다. 점의 위치는 비교 관점을 제안하는 정성적 가설이며, 검증된 회사 순위나 NVIDIA 구성요소의 책임 지도가 아니다. 출처: 저자 작성.
이 구분은 부정적인 태도가 아니라 더 빠른 채택을 위한 장치다. 기능 증거만 있는 항목은 탐색 실험에, 공개 산출물이 있는 항목은 내부 기준선에, 독립 셀 근거가 있는 항목은 제한 배포 후보에 놓을 수 있다. 근거가 부족하다는 이유로 기술을 버릴 필요도 없고, 흥미로운 데모라는 이유로 품질 승인권을 넘길 필요도 없다.
역사적 전환: 한 작업의 시연에서 교차 로봇 사전학습으로
초기 시연학습은 작업자 궤적을 상태와 행동의 대응으로 바꾸는 문제였다. 장점은 명확한 보상 설계 없이 숙련을 전달할 수 있다는 점이었고, 약점은 시연 분포 밖으로 나가면 오류가 누적된다는 점이었다 [1], [9]. 실제 로봇에서 데이터를 모으는 비용이 높아지자 연구는 더 많은 로봇을 병렬화하고, 서로 다른 로봇의 영상을 사전학습에 공유하며, 실행 중 실패한 상태에서만 사람의 교정을 요청하는 방향으로 확장됐다.
RoboNet은 여러 연구실과 일곱 로봇 플랫폼의 약 1,500만 프레임을 묶어 교차 로봇 비디오 학습의 가능성을 보였다 [2]. Open X-Embodiment는 22개 로봇과 여러 기관의 데이터를 공통 형식으로 모아 더 큰 협력 규모를 만들었다 [3]. 그러나 이 성취는 동시에 손실을 드러냈다. 서로 다른 카메라, 주기, 관절, 그리퍼, 좌표계를 하나로 맞추면 로봇 고유의 접촉 정보와 제어 의미가 희석될 수 있다. 데이터량의 증가는 행동 의미의 일치를 자동으로 만들지 않는다.
Octo와 OpenVLA는 이 공동 자료를 범용 정책으로 바꾸려는 공개 기준점이다. Octo는 다양한 관측·행동 헤드를 바꿔 끼울 수 있는 정책 구조와 80만 궤적 규모의 사전학습을 보고했고, OpenVLA는 시각언어 모델에 로봇 행동 토큰을 결합해 공개 미세조정 경로를 제공했다 [4], [5]. π0는 연속 행동 묶음을 흐름 기반으로 생성하면서 고주파·정교 조작으로 범위를 넓혔다 [6]. 이 흐름의 성취는 “하나의 정책을 여러 곳에서 시작점으로 쓸 수 있다”는 것이다. 성취하지 못한 것은 “새 공정에 실제 자료 없이 바로 투입할 수 있다”는 명제다.
교차 로봇 사전학습은 정책의 사전분포를 넓히지만, 보고된 작업 성공률은 고객 고유의 품질·안전·수명주기 성능을 입증하지 않는다. π0.5가 낯선 가정에서 장기 정리 작업의 일반화를 보인 것과, π0.7이 조향 가능한 범용 정책의 새 평가를 제시한 것은 중요한 연구 진전이다 [11], [12]. 그러나 반사 재질, 공차, 공구 마모, 센서 교체, 설비 연동, 교대조 변화가 있는 생산 셀에서는 별도 검증이 필요하다. 넓은 사전학습은 “처음부터 배우는 비용”을 줄일 수 있지만 “공정 책임의 증거”를 대신하지 못한다.
이 때문에 범용 정책의 비교표는 회사명보다 다음 여섯 축이 유용하다.
| 비교 축 | 공개 범용 정책 계열 | 인간·다중 로봇 데이터 중심 계열 | 수직 통합 휴머노이드 계열 | 제조 해석 |
|---|---|---|---|---|
| 데이터 접근 | 공개 데이터와 일부 비공개 혼합, 미세조정 경로 공개 | 대규모 인간 영상·다기관·자체 수집 자료 | 자체 텔레오퍼레이션과 플릿 자료가 중심 | 원자료보다 고객 셀 자료의 반출·재생 권한이 핵심이다. |
| 로봇 몸체 | 여러 팔과 그리퍼에 어댑터 적용 | 공통 표현 또는 공통 말단장치로 차이를 줄임 | 특정 휴머노이드 몸체와 정책을 함께 최적화 | 교차 로봇 폭과 특정 몸체의 정밀도는 서로 다른 장점이다. |
| 행동 인터페이스 | 토큰, 연속 행동, 행동 묶음 등 비교 가능 | 인간 동작을 재대상화하거나 역동역학으로 행동을 추정 | 저수준 제어 경계가 공개되지 않는 경우가 많음 | 주기, 지연, 힘 제어, 안전 제어기의 경계를 확인해야 한다. |
| 공개성 | 코드·가중치·논문이 상대적으로 많음 | 데이터 규모는 커도 수집·정제 과정은 일부만 공개 | 제품 통합은 높지만 내부 자료와 평가가 폐쇄적 | 공개성은 내부 기준선에, 통합성은 배포 비용에 이점이 있다. |
| 평가 | 연구실 작업과 저자 정의 분모 | 교차 장면·교차 로봇·인간 영상 전이 | 선정된 제품·파트너 시연 | 같은 작업 정의와 실패 분류로 재평가해야 한다. |
| 배포 증거 | 외부 재현은 가능하나 생산 기록은 드묾 | 대규모 수집이 생산 수율로 이어진 증거가 제한적 | 현장 시연은 늘지만 연속 운영 지표가 제한적 | 공장 재생 집합과 변경 승인 기록이 최종 기준이다. |
이 표에서 공개성과 성능은 같은 축이 아니다. 공개 모델이 더 약해도 내부 검증 언어를 제공할 수 있고, 폐쇄형 모델이 더 강해도 고객 자료와 갱신 권한을 충분히 주지 않을 수 있다. 범용 전략은 둘 중 하나를 신앙처럼 택하는 것이 아니라, 공개 기준선과 통합 배포 후보를 같은 재생 집합으로 비교하는 것이다.
기업이 발표한 GEN-1의 숙련도·속도·소량 적응 주장도 이 표에서는 “수직 통합 후보의 공식 보고”로 읽는다 [28]. 공개된 작업 분모와 한계는 유용한 시장 신호지만, 외부 공장에서 같은 기준으로 재생되기 전에는 독립 생산 근거가 아니다.
그림 9.2. π0의 Figure 3은 인터넷 사전학습 VLM, 자체 수집 로봇 자료와 OXE를 포함한 사전학습 혼합, 300M 파라미터 행동 전문가가 여러 로봇의 연속 행동을 생성하는 구조를 보여준다. 입력 자료와 생성된 정책 행동을 보여주는 논문 구조도이지, 공장 품질·안전의 실측 증거는 아니다. 출처: Black et al. (2024), arXiv:2410.24164, Figure 3, p. 4.
NVIDIA 책임 지도: 하나의 스택이 아니라 일곱 개의 계약
NVIDIA 중심의 피지컬 AI 스택은 작성, 시뮬레이션, 학습, 학습형 증폭, 파운데이션 정책, 실제 셀 보증을 서로 다른 구성요소에 배정한다 [13], [14], [15]. 이 경계를 지우면 Omniverse가 물리 엔진처럼, Cosmos가 힘 센서처럼, GR00T가 안전 제어기처럼 오해된다. 반대로 경계를 유지하면 각 단계의 입력, 출력, 보정 책임, 증거 수준을 계약으로 만들 수 있다.
| 책임 | 주된 계층 | 받아들이는 것 | 내보내는 것 | 해결하려는 격차 | 보장하지 않는 것 |
|---|---|---|---|---|---|
| 장면 작성·상호운용 | OpenUSD·Omniverse 라이브러리 | 형상, 재질, 계층, 의미 표지, 변형 | 조합 가능한 장면과 자산 | 도구·조직 사이의 장면 단절 | 실제 마찰, 공차, 센서 오차의 정확성 |
| 로봇·센서 시뮬레이션 | Isaac Sim | 로봇 모델, 장면, 센서, 물리 설정 | 상태·영상·센서 합성 자료 | 실제 장비 없이 반복 실험하기 어려움 | 모든 실물 동역학과 고장 모드의 일치 |
| 학습·평가 편성 | Isaac Lab | 환경, 관측, 행동, 보상, 무작위화 | 병렬 학습 정책과 평가 기록 | 대규모 반복·비교 비용 | 좋은 보상, 올바른 공정 정의, 실물 안전성 |
| 접촉·변형 물리 | Newton 및 물리 백엔드 | CAD, 질량, 마찰, 탄성, 제어 입력 | 충돌·접촉·변형 상태 | 삽입, 케이블, 연질물의 표현 부족 | 잘못된 물성값을 자동으로 현실값으로 바꿈 |
| 시각·행동·미래 모델링 | Cosmos 계열 | 영상, 언어, 행동, 구조 조건 | 변환 영상, 미래 영상, 행동 추정, 점수 | 외관·장면·행동 범위 부족 | 관측되지 않은 힘·토크의 참값, 형식적 안전 증명 |
| 범용 정책 학습 | GR00T 계열과 학습 청사진 | 실제·합성 궤적, 언어, 로봇 상태 | 로봇 행동 정책 | 여러 작업·몸체 사이의 재사용 | 고객 공정의 수율·수명·규제 적합성 |
| 배포 보증 | 실제 셀 운영체계 | 실물 실행, 품질 결과, 정지·개입 로그 | 승인·거부·되돌림·재학습 자료 | 시뮬레이션이 놓친 잔차 | 공급자 플랫폼이 대신 소유할 수 없는 품질 책임 |
장면 계약: OpenUSD와 Omniverse
OpenUSD의 핵심은 여러 도구가 형상, 재질, 변형, 메타데이터를 조합 가능한 장면으로 교환하게 하는 데 있다 [13]. Omniverse 라이브러리와 연결기는 이 장면을 기존 3차원 제작 도구와 산업 응용에 넣고, 렌더링·물리·자료 접근 기능을 연결한다 [16]. 그 결과 한 팀이 만든 자산을 다른 팀이 다시 모델링하는 비용을 줄이고, 설계 변경을 장면 버전으로 추적하며, 센서 위치와 의미 표지를 재사용할 수 있다.
하지만 “로봇 준비 장면”은 “현실과 동일한 디지털 트윈”과 같은 말이 아니다. 충돌 형상이 있어도 실제 조립 공차가 빠질 수 있고, 재질 이름이 있어도 마찰계수가 틀릴 수 있으며, 의미 표지가 있어도 품질 검사 기준이 없을 수 있다. OpenUSD는 무엇을 담아 전달할지 정하는 언어다. 담긴 값이 현실과 맞다는 인증서는 아니다. 제조사는 장면 자산마다 출처, 허용 오차, 측정일, 보정 대상, 책임자를 기록해야 한다.
실험 계약: Isaac Sim과 Isaac Lab
Isaac Sim은 로봇 관절, 강체, 센서, 카메라, 라이다와 합성 자료 생성을 한 장면 안에서 실행하는 시뮬레이션 계층이다. 2026년의 Isaac Sim 연구 종합은 GPU 가속 병렬 실험과 합성 자료 생성을 주요 활용으로 정리하면서도 개방 세계 물리와 실용성의 한계를 과제로 남긴다 [14]. 이것은 플랫폼의 폭을 설명하는 논문 수준 근거지만, 공급자 생태계와 가까운 연구라는 점과 개별 제조 공정을 직접 평가한 논문이 아니라는 점도 함께 읽어야 한다.
Isaac Lab은 별도의 물리 법칙이 아니라 환경, 관측, 행동, 보상, 교육과정, 무작위화, 강화학습·모방학습 실험을 편성하는 틀이다 [17]. 수천 개 환경을 병렬화할 수 있다는 기능보다 더 중요한 것은 같은 정책을 같은 초기조건과 실패 정의로 반복 평가할 수 있다는 점이다. 그러나 잘못 설계한 보상을 더 빠르게 최적화할 수도 있다. 시뮬레이션에서 부품을 떨어뜨리고도 성공으로 판정하거나, 실제 센서에는 없는 완전한 물체 자세를 관측으로 주면 높은 점수는 오히려 배포 위험을 가린다.
따라서 Isaac Lab의 산출물은 “정책 파일” 하나가 아니라 실험 묶음이어야 한다. 장면 버전, 물리 백엔드 버전, 무작위화 분포, 관측·행동 정의, 보상, 초기화, 실패 분류, 시드, 학습 체크포인트를 함께 고정해야 한다. 그래야 정책의 개선과 시뮬레이터의 변경을 분리할 수 있다.
물리 계약: Newton은 표현력을 늘리지만 보정을 없애지 않는다
Newton은 Warp와 OpenUSD 위에서 확장 가능한 GPU 물리 엔진을 지향하며, 강체뿐 아니라 접촉·마찰·변형체와 미분 가능한 계산을 로봇 학습에 연결한다 [18]. 이 방향은 단단한 물체의 자유공간 이동보다 케이블 삽입, 천·고무 변형, 비틀림 마찰, 넓은 접촉면처럼 기존 단순 충돌 모델이 부족했던 작업에 중요하다.
그렇지만 더 표현력 높은 해석기는 더 많은 현실값을 요구한다. 실제 CAD 공차, 질량 분포, 마찰, 탄성, 감쇠, 모터 지연, 말단 순응성, 힘·촉각 센서 응답이 틀리면 세밀한 해석기가 세밀하게 틀릴 수 있다. Chebotar et al.[2]이 실제 실행 결과로 시뮬레이션 무작위화 분포를 조정한 이유도 여기에 있다. 시뮬레이터는 현실을 대체하는 원본이 아니라 실물 관측으로 계속 갱신해야 하는 가설이다.
Newton의 공개 페이지와 파트너 데모는 기능 방향과 통합 가능성을 보여주는 공식 근거다. 그러나 공식 근거만으로는 접촉이 많은 생산 셀에서의 장기 상관관계, 센서 교체 이후의 드리프트, 공구 마모에 대한 예측 정확도를 독립적으로 입증하지 않는다. 따라서 Newton의 채택 기준은 “정교한 영상을 만들었는가”가 아니라 같은 초기조건에서 접촉 시작 시점, 최고 힘, 미끄럼 방향, 최종 삽입 깊이, 실패 유형의 순위가 실물과 얼마나 맞는가가 되어야 한다.
| 계약 단위 | 기준이 되는 진실 | 배포 전에 남길 비교 근거 |
|---|---|---|
| 장면·자산 | 측정된 형상, 재질, 공차, 센서 배치 | 출처·불확실성·보정 대상이 있는 장면 버전 |
| 실험·물리 | 고정된 관측·행동·실패 정의와 실물 접촉 | 동일 초기조건의 실물-모의 궤적과 불일치 기록 |
| 학습형 증폭 | 실제 씨앗 자료와 역동역학을 거친 행동 가능성 | 생성·필터·의사 행동의 계보와 실물 재생 결과 |
Cosmos: 시각 증폭, 행동 증폭, 정책을 구분하기
Cosmos를 한 종류의 시뮬레이터로 부르면 책임이 흐려진다. Cosmos Transfer류의 조건부 변환은 깊이·분할·윤곽·키포인트 같은 구조 조건을 유지하면서 외관, 조명, 배경의 다양성을 늘리는 데 유용하다. 이는 주로 시각 격차를 다룬다. 접촉력이나 재료 변형을 계산하는 Newton의 역할과 다르다.
Cosmos Predict와 DreamGen·DreamDojo 같은 비디오 월드 모델은 현재 장면과 행동 또는 언어에서 미래 영상을 생성해 행동 범위를 넓히고, 정책 후보를 평가하며, 합성 궤적을 만드는 방향을 탐구한다 [7], [8]. DreamGen은 실제 시연을 바탕으로 새로운 행동과 환경의 비디오를 만들고 역동역학 모델로 의사 행동을 붙이는 흐름을 제시했다. 이 방식은 명시적 CAD 자산이 없는 장면까지 넓힐 잠재력이 있지만, 생성 영상이 그럴듯하다는 사실은 행동이 실물에서 실행 가능하거나 접촉력이 옳다는 뜻이 아니다. 의사 행동에는 생성 모델 오류와 역동역학 오류가 함께 들어간다.
Cosmos Reason류의 판별·추론 계층은 지시를 따르지 않거나 물체가 사라지고 관통하는 생성물을 걸러 내는 데 쓰일 수 있다. 그러나 이 판별기는 품질을 높이는 확률적 필터이지 물리적 정당성의 형식 검증기가 아니다. 잘못된 영상 중 눈에 띄는 것을 제거할 수 있어도, 미세한 과도 힘, 허용 공차 밖의 삽입, 재료 손상, 센서 포화까지 증명하지는 못한다.
Cosmos 3는 언어·이미지·비디오·음성·행동을 하나의 혼합 변환기 구조에서 처리하고 생성하는 옴니모달 월드 모델을 제시한다 [15], [20]. 행동 조건부 포스트트레이닝에서는 세 가지 모드를 구분할 수 있다. 순방향 동역학 모드는 현재 장면과 행동에서 다음 영상을 예측하고, 역동역학 모드는 관측된 비디오에서 가능한 행동 궤적을 추정하며, 정책 모드는 행동 묶음과 예상 미래를 함께 생성한다. 이 통합은 정책과 월드 모델 사이의 인터페이스를 줄이는 연구 방향으로 중요하다. 하지만 관측되지 않은 토크, 압력 분포, 촉각 사건이 비디오만으로 유일하게 결정되는 것은 아니다. 여러 행동이 비슷한 영상을 만들 수 있다는 비식별성도 남는다.
사용자가 제시한 두 NVIDIA 영상은 연결 가능한 기능과 작업 흐름을 보여주는 1차 공식 맥락일 뿐, 별도의 원 논문 실험이 뒷받침하지 않는 한 일반 성능 근거가 아니다 [21], [22]. Blender 영상은 Omniverse 라이브러리와 에이전트 도구를 기존 제작 환경에 넣어 물리 속성·센서·의미 표지를 보완하고 USD로 넘기는 예시를 보여준다. 그것은 장면 재사용과 작성 자동화의 가능성을 설명하지만, 자동으로 채운 속성이 실제 셀과 일치하거나 정책의 실물 성능이 향상됐다는 검증은 아니다.
Cosmos 3 행동 예측 영상에서 언급되는 100개 텔레오퍼레이션 시연도 같은 방식으로 읽어야 한다. 이는 LeRobot 형식의 소규모 픽앤플레이스 튜토리얼 구성과 포스트트레이닝 절차를 보여주는 맥락이다 [21]. 여러 작업·로봇·센서에서 같은 수량으로 목표 성능에 도달했다는 표본 효율 법칙이 아니다. 더구나 100개는 해당 과제의 적응 자료만 가리킬 뿐, 기반 월드 모델의 사전학습 자료, 실패 수집, 장면 보정, 안전 시험, 실물 품질 검증 비용을 포함하지 않는다.
따라서 “텔레오퍼레이션이 줄어드는가”에 대한 정확한 답은 조건부다. 이미 학습된 시각·행동 사전분포가 맞고, 작업의 접촉이 단순하며, 역동역학 오차를 실제 재생으로 걸러 낼 수 있다면 과제별 정상 시연의 추가 수량은 줄 수 있다. 반대로 공차가 좁거나 힘·촉각이 핵심이고 실패 비용이 높다면 실제 시연보다 실패·복구·품질 자료가 더 중요해질 수 있다. 인간 시간은 사라지기보다 정상 반복에서 예외 판정과 보정으로 이동한다.
GR00T 데이터 공장: 세 종류의 자료를 섞되 출처를 잃지 않기
GR00T N1은 언어·시각 의미를 다루는 상위 체계와 로봇 행동을 생성하는 하위 체계를 결합해 휴머노이드 범용 정책을 만들려는 공개 연구 기준점이다 [10]. NVIDIA 전략에서 중요한 것은 모델 이름보다 자료의 생산 방식이다. 실제 텔레오퍼레이션, 명시적 시뮬레이션, 학습형 비디오 생성이 서로 다른 오류를 갖는다는 전제 아래 한 정책 학습 파이프라인에 들어간다.
첫 번째 경로는 실제 씨앗 자료다. 작업자의 텔레오퍼레이션, 로봇 자체 실행, 실패 시 개입, 힘·촉각·관절·품질 결과가 여기에 속한다. 가장 비싸지만 행동 가능성과 공정 결과를 직접 연결한다. 두 번째는 물리 기반 증폭이다. Isaac Sim과 Isaac Lab에서 물체 위치, 장면, 로봇, 궤적, 조명, 센서 노이즈를 바꾸고, Newton 같은 백엔드로 접촉 표현을 확장한다. GR00T-Mimic류 흐름은 소수 시연을 객체 상대 궤적으로 바꾸어 같은 기술의 변형을 늘리는 데 적합하다. 세 번째는 학습형 증폭이다. Cosmos와 GR00T-Dreams류 흐름이 새로운 장면·행동 비디오를 생성하고, 필터와 역동역학으로 의사 행동을 붙인다.
세 경로를 섞을 때 가장 중요한 것은 출처 표지다. 각 에피소드가 실제인지, 물리 시뮬레이션인지, 생성 비디오에서 역산한 것인지, 사람이 수정한 것인지 남겨야 한다. 그렇지 않으면 정책이 좋아졌을 때 어느 자료가 기여했는지, 실패했을 때 어떤 생성 오류가 들어왔는지 알 수 없다. 학습 혼합 비율뿐 아니라 자료별 성공 판정의 신뢰도와 센서 채널의 결측도 기록해야 한다.
이 데이터 공장은 다른 범용 연구와 경쟁하면서도 보완된다. OpenVLA·Octo·π0 계열은 공개 모델과 행동 표현을 비교하는 기준선을 제공한다. 인간 영상 중심 계열은 로봇 점유 없이 작업 의미를 수집하는 확장성을 제공한다. 특정 몸체에 수직 통합된 계열은 몸체·제어기·정책을 공동 최적화한다. NVIDIA 계열의 차별점은 장면, 시뮬레이션, 학습, 월드 모델, 정책을 하나의 개발 생태계로 연결하려는 범위다. 장점은 인터페이스 비용 감소이고, 위험은 한 공급자의 용어가 장면 진실, 모델 성능, 배포 증거를 모두 정의하게 되는 것이다.
그림 9.3. Figure AI가 Helix 발표 페이지에서 제시한 과제 수 대 시간의 개념적 확장 곡선. 축에 수치·표본·오차막대가 없으므로 회사가 주장한 워크플로 맥락으로만 읽어야 하며, 측정된 스케일링 법칙이나 독립 공장 성능 증거가 아니다. 출처: Figure AI, 2025, Figure 1.
반증과 한계: 월드 모델이 놓치는 것
첫째, 영상에서 행동을 추정해도 힘과 촉각은 자동 복원되지 않는다. ForceVLA와 Tactile-VLA가 접촉이 많은 소수 작업에서 힘·촉각 채널의 이점을 보고한 것은 비전 중심 범용 정책의 빈칸을 보여준다 [23], [24]. 이 결과도 각각 제한된 작업과 센서 구성의 프리프린트이며, 센서 교체·오염·드리프트를 포함한 생산 수명주기 근거는 아니다. 중요한 반증은 “VLA가 실패했다”가 아니라 “같은 영상만으로는 접촉 상태를 충분히 구별하지 못할 수 있다”는 것이다.
둘째, 합성 궤적의 수는 유효 경험의 수가 아니다. 생성 모델이 같은 편향을 여러 번 복제하면 표면적 데이터량은 늘어도 실패 범위는 넓어지지 않는다. DreamGen은 새로운 행동을 만드는 가능성을 보였지만 의사 행동 오류, 생성 계산량, 복잡한 손 조작의 제한을 스스로 남긴다 [7]. DreamDojo도 인간 영상의 넓은 상호작용 사전분포를 정책 평가와 계획에 쓰는 전선을 열었지만, 희귀하고 빠른 실패, 다중 시점 일관성, 실제보다 낙관적인 성공 예측은 계속 검증해야 한다 [8].
셋째, 시뮬레이션의 순위 상관과 절대 정확도를 구분해야 한다. 어떤 시뮬레이터가 정책 A를 B보다 낫게 고르는 데 유용해도, 실제 성공률과 힘 값을 정확히 맞추지 못할 수 있다. 이 경우 정책 후보 선별에는 사용할 수 있지만 품질 승인에는 사용할 수 없다. 반대로 시각 외관은 매우 사실적이어도 접촉 실패의 순위가 틀릴 수 있다. 렌더링 사실성, 센서 사실성, 동역학 사실성, 작업 결과 상관은 별도 지표다.
넷째, 범용 정책은 긴 작업의 실패를 숨길 수 있다. 단계별 성공률이 높아도 수십 단계를 연속 수행하면 전체 완료율은 급격히 낮아진다. 오염, 사람 진입, 부품 혼입, 잘못된 초기화, 통신 지연처럼 학습 자료에서 드문 사건은 생산에서 반복된다. 모델이 언어 지시를 잘 이해하는 것과 안전 정지·복구·재작업을 올바르게 수행하는 것은 다른 능력이다.
다섯째, 공개성에도 경계가 있다. 가중치와 코드가 공개되어도 원학습 자료, 필터링, 계산 자원, 실패한 실험이 공개되지 않으면 완전 재현은 어렵다. 반대로 폐쇄형 시스템도 고객 셀의 에피소드와 갱신 기록을 내보내고 독립 감사를 허용하면 강한 배포 근거를 만들 수 있다. 따라서 오픈 대 폐쇄의 이분법보다 어떤 주장을 누가 다시 실행하고 반박할 수 있는가가 더 정확한 질문이다.
제조 해석: 현실 자료를 가장 정보 밀도 높은 곳에 쓰기
제조 데이터 전략의 목표는 실제 자료를 0으로 만드는 것이 아니다. 쉽게 바꿀 수 있는 변이는 계산으로 늘리고, 현실에서만 드러나는 접촉·실패·품질은 실제 셀에서 선택적으로 모으는 것이다. 이 원칙을 적용하면 작업별로 책임이 달라진다.
| 작업군 | 시뮬레이션·월드 모델이 잘 늘리는 것 | 실제 셀에서 남겨야 할 것 | 첫 승인 지표 |
|---|---|---|---|
| 정형 픽앤플레이스 | 물체 위치·자세, 조명, 배경, 카메라 시점, 도달 경로 | 미끄럼, 이중 집기, 반사·투명 물체, 그리퍼 마모 | 성공률과 함께 낙하·손상·재시도율 |
| 상자 적재·배열 | 양팔 충돌, 배치 순서, 목표 배열, 작업공간 | 종이 변형, 붙음, 반발, 실제 포장 편차 | 처리량, 눌림, 배열 오차, 사람 개입 |
| 삽입·체결 | CAD 변화, 접근 자세, 힘 제어 후보, 공차 분포 | 실제 마찰, 나사산, 토크-각도, 공구 마모, 잼 | 삽입 깊이, 최고 힘, 불량·손상률 |
| 케이블·필름·연질물 | 대략적 형태 변화와 경로 후보 | 재료별 탄성·접착·주름·미끄럼, 센서 드리프트 | 최종 형상, 손상, 복구 성공률 |
| 장기 다단계 작업 | 언어·순서 변형, 장면·물체 다양성 | 예외 전이, 잘못된 물체, 재작업, 교대조 변화 | 전체 완료율, 단계별 실패, 복구 시간 |
| 안전·품질 판정 | 위험 시나리오 열거와 회귀 시험 보조 | 실제 위해 사건, 제품 결과, 정지·승인 기록 | 허용 한계 위반 0건과 추적 가능한 판정 |
실행 순서는 로깅에서 시작한다. RGB·깊이, 명령·실제 관절, 말단 힘·토크, 그리퍼 상태, 물체와 공정 식별자, 설비 상태, 작업 결과, 불량 코드, 개입, 주기 시간을 동기화한다. 이 자료가 있어야 Newton의 물성 보정, Isaac Lab의 관측·보상 설계, Cosmos의 포스트트레이닝, GR00T의 미세조정, 실제 재생 평가가 같은 공정 진실을 공유한다.
그다음에는 작은 씨앗 시연으로 기준 정책을 만든다. 정상 시연만 늘리기보다 자율 실행을 제한된 셀에서 돌리고, 미끄럼·잼·잘못된 접근·품질 불합격 직전에 사람이 개입한 구간을 높은 우선순위로 수집한다. DAgger가 학습자가 실제로 방문하는 상태에서 전문가 레이블을 요청한 역사적 이유와 같다 [9]. 다만 위험 상태를 일부러 방문할 수 없으므로 안전 감시기와 잔여 제어기가 개입 범위를 제한해야 한다.
시뮬레이션과 생성 자료는 이 실제 씨앗 주위의 범위를 늘린다. 각 합성 에피소드에는 생성 경로와 신뢰도를 붙이고, 실제 실패 집합에서 도움이 되는지 제거 실험으로 확인한다. 합성 자료를 넣었을 때 평균 성공은 오르지만 잼 실패가 늘어난다면 전체 점수 하나로 덮지 않는다. 작업군, 물체군, 실패 유형별로 분해해 혼합 비율을 조정한다.
실제 셀의 릴리스 권한: 마지막 모델은 품질 체계다
독립적인 공장 규모 검증은 공급자 데모, 생성 궤적 개수, 모델 카드 벤치마크와 별개의 증거 요구사항으로 남는다 [25], [12], [26]. 2026년의 범용 정책·대규모 데이터 연구는 전선이 빠르게 움직인다는 강한 신호를 주지만, 비공개 텔레오퍼레이션·합성 자료·자체 평가에 의존하는 경우가 많고, 이미 강한 정책에 포스트트레이닝을 잘못 적용하면 성능이 떨어질 수도 있다. 제한된 실험실 과제군이나 공급자가 정의한 숙련도 임계값은 여러 공장의 연속 운영을 대신하지 않는다.
생산 승인은 네 개의 독립 루프를 요구한다. 첫째는 보정 루프다. 실제 궤적, 접촉, 센서 응답을 시뮬레이션과 비교해 장면·물성·지연 분포를 갱신한다. 둘째는 재생 루프다. 정상 사례뿐 아니라 미끄럼, 잼, 과도 힘, 잘못된 물체, 센서 누락, 사람 진입, 품질 불합격을 고정 집합으로 보관하고 모든 체크포인트에 다시 실행한다. 셋째는 안전 루프다. 정책과 별도의 힘 제한, 속도 제한, 작업공간, 설비 연동, 비상정지, 사람 인계가 최종 권한을 가진다. 넷째는 품질 루프다. 제품 검사 결과와 재작업·폐기·고객 불량을 에피소드에 다시 연결한다.
릴리스 절차는 오프라인 재생, 시뮬레이션 스트레스 시험, 그림자 실행, 제한된 시험 셀, 소규모 배포, 확대 배포 순으로 진행한다. 각 단계의 통과 조건과 되돌림 조건을 수치로 고정한다. 새 정책이 평균 성공률을 높여도 최고 접촉력을 넘거나 특정 부품군의 손상을 늘리면 거부해야 한다. 모델 공급자가 체크포인트를 갱신하더라도 생산 책임자는 이전 버전을 고정하고 비교할 수 있어야 한다.
자료 권한도 릴리스 권한의 일부다. 제조사는 자기 셀에서 나온 영상·센서·행동·품질 레이블을 내보낼 수 있어야 하고, 합성 자료와 실제 자료를 구분할 수 있어야 하며, 어떤 체크포인트가 어느 자료로 학습됐는지 추적할 수 있어야 한다. 공급자가 원사전학습 자료를 모두 공개하지 않아도 고객 셀의 결과와 갱신 이력을 감사할 수 있어야 한다. 이 권한이 없으면 데이터 플라이휠은 공장에 있지 않다.
실무적으로는 한 장짜리 모델 카드보다 셀 증거 패킷이 유용하다. 패킷에는 장면·물리·정책 버전, 센서 보정일, 학습 자료 출처 비율, 재생 집합 결과, 실물 시험 분모, 실패 혼동 행렬, 안전 한계 위반, 품질 결과, 사람 개입 시간, 승인자, 되돌림 버전을 담는다. 이 패킷을 공개 정책, NVIDIA 통합 스택, 다른 수직 통합 후보에 동일하게 요구하면 공급자 용어가 달라도 비교가 가능하다.
그림 9.4. 사전학습·모의실험·적응·실셀 승인의 파운데이션 모델 절차. 이 도식은 성능 주장이 아니라, 능력 근거가 재현과 품질 판정을 거쳐 배포 권한으로 넘어가는 운영 책임 체인을 요약한다. 출처: 저자 제작 SVG.
결론: 계산으로 범위를 넓히고 현실로 책임을 닫기
파운데이션 모델의 데이터 전략은 텔레오퍼레이션을 완전히 없애는 전략이 아니다. 반복되는 정상 시연 일부를 공개 사전학습, 물리 시뮬레이션, 월드 모델, 역동역학으로 대체하거나 증폭하고, 사람의 시간을 접촉 보정·실패 복구·품질 판정에 집중하는 전략이다. 이때 OpenUSD는 장면의 언어, Isaac Sim은 로봇·센서 실험장, Isaac Lab은 학습·평가 편성기, Newton은 접촉 표현기, Cosmos는 시각·행동 생성기, GR00T는 정책 학습기다. 어느 것도 실제 셀의 품질 권한을 대신하지 않는다.
NVIDIA 중심 전략의 강점은 이 책임들을 하나의 생태계로 연결해 장면에서 정책까지의 마찰을 줄이는 데 있다. 약점은 연결성이 높은 만큼 기능 설명, 연구 결과, 파트너 데모, 생산 증거가 한 브랜드 이야기 안에서 섞이기 쉽다는 데 있다. 따라서 가장 중요한 기술은 또 하나의 모델이 아니라 증거 등급, 자료 출처, 보정 기록, 재생 집합, 릴리스 권한을 유지하는 운영 설계다.
다음 10장에서는 이 원칙을 실제 배포 데이터 플라이휠로 옮긴다. 좁은 작업에서 시작한 생산 로봇 기업과 운영팀이 고객 셀의 로그, 예외, 원격 개입, 품질 결과를 어떻게 축적하고, 그 자료의 소유권과 갱신 권한을 어떻게 나누는지 살펴본다. 9장이 범용 정책을 만드는 데이터 공장의 지도라면, 10장은 그 정책이 매일 실패하고 교정되는 생산 운영의 지도다.
참고문헌
- Argall, Brenna D. et al. (2009). A Survey of Robot Learning from Demonstration. Robotics and Autonomous Systems.
- Dasari, Sudeep et al. (2019). RoboNet: Large-Scale Multi-Robot Learning. CoRL.
- Open X-Embodiment Collaboration (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. IEEE ICRA 2024.
- Ghosh, Dibya et al. (2024). Octo: An Open-Source Generalist Robot Policy. RSS 2024.
- Kim, Moo Jin et al. (2024). OpenVLA: An Open-Source Vision-Language-Action Model. CoRL 2024.
- Black, Kevin et al. (2024). π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv preprint. #2
- Jang, Joel et al. (2025). DreamGen: Unlocking Generalization in Robot Learning through Neural Trajectories. arXiv preprint.
- Gao, Shenyuan et al. (2026a). DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos. ICML 2026 Spotlight / arXiv.
- Ross, Stéphane et al. (2011). A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. AISTATS.
- Bjorck, Johan et al. (2025). GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. arXiv preprint.
- Physical Intelligence et al. (2025). π0.5: A Vision-Language-Action Model with Open-World Generalization. arXiv preprint.
- Physical Intelligence (2026). $π_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities. arXiv preprint. #62
- Alliance for OpenUSD (2026). OpenUSD Specifications and Alliance Governance. Official specification and governance site.
- Gao, Sicong et al. (2026b). NVIDIA Isaac Sim: Enabling Scalable, GPU-Accelerated Simulation for Robotics. arXiv preprint.
- Aditi et al. (2026). Cosmos 3: Omnimodal World Models for Physical AI. arXiv technical report.
- NVIDIA Omniverse (2026). NVIDIA Agent Toolkit Expands With New Omniverse Libraries. Official announcement.
- Mittal, Mayank et al. (2025). Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning. arXiv preprint.
- Newton Project (2026). Newton Physics Engine. Official project page.
- Chebotar, Yevgen et al. (2019). Closing the Sim-to-Real Loop: Adapting Simulation Randomization with Real World Experience. IEEE ICRA.
- NVIDIA Cosmos (2026). Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3. Official technical blog.
- NVIDIA Video (2026a). How to Post-Train NVIDIA Cosmos 3 for Robot Action Prediction. Official tutorial video.
- NVIDIA Video (2026b). Bringing Agent-Ready Simulation Into Blender. Official workflow video.
- Yu, Jiawen et al. (2025). ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation. arXiv preprint.
- Huang, Jialei et al. (2025). Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization. arXiv preprint.
- Kim, Dongyoung et al. (2026). RLDX-1 Technical Report. arXiv preprint. #67
- Zheng, Ruijie et al. (2026). EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data. arXiv preprint.
- Figure AI (2025). Helix: A Vision-Language-Action Model for Generalist Humanoid Control. Official company research post.
- Generalist Team (2026). GEN-1: Scaling Embodied Foundation Models to Mastery. Official company research post. #24
- Chelsea Finn et al. (2016). Guided Cost Learning: Deep Inverse Optimal Control via Policy Optimization. International Conference on Machine Learning.
- Michael Janner et al. (2019). When to Trust Your Model: Model-Based Policy Optimization. NeurIPS.
- Oliver Kroemer et al. (2021). A Review of Robot Learning for Manipulation: Challenges, Representations, and Algorithms. JMLR.
- Fanbo Xiang et al. (2020). SAPIEN: A SimulAted Part-based Interactive ENvironment. CVPR.
- Mohit Shridhar et al. (2022). CLIPort: What and Where Pathways for Robotic Manipulation. CoRL.
- Songming Liu et al. (2024). RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation. arXiv primary preprint (2024-10-10).
- Pertsch, Karl et al. (2024). Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models. Primary publication.