Part II: 제어와 학습

Chapter 6: 정책 아키텍처 — 범용성과 실행의 균형

집필일: 2026-06-18 최종수정일: 2026-07-22

개요

정책 아키텍처를 VLA 순위표로 읽으면 제조 조작의 핵심을 놓친다. 공장 셀에서 아키텍처는 중추 모델보다 먼저 행동 표현(action representation), 제어 지연, 센서 채널, 실패 시 권한을 결정한다. ACT는 짧은 양손 동작을 묶음으로 예측한다 [1]. Diffusion Policy는 연속 행동의 다봉 분포를 잡음 제거 과정으로 다룬다 [2]. RT-1/RT-2와 RT-X는 로봇 데이터 혼합과 언어 조건 일반화를 확장했다 [4], [5], [3].

OpenVLA, Octo, π0, OpenPI, FAST 계열은 "큰 모델이 곧 현장 준비 완료"라는 뜻이 아니다 [6], [7], [8], [10], [11]. 제조사는 모델이 무엇을 볼 수 있고, 얼마나 자주 행동을 바꾸며, 어떤 실패를 재생할 수 있고, 어떤 보호 장치가 출시를 막는지부터 물어야 한다. 이 장의 주장은 간단하다. 범용성은 넓은 사전학습에서 오지만, 실행 신뢰성은 짧은 피드백 고리, 물리 센서, 로봇별 제어기, 감사 가능한 실패 기록에서 온다. 어느 한쪽도 다른 쪽을 대신하지 못한다.

이 장을 읽고 나면... - ACT, Diffusion Policy, RT-X/Open X, OpenVLA/Octo/π0를 행동 표현 관점에서 비교할 수 있다. - 언어 연결, 로봇 혼합, 힘·촉각 채널이 제조 셀의 작업 주기와 출시 관문에 주는 영향을 설명할 수 있다. - 범용 정책 주장을 공장 배포 주장으로 바꾸기 전에 필요한 기록과 평가를 정의할 수 있다. - VLA가 아니어도 좋은 제조 정책 아키텍처가 될 수 있는 조건을 말할 수 있다. - Cosmos 3의 순방향 예측, 역행동 추론, 정책·세계 공동 생성을 구분하고 각 모드의 증거 한계를 설명할 수 있다.

아키텍처 선택표

선택 축 대표 계열 제조상 의미 먼저 확인할 증거
시간 표현 ACT의 행동 묶음 [1] 짧은 양손 절차에는 강하지만, 중간 접촉이 틀어지면 묶음을 끊고 복구해야 한다 묶음 길이별 실패 재생, 작업자 개입 지연
행동 분포 Diffusion Policy [2] 여러 가능한 접근 경로를 표현하기 좋지만, 표본화 지연과 안전 보호가 중요하다 작업 주기, 힘 제한 위반, 복구 경로
언어 연결 RT-1/RT-2, OpenVLA [4], [5], [6] SKU 지시와 과제 설명을 흡수하지만, 공정 변수는 별도 구조 입력이 필요하다 지시문 바꿔쓰기 시험, 로트·지그 분할
로봇 혼합 Open X-Embodiment, Octo [3], [7] 로봇 다양성은 사전지식을 넓히지만 행동 규약 불일치를 만든다 로봇별 보정, 행동 재매핑 기록
흐름·토큰 행동 π0, FAST, SmolVLA [8], [11], [12] 부드러운 제어와 학습 효율 사이에 절충이 생긴다 경계 행동, 접촉 복구, 추론 예산
물리 채널 Gemini Robotics, GR00T, ForceVLA, Tactile-VLA [13], [14], [16], [17] 시각언어만으로 보이지 않는 힘과 접촉을 정책 입력으로 넣는다 힘·촉각 보정, 이동, 센서 누락 시험

이 표는 아키텍처를 "최신 모델"이 아니라 "공장 셀의 제어 계약"으로 보게 만든다. 같은 중추라도 행동을 5 Hz로 내는지 50 Hz로 내는지, 힘 보호를 외부 제어기가 맡는지 정책 토큰이 맡는지에 따라 안전성과 작업 주기는 전혀 달라진다.

역사적 전환: 한 시점의 행동에서 조건부 궤적으로

행동 복제의 오래된 약점은 학습 데이터의 상태 분포를 벗어난 순간부터 오차가 누적된다는 것이다. DAgger는 학습자가 실제로 방문한 상태에 전문가 표식을 다시 모으는 방식으로 이 문제를 정식화했지만, 위험한 접촉 상태를 일부러 방문해 교사에게 물을 수 없는 제조 셀에서는 전문가 호출 자체가 비용이 된다 [25]. 2010년대의 시각 운동 제어와 로봇 강화학습은 이 문제를 더 큰 데이터와 온라인 상호작용으로 밀어붙였으나, 조립과 양손 작업에서는 한 프레임의 행동보다 연속성 있는 짧은 동작 구조가 중요했다.

ACT의 행동 묶음과 시간 앙상블은 이 흐름을 바꿨다. 정책이 매 순간 하나의 명령만 내는 대신 겹치는 미래 행동열을 예측하고, 여러 예측을 시간축에서 합치면 시연의 비정상적 정지나 떨림을 완화할 수 있다 [1]. Diffusion Policy는 다음 단계로, 가능한 궤적이 하나라는 가정을 버리고 조건부 확산 과정으로 여러 행동 모드를 보존했다 [2]. 이후 Open X-Embodiment와 RT-X는 행동 문법 자체보다 서로 다른 로봇의 데이터를 하나의 학습 혼합으로 묶는 문제를 전면에 놓았고 [3], Octo와 OpenVLA는 각각 유연한 관측·행동 토큰화와 언어-행동 공동 표현을 공개 구현으로 확장했다 [7], [6]. π0는 사전학습된 시각언어 모델에 흐름 정합(action flow matching) 기반 행동 전문가를 붙여 연속 행동 묶음을 생성하는 방향을 택했다 [8].

행동 묶음, 확산, 흐름 정합, 토큰화 행동은 지연, 다봉성, 예측 지평, 폐루프 수정의 비용을 서로 다르게 교환한다. 이들은 같은 메커니즘을 가리키는 표현이 아니며, 그 우열은 인용된 과제·로봇·데이터·제어 주기·기준선·평가 분모 안에서만 말할 수 있다 [1], [2], [8], [6]. 따라서 역사적 진보를 “더 큰 모델”로만 요약하면 실제 변화가 사라진다. 핵심 변화는 한 시점의 평균 행동에서 조건부 궤적 분포로, 단일 로봇의 좌표계에서 로봇 간 사전학습으로, 영상 명령에서 힘과 촉각까지 포함한 폐루프로 확장된 것이다.

이 계보는 제조 의사결정에 세 가지 질문을 남긴다. 첫째, 정책이 내놓는 것은 관절 위치, 말단장치 속도, 자세 변화량, 이산 토큰, 아니면 의미가 붙은 기술 단위인가. 둘째, 예측한 전체 지평 중 얼마를 실행한 뒤 다시 관측하는가. 셋째, 모델이 보지 못하는 접촉 변수가 바뀌면 누가 동작을 중단하는가. 이 세 질문에 답하지 않은 성공률은 아키텍처를 선택하기에 부족하다.

비교 축 ACT·행동 묶음 확산·흐름 정책 RT-X·Octo·OpenVLA·π0 촉각·힘 정책 세계·행동 모델
행동 표현 겹치는 연속 행동열 연속 궤적 분포 정규화 행동, 토큰 또는 흐름 전문가 위치·힘 또는 촉각 조건 행동 행동과 미래 장면의 공동 변수
지연 한 번에 여러 동작을 내지만 묶음 취소가 관건 반복 표본화 또는 흐름 적분 비용 큰 중추·디코더와 통신 비용 센서 동기화와 혼합 제어 비용 영상 생성·추론 비용이 큼
폐루프 실행 접두부 뒤 재계획 지평 일부만 실행하고 재표본화 구현별 재계획 주기 차이가 큼 빠른 힘 고리가 필수 예측을 행동 고리에 연결하는 검증 필요
감각 양식 주로 영상·고유감각 주로 영상·고유감각 영상·언어 중심 영상·언어에 힘·촉각 추가 영상·언어·행동, 일부 다중양식
데이터 체제 과제별 시연에 강함 과제별 시연과 재생 데이터 대규모 로봇 혼합 뒤 현장 적응 센서가 달린 접촉 시연 필요 대규모 사전학습과 행동 표식 사후학습
접촉 실패 긴 묶음이 충돌 뒤 계속될 수 있음 표본화 중 빠른 반사 고리가 필요 숨은 힘을 영상으로 대체할 수 없음 보정 이동·마모·누락에 취약 그럴듯한 영상과 정확한 힘은 다름
계산 비교적 작은 정책도 가능 표본화 단계에 민감 중추 크기·양자화·가속기 의존 정책 외 고속 제어기가 추가됨 학습·생성 비용이 가장 큼
출시 가능성 좁은 반복 작업부터 단계 출시 지연과 안전 필터를 함께 승인 공개성보다 로봇별 검증이 중요 센서 수명·고장 시험이 필수 당사자 기능 증거와 현장 검증을 분리

이 비교표는 어느 계열이 “최고”인지 답하지 않는다. 대신 어떤 실패 비용을 어디로 옮기는지 보여준다. ACT는 시간적으로 겹치는 예측을 행동 묶음으로 구성하지만 공개된 시간 앙상블 구현은 매 시점 정책을 호출하므로, 묶음화 자체가 예측 호출 수를 줄이지 않으며 별도의 중단 경로가 필요하고, 확산·흐름 정책은 다봉성을 얻는 대신 계산과 보호 장치 통합을 요구한다. 교차 로봇 VLA는 넓은 사전지식을 얻는 대신 좌표계와 데이터 혼합 감사를 요구하며, 세계·행동 모델은 예측과 생성 범위를 넓히는 대신 물리 일관성을 별도 검증해야 한다.

Manipulation policy architecture map

그림 6.1. ACT, Diffusion Policy, RT-X, OpenVLA, π0를 관측·정책 코어·행동 표현·제조 검증 문턱으로 정리한 저자 작성 비교도다. 공통 벤치마크 결과나 Cosmos 3 튜토리얼의 실증을 나타내지 않는다.

ACT와 행동 묶음의 장점과 위험

ACT가 중요한 이유는 양손 조작을 매 순간 독립 행동으로 보지 않고, 짧은 미래의 행동열로 예측한다는 점이다 [1]. 케이블을 잡고 당기거나 양손으로 작은 부품을 맞추는 작업에서는 이런 묶음이 사람의 연속 동작과 잘 맞는다. 또한 저비용 하드웨어와 모방학습 구성이 결합되어 "정교한 하드웨어만 답"이라는 가정을 약화시킨다.

문제는 제조 셀의 접촉이 묶음 중간에서 바뀐다는 점이다. 부품이 지그 턱에 걸렸는데 묶음이 끝날 때까지 계속 밀면 외관 손상이나 걸림이 된다. 그래서 ACT류 정책은 묶음 길이, 재계획 주기, 힘 정지, 작업자 개입 지연을 같이 설계해야 한다. 묶음이 길수록 동작은 부드러워질 수 있지만 접촉 사건에 대한 반응은 늦어진다.

ACT action-chunking behavior

그림 6.2. ACT의 조건부 VAE 인코더는 시연 행동열에서 스타일 변수 z를 추론하고, Transformer 디코더는 네 카메라 관측·관절 상태·z에서 행동 묶음을 생성한다. 이 구조도 자체는 접촉 변화 때 묶음을 안전하게 중단하는 기능을 입증하지 않는다. 출처: Zhao et al. 2023, arXiv:2304.13705 Fig. 4.

확산 행동은 위험한 평균을 피한다

Diffusion Policy의 장점은 "한 장면에는 하나의 정답 행동만 있다"는 가정을 약화시키는 것이다 [2]. 같은 부품 삽입도 왼쪽에서 약간 돌려 넣는 경로, 오른쪽으로 미세하게 밀어 넣는 경로, 한 번 물러났다 다시 접근하는 경로가 모두 가능하다. 평균을 내면 위험한 행동이 될 수 있는 상황에서 분포를 모델링하는 것은 큰 이점이다.

하지만 확산 표본화는 추론 예산과 연결된다. 제조 작업 주기가 엄격하면 여러 잡음 제거 단계를 쓰기 어렵고, 접촉 직후 복구에는 빠른 하위 제어 반사나 보호 장치가 필요하다. 그래서 Diffusion Policy를 공장에 넣는 질문은 "성공률이 높은가"뿐 아니라 "표본화 지연 동안 힘 제한을 누가 보장하는가"가 되어야 한다.

지연 예산은 아키텍처의 숨은 사양이다

제조 셀에서 지연은 평균 추론 시간이 아니라 최악 응답 시간이다. 시각 부호기가 장면을 읽는 시간, 언어 조건 중추가 행동을 내는 시간, 제어기가 궤적을 보간하는 시간, 안전 계층이 정지를 거는 시간이 모두 합쳐진다. 같은 정책이라도 200 ms마다 행동을 바꾸는 셀과 20 ms마다 접촉 보호를 확인하는 셀은 전혀 다른 설계다.

ACT류 묶음은 상위 행동을 안정적으로 만들 수 있지만 접촉 사건이 묶음 중간에 들어오면 중단 경로가 필요하다. 확산류 행동 분포는 여러 경로를 잘 표현할 수 있지만 표본화 단계가 많아지면 작업 주기가 늘어난다. RT-X/OpenVLA류 모델은 지시와 시각 맥락을 넓게 쓰지만, 하위 힘 반응을 언어 모델이 직접 맡기에는 느릴 수 있다. 따라서 아키텍처 비교표에는 성공률과 함께 반응 예산이 들어가야 한다.

현장에서는 정책 고리와 안전 고리를 분리하는 경우가 많다. 정책은 5~20 Hz로 다음 동작 구간을 제안하고, 제어기와 안전 보호는 더 높은 주기로 힘 제한과 충돌 구역을 본다. 이 분리가 명시되어 있지 않으면 큰 정책이 실제보다 더 많은 권한을 가진 것처럼 보인다. 제조사가 공급자 묶음을 평가할 때 물어야 할 질문은 "모델이 무엇을 할 수 있는가"뿐 아니라 "모델이 무엇을 못 하게 되어 있는가"다.

의사결정 예시: 유연 케이블 배선

유연 케이블 배선은 아키텍처 차이를 잘 드러내는 작업이다. 케이블은 고정된 강체 자세가 없고, 작업 중 모양이 바뀌며, 연결부 끝과 여유 길이가 서로 다른 상태를 만든다. 사람은 큰 모양을 눈으로 보고 손끝으로 장력을 느끼며, 당기면 안 되는 구간에서는 힘을 뺀다. 시각언어 모델은 "케이블을 고정구 안에 넣어라"라는 지시를 이해할 수 있지만, 케이블 장력과 걸림은 별도 채널 없이는 늦게 드러난다.

ACT를 쓰면 케이블 배선의 짧은 하위 절차, 예를 들어 고정구 앞에서 잡고 밀어 넣는 동작을 묶음으로 만들 수 있다. Diffusion Policy를 쓰면 여러 가능한 배선 경로를 행동 분포로 표현할 수 있다. OpenVLA나 RT-X 계열을 쓰면 SKU 설명, 고정구 위치, 작업 순서 같은 언어 맥락을 활용할 수 있다. 하지만 케이블이 모서리에 걸리는 순간에는 힘·촉각 보호와 빠른 후퇴가 필요하다.

따라서 이 작업의 아키텍처 선택은 모델 계열이 아니라 권한 이양 설계다. 상위 정책은 어느 고정구로 갈지 정한다. 지역 제어기는 장력과 힘 제한을 본다. 실패 감지기는 걸림을 접촉 사건으로 분류한다. 작업자 개입 기록은 어떤 후퇴 동작이 실제로 케이블 피복 손상을 줄였는지 남긴다. 이 이양 구조가 보이지 않으면 범용 정책은 케이블 배선을 "영상에서 보이는 경로 따라가기"로 축소한다.

행동 표현은 실패 복구 방식을 결정한다

행동 표현은 정책 출력의 모양만이 아니라 실패 복구의 문법이다. 이산 행동 토큰은 기록과 언어 정렬이 쉽지만 접촉이 많은 경계에서 동작이 거칠어질 수 있다. 연속 행동은 부드럽지만 감사와 기호 제약 연결이 어렵다. 흐름이나 확산 행동은 여러 가능한 궤적을 다루지만 표본화와 보호 장치 통합이 중요하다. FAST와 π0 계열 논의가 제조에서 흥미로운 이유가 여기에 있다 [8], [11], [10].

예를 들어 압입 작업에서 이산 토큰 정책이 "삽입" 토큰을 냈다고 하자. 이 토큰이 실제로는 어느 속도, 어느 힘 증가율, 어느 후퇴 문턱을 뜻하는지 제어기가 알아야 한다. 연속 정책이 직접 속도를 내면 더 세밀하지만, 품질 담당자가 왜 특정 실패에서 더 밀었는지 설명하기 어렵다. 확산 궤적은 여러 복구 경로를 제안할 수 있지만, 현장에서는 그중 안전 보호를 통과한 경로만 실행되어야 한다.

이 때문에 제조 아키텍처는 정책 출력을 그대로 구동기 명령으로 보내기보다 형식화된 행동 계층을 둔다. 접근, 정렬, 탐침, 삽입, 후퇴, 검사 같은 행동 유형을 정의하고 각 유형의 매개변수와 보호 조건을 따로 둔다. 학습 정책은 유형과 매개변수를 제안하고, 제어기는 보호 조건을 적용하며, 출시 심의자는 유형별 실패율을 본다. 이 구조가 있으면 범용 정책을 쓰더라도 품질팀이 이해할 수 있는 단위로 성능을 관리할 수 있다.

데이터 혼합 감사: 큰 말뭉치가 내 셀을 대표하는가

Open X-Embodiment와 DROID 같은 말뭉치는 다양성을 준다 [3], [19]. 그러나 다양성은 표현 사전지식이지 현장 인증이 아니다. 제조사는 후보 정책이 어떤 데이터 혼합에서 왔는지 물어야 한다. 탁상 집기가 많은지, 양손 조립이 있는지, 힘이 중요한 삽입이 있는지, 변형 물체가 있는지, 실패 에피소드와 작업자 교정이 얼마나 있는지에 따라 전이 위험이 달라진다.

데이터 혼합 감사는 SKU 범위만 보는 일이 아니다. 카메라 각도, 로봇 형상, 집게 유형, 행동 주기, 센서 양식, 초기화 절차, 성공 정의를 함께 본다. 공개 데이터셋에서 성공이 "목표 위치에 도달"이라면, 공장에서는 "검사와 후속 시험 통과"가 될 수 있다. 이 차이를 알지 못하면 범용 모델의 넓은 사전지식이 현장의 잘못된 확신이 된다.

RT-X와 교차 로봇 학습은 사전지식이지 인증이 아니다

교차 로봇 VLA 사전학습은 넓은 사전지식을 제공하지만, 배포는 행동 공간 정규화와 로봇별 적응에 계속 좌우된다 [3], [7], [6]. Open X-Embodiment가 이질적인 데이터셋을 공통 형식으로 정규화한 것은 큰 공학적 성취인 동시에 경고다. 공통 스키마는 로봇 간 학습을 가능하게 하지만, 각 로봇의 관절 한계, 제어 의미, 집게 순응성, 센서 지연 중 일부를 버리거나 우회해야 하기 때문이다. Octo가 새 관측과 행동 머리에 적응할 수 있고 OpenVLA가 공개 미세조정 경로를 제공한다는 사실도 이 마지막 구간을 없애지는 않는다.

RT-1/RT-2와 Open X-Embodiment의 힘은 로봇 데이터를 웹 지식, 언어 지시, 여러 몸체와 연결한 데 있다 [4], [5], [3]. Octo와 OpenVLA는 이 흐름을 공개 범용 정책과 VLA 쪽으로 넓혔다 [7], [6]. 제조사에게 이것은 강한 사전지식이다. 처음 보는 SKU 설명, 비슷한 도구 사용, 다른 로봇에서 본 시각 동작을 더 빠르게 활용할 수 있다.

Open X-Embodiment cross-robot data

그림 6.3. Open X-Embodiment Figure 1은 100만 에피소드, 34개 연구실, 21개 기관, 22개 embodiment, 527개 skill, 60개 데이터셋의 구성을 요약한다. 이 범위만으로 action convention과 calibration의 제조 전이를 인증하지는 않는다. 출처: Open X-Embodiment Collaboration 2024, arXiv:2310.08864 Fig. 1.

그러나 교차 로봇 학습은 인증서가 아니다. 공개 데이터셋에서 "집기"로 묶인 행동이 특정 공장의 토크 제한, 집게 패드 마모, 검사 카메라 시점과 맞는다는 보장은 없다. Open X 방식의 사전학습은 초기 정책을 똑똑하게 만들 수 있지만, 출시 관문은 현장별 재생 자료, 지그 분할, 센서 누락, 작업자 개입으로 다시 걸러야 한다.

이때 RT-X, Octo, OpenVLA, π0를 한 줄 순위로 세우면 안 된다. RT-X는 데이터 혼합에서 양의 전이가 가능한지를 묻고, Octo는 유연한 입출력 어댑터와 공개 정책 학습을 강조한다. OpenVLA는 7B 규모의 시각언어 중추와 이산 행동 토큰을 결합해 공개 미세조정과 양자화 경로를 제공한다. π0는 연속 행동 묶음을 생성하는 흐름 기반 행동 전문가에 무게를 둔다. 전자는 토큰 로그와 언어 정렬을 감사하기 쉽지만 접촉 경계의 양자화와 추론 지연을 확인해야 하고, 후자는 연속 궤적을 자연스럽게 표현하지만 비공개 학습 혼합과 계산 비용 때문에 독립 재현 범위가 좁다 [6], [8].

통합 패턴: 계획기, 정책, 제어기를 분리한다

제조 아키텍처는 하나의 거대한 모델 블록으로 끝나지 않는다. 과제 계획기는 어떤 SKU와 지그에서 어떤 단계를 수행할지 정한다. 정책은 현재 관측에서 다음 행동 유형과 매개변수를 제안한다. 제어기는 로봇별 동역학과 힘 보호를 적용한다. 안전 계층은 사람, 설비, 제품 손상을 막는 마지막 권한을 갖는다. 이 네 층을 분리해야 VLA나 확산 정책을 넣어도 공정 책임이 사라지지 않는다.

예를 들어 OpenVLA류 모델이 "파란 연결부를 왼쪽 소켓에 넣어라"는 지시를 이해한다고 하자 [6]. 그 다음에는 계획기가 소켓 변형과 검사 규칙을 고르고, 정책이 접근과 탐침 행동을 제안하며, 제어기가 힘 증가율을 제한한다. 센서 누락이 생기면 안전 계층이 보호된 후퇴로 전환한다. 이 분리가 없으면 언어 조건 성공이 곧바로 생산 권한처럼 오해된다.

Octo나 OpenPI 같은 공개 기술 묶음은 이 분리를 실험하고 감사하기 좋다 [7], [10]. 그러나 공개 묶음이라도 현장 통합은 별도 문제다. 제어기 주기, 로봇 구동기, 안전 PLC, 품질 데이터베이스, MES 추적이 연결되어야 한다. 제조사가 아키텍처를 산다는 것은 모델 가중치를 사는 것이 아니라 이 통합 경계를 관리하는 일이다.

통합 패턴의 마지막 질문은 되돌리기다. 계획 규칙만 되돌릴 수 있는가, 정책 체크포인트만 되돌릴 수 있는가, 제어기 보호 문턱만 되돌릴 수 있는가. 세 층이 한 공급자 제품으로 묶여 있으면 되돌리기는 느리고 불투명하다. 층이 분리되어 있으면 실패 원인에 맞춰 더 작게 되돌릴 수 있다.

인수 시험도 이 층별 구조를 따라야 한다. 계획기 시험은 잘못된 SKU나 지그를 고르지 않는지 본다. 정책 시험은 재생 자료에서 행동 유형과 매개변수가 적절한지 본다. 제어기 시험은 힘과 충돌 보호를 본다. 안전 시험은 센서 누락, 비상 정지, 사람 진입을 본다. 하나의 종합 성공률로 이 네 층을 합치면 어디가 약한지 알 수 없다.

이전 단계에서 받은 것 필요한 현장 변환 지연·복구 확인 남길 출시 기록
교차 로봇 사전지식 관측·행동 규약을 대상 로봇에 다시 대응 관절 한계, 집게 순응성, 센서 시간 정렬에 맞는지 확인 데이터 혼합, 어댑터, 보정 판본
행동 묶음·흐름·토큰 출력 계획기·정책·제어기 사이의 형식화된 행동으로 변환 관측부터 실행·취소·재계획까지 보호 문턱 안인지 확인 시간표식, 취소 이유, 보호 개입
공개 체크포인트·인터페이스 현장 드라이버와 QA·PLC에 연결 재현 집합과 고장 주입에서도 행동 의미가 유지되는지 확인 체크포인트, 드라이버, 평가 규칙
후보 정책 제한된 셀·SKU·지그에서 보류 평가 꼬리 지연, 센서 누락, 복구 경로 확인 승인자, 배포 묶음, 되돌리기 지점

OpenVLA, Octo, π0를 구분하는 질문

공개 체크포인트와 명시된 인터페이스는 감사 가능성을 높이지만 그 자체로 제조 성능을 입증하지는 않는다. 실험 재현, 실패 재생, 버전 고정, 지연 측정, 통제된 적응은 더 쉬워질 수 있다 [6], [7], [12]. 공개 모델도 훈련 혼합의 편향, 로봇 드라이버 차이, 비결정적 추론, 센서 교체 후 분포 이동을 겪는다. “가중치를 받을 수 있는가”와 “내 셀에서 장기간 허용 가능한 불량률을 보이는가”는 서로 다른 출시 질문이다.

OpenVLA는 공개 VLA라는 점에서 실험과 감사 가능성을 높인다 [6]. Octo는 범용 로봇 정책을 공개된 학습법으로 제공해 여러 로봇을 다루는 비교 기준이 된다 [7]. π0는 흐름 방식 행동 모델로 범용 로봇 제어를 밀어붙이고, OpenPI는 그 기술 묶음을 실험 가능한 형태로 열었다 [8], [10]. FAST는 행동 토큰화의 효율을 다른 방향에서 제안한다 [11].

이 차이는 제조에서 실용적이다. 감사가 필요한 제조사는 공개 가중치와 학습법을 선호할 수 있다. 작업 주기가 빡빡한 셀은 추론 지연과 행동 토큰화 비용을 본다. 고장 시 책임이 중요한 셀은 어떤 계층이 정지 권한을 갖는지 본다. "VLA"라는 이름 하나로 묶으면 이 차이가 사라진다.

계산 자원도 출시 가능성의 일부다. 큰 모델이 서버에서 충분히 빠르더라도 카메라 프레임 전송, 전처리, 네트워크 왕복, 행동 디코딩, 제어기 큐잉까지 더하면 꼬리 지연이 커질 수 있다. 반대로 SmolVLA의 비동기 추론처럼 행동 실행과 다음 예측을 겹치면 평균 처리량은 좋아지지만, 장면이 급변할 때 오래된 행동 묶음이 실행될 위험이 생긴다 [12]. 따라서 평균 초당 프레임 수와 함께 95·99백분위 지연, 관측 시각과 실행 시각의 차이, 취소된 행동의 비율을 기록해야 한다.

FAST의 효율적 토큰화도 같은 관점에서 보아야 한다 [11]. 더 짧은 토큰열은 자기회귀 디코딩 비용을 줄일 수 있지만, 압축된 표현이 접촉 직전의 미세 속도 변화와 실패 복구를 얼마나 보존하는지는 과제별로 시험해야 한다. 공개성, 소형화, 빠른 디코딩은 모두 중요한 공학적 장점이지만, 어느 것도 접촉 품질의 대리 지표는 아니다.

세계·행동 모델: 예측기, 역추론기, 정책을 분리해서 읽기

학습된 세계 모델의 계보는 행동 조건 비디오 예측과 모델 기반 제어에서 출발한다. Visual Foresight는 행동 후보에 따른 미래 영상을 예측하고 계획에 사용했고, DayDreamer는 서로 다른 실제 로봇에서 픽셀과 희소 보상으로 세계 모델을 학습하는 경로를 보였다 [26], [27]. 최신 세계·행동 모델(world-action model)은 여기서 한 걸음 더 나아가 미래 장면과 행동을 공동 모델링한다. Ye et al.[28]은 비디오 확산 중추가 세계 상태와 행동을 함께 모델링해 영점 예시 정책처럼 작동할 가능성을 탐구한다. 하지만 이 결과 역시 해당 논문의 과제·주기·로봇 설정에 묶이며, 검증되지 않은 공장 상태에서 즉시 쓸 수 있다는 뜻은 아니다.

NVIDIA의 Cosmos 3 전략은 이 전선을 제품화 가능한 구성 요소로 묶으려는 시도다. 연구 논문은 Cosmos 3를 생성, 추론, 행동 모사, 공개 체크포인트·데이터·벤치마크를 연결한 다중양식 세계 모델 플랫폼으로 제시한다 [29]. 공식 기술 안내서는 행동 표식 데이터로 사후학습한 모델을 세 가지 모드로 설명한다 [30]. 첫째, 순방향 동역학은 현재 영상·과제 설명·행동 궤적을 받아 그 행동 이후의 영상을 예측한다. 둘째, 역동역학은 과제 영상과 설명에서 관측 가능한 행동 궤적을 추론한다. 셋째, 정책·세계 공동 모드는 초기 관측과 과제 설명으로 다음 행동 묶음과 예상 영상을 함께 생성한다. 세 모드는 같은 학습 기반을 공유할 수 있지만, 질문과 출력이 다르므로 하나의 능력으로 합쳐 말하면 안 된다.

특히 역동역학 출력은 센서가 직접 측정한 물리량이 아니다. 영상에서 말단장치의 이동을 추정할 수 있어도 가려진 접촉력, 손가락 내부 압력, 미세 미끄럼, 구동기 토크의 참값이 자동으로 복원되는 것은 아니다. 순방향으로 그럴듯한 영상을 만든 것 역시 접촉 역학이 정확하다는 보증이 아니다. NVIDIA의 공식 Cosmos3-Super 모델 카드는 행동-상태 표류, 객체 변형, 비현실적 충돌, 물리적으로 타당하지 않은 동작 가능성을 한계로 명시한다 [33]. 그러므로 세계 모델 예측은 후보 행동 선별, 데이터 점검, 실패 시나리오 생성에는 유용할 수 있지만, 힘 제한과 제품 손상 판정은 측정 센서와 실제 셀 시험으로 닫아야 한다.

Cosmos 행동 모델 시연은 당사자 기능 증거이며, 통제된 교차 과제 평가 없이는 보편적 소수 예시 학습이나 원격조작 감소 주장이 따라오지 않는다. 제공된 튜토리얼은 LeRobot 형식의 YAM 데이터를 사용한 사후학습, 체크포인트 내보내기, 순방향 예측 절차를 보여주고 다른 설정으로 역동역학과 정책 모드를 지원한다고 설명한다 [31]. 그러나 과제 성공률의 분모, 교차 과제 비교, 독립 재현이 없다. 공개 영상은 “100개 시연이 일반적으로 충분하다”는 표본 효율 결과도 입증하지 않는다 [31], [29].

이 경계는 NVIDIA의 GR00T 맥락을 이해하는 데 중요하다. GR00T N1은 휴머노이드용 범용 로봇 정책 계열로서 언어·영상 입력을 행동으로 연결하려는 모델이고, Cosmos 3는 세계 예측·추론·행동 조건 생성을 지원하는 세계 모델 계열이다 [14], [29]. Cosmos가 생성하거나 추론한 궤적은 GR00T류 정책의 학습 자료나 평가 후보가 될 수 있지만, 두 모델을 합쳤다고 실제 시연, 로봇 보정, 안전 검증이 사라지는 것은 아니다. 생성 데이터에는 출처, 생성 설정, 필터, 물리 일관성 검사, 실제 데이터와의 비율을 붙여야 한다. 실제 출시에서는 세계 모델이 예측한 성공보다 실제 로봇의 힘 기록, 품질 검사, 재시도와 작업 중단이 더 높은 권위를 가져야 한다.

NVIDIA 중심 전략을 정책 층에서 정리하면 역할 분담이 보인다. Omniverse와 OpenUSD가 장면과 자산을 교환하고, Isaac Sim/Lab이 로봇·센서 시뮬레이션과 병렬 학습을 맡으며, Cosmos가 시각·행동 시나리오를 생성하거나 평가하고, GR00T가 정책 학습의 한 축을 담당한다. 그러나 이 연결은 단일 종단간 보증이 아니다. 장면의 시각적 사실성, 접촉 물리의 정확성, 정책의 행동 정확성, 실제 셀의 안전성은 각각 다른 시험을 요구한다. 이 장에서 중요한 것은 Cosmos와 GR00T를 거대한 “피지컬 AI” 상자 하나로 그리지 않고, 어느 데이터가 어느 모델을 거쳐 어느 출시 게이트에 도달하는지 추적하는 일이다.

힘과 촉각은 아키텍처의 주변 장식이 아니다

구성 요소 지원할 수 있는 판단 그것만으로 입증하지 못하는 것 출시 기록과 최종 권한
순방향 세계 예측 후보 행동의 예상 장면 비교, 실패 가설 생성 실제 접촉력, 변형, 제품 손상 생성 설정과 실제 시험의 대응표; 안전 권한 없음
영상 기반 역동역학 관측 가능한 움직임에서 행동 표식 후보 추론 가려진 힘, 미세 미끄럼, 구동기 토크의 참값 원본 영상·추론 판본·센서 대조; 측정 궤적을 대체하지 않음
정책·행동 생성 다음 행동 유형이나 묶음 제안 현장 보정, 장기 불량률, 안전성 정책·데이터 판본과 재현 결과; 제어기 보호를 통과해야 함
힘·촉각 센서와 제어기 접촉 상태 측정과 빠른 보호 보정값 변화, 마모, 누락 뒤의 자동 신뢰성 보정·건강 검사·대체 제어 기록; 위험별 PLC·사람 권한 유지

힘이나 촉각 입력이 없는 시각언어행동 정책이 가려진 접촉 상태를 안정적으로 추론한다고 가정할 수 없다. 접촉력, 미끄럼, 순응 변형은 같은 RGB 장면에서도 달라질 수 있기 때문이다. ForceVLA는 실시간 6축 힘을 혼합 전문가 행동 디코더에 넣고, Tactile-VLA는 촉각 입력과 혼합 위치-힘 제어기를 결합한다 [16], [17]. ForceVLA2도 힘 프롬프트와 교차 규모 전문가를 폐루프 혼합 제어에 연결한다 [32]. 이 연구들이 보여주는 것은 물리 채널을 명시적으로 넣을 가치이지, 영상만으로 숨은 힘의 참값을 복구할 수 있다는 증거가 아니다. 또한 보고된 과제 수와 단일 플랫폼, 센서별 보정, 수명 평가 부재를 넘어 보편적 우위를 주장해서는 안 된다.

제조 조작에서는 힘·토크와 촉각 신호가 사후 고려가 되면 안 된다. Gemini Robotics와 GR00T 같은 범용 로봇 모델은 물리 과제 일반화를 전면에 세우고 [13], [14], ForceVLA와 Tactile-VLA는 힘 또는 촉각 관측을 VLA 계열에 직접 넣으려 한다 [16], [17]. Tactile-Language-Action 계열은 RGB가 약한 상황에서 촉각 토큰과 언어가 어떻게 만나는지도 보여준다 [18].

핵심은 센서 융합이 아니라 출시 책임이다. 촉각이 들어오면 보정 이동, 센서 교체, 젤 마모, 케이블 잡음, 문턱 불일치가 생긴다. 힘 인식 혼합 전문가가 힘을 쓰더라도, 과도한 힘을 막는 마지막 권한은 제어기 보호와 안전 PLC에 남아야 할 수 있다. 아키텍처 그림에는 모델 블록뿐 아니라 보정 작업, 센서 건강 검사, 대체 제어기가 같이 있어야 한다.

다중양식 정책의 평가도 성공률 하나로 끝낼 수 없다. 센서가 정상일 때와 일부 포화되었을 때, 영점이 틀어졌을 때, 교체 부품으로 바뀌었을 때를 나눠 시험해야 한다. 영상과 힘이 충돌할 때 어느 채널을 신뢰하는지, 촉각 프레임이 늦었을 때 오래된 접촉을 행동에 쓰는지, 센서가 끊기면 즉시 정지하는지 시나리오별로 기록한다. 다중양식은 관측 가능성을 높이지만, 동시에 보정과 동기화라는 새로운 실패 표면을 만든다.

제조 셀 적용 체크포인트

첫째, 아키텍처 후보마다 지연 예산을 쓴다. 인지 지연, 정책 추론, 행동 유지, 제어기 주기, 안전 정지 응답을 분리해 적는다. 둘째, 행동 표현을 과제 실패와 연결한다. 묶음이 걸림을 늦게 감지하는지, 확산 표본화가 작업 주기를 넘기는지, 토큰 행동이 경계 동작에서 거칠어지는지 재생 자료로 본다.

셋째, 센서 채널을 실패 유형에 맞춘다. 시각만으로 충분한 집어놓기와 힘·촉각이 필요한 삽입을 같은 아키텍처로 묶지 않는다. 넷째, 증거 등급을 분리한다. arXiv 논문은 방법론과 벤치마크 근거이고, 회사 개발자 문서는 제품 방향과 지원 기술의 근거다. 생산 준비도는 현장별 소규모 시험, 되돌리기, 유지보수 기록이 있어야 판단할 수 있다.

열린 문제와 실패 모드

큰 중추 모델은 공정 변수 누락을 자동으로 해결하지 않는다. 언어 지시가 있어도 로트, 지그 개정, 접착제 경과 시간, 도구 마모가 빠지면 셀별 실패는 남는다. 교차 로봇 사전학습은 행동 사전지식을 주지만 보정 불일치를 숨길 수 있다. 촉각·힘 채널은 접촉이 많은 작업을 열어주지만 센서 이동과 유지보수 부담을 새로 만든다. 마지막으로 공급자 묶음이 닫혀 있으면 제조사는 출시 관문을 독립적으로 감사하기 어렵다.

관측과 정책 실행을 안전 보호장치에 연결하는 아키텍처 게이트

그림 6.4. 관측과 정책 실행을 안전 보호장치에 연결하는 아키텍처 게이트. 이 도식은 성능 주장이 아니라, 능력 근거가 재현과 품질 판정을 거쳐 배포 권한으로 넘어가는 운영 책임 체인을 요약한다. 출처: 저자 제작 SVG.

다음에 배울 것

다음 장은 아키텍처에 넣을 데이터를 어디서 얻는지 묻는다. UMI, DexUMI, DEXOP, EgoScale은 사람 데이터의 규모를 키우지만, 몸체 차이와 힘 관측 가능성을 각각 다른 방식으로 처리한다. 좋은 정책 아키텍처도 잘못 변환된 사람 데이터 위에서는 제조 셀을 안정화하지 못한다.

참고문헌

  1. Zhao, Tony Z. (2023). Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. arXiv.
  2. Chi, Cheng (2023). Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. arXiv. #34
  3. O'Neill, Abby et al. (2024). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. ICRA.
  4. Brohan, Anthony (2022). RT-1: Robotics Transformer for Real-World Control at Scale. arXiv.
  5. Brohan, Anthony (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv.
  6. Kim, Moo Jin (2024). OpenVLA: An Open-Source Vision-Language-Action Model. arXiv.
  7. Octo Model Team (2024). Octo: An Open-Source Generalist Robot Policy. arXiv. #55
  8. Black, Kevin (2024). pi0: A Vision-Language-Action Flow Model for General Robot Control. arXiv. #2
  9. Physical Intelligence (2024). pi0: A Generalist Robot Policy. Company research post.
  10. Physical Intelligence (2025). OpenPI: Open Source Robot Policy Stack. GitHub.
  11. Pertsch, Karl (2025). FAST: Efficient Action Tokenization for Vision-Language-Action Models. arXiv.
  12. Shukor, Mustafa (2025). SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics. arXiv.
  13. Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv.
  14. Bjorck, Johan (2025). GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. arXiv.
  15. NVIDIA (2025). Isaac GR00T N1 Open Foundation Model for Humanoid Robots. NVIDIA Developer.
  16. Yu, Jiawen (2025). ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation. arXiv. #1
  17. Huang, Jialei (2025). Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization. arXiv.
  18. Hao, Peng (2025). TLA: Tactile-Language-Action Model for Contact-Rich Manipulation. arXiv.
  19. Khazatsky, Alexander (2024). DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset. arXiv.
  20. AgiBot-World-Contributors (2025). AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems. arXiv.
  21. Li, Xuanlin (2024). Evaluating Real-World Robot Manipulation Policies in Simulation. arXiv.
  22. Mandlekar, Ajay (2021). What Matters in Learning from Offline Human Demonstrations for Robot Manipulation. arXiv.
  23. Ha, Huy (2024). Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots. arXiv.
  24. Toyota Research Institute (2024). Large Behavior Models for Robot Manipulation. Company technical post.
  25. Ross, Stephane et al. (2011). A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. AISTATS.
  26. Finn, Chelsea and Levine, Sergey (2017). Deep Visual Foresight for Planning Robot Motion. ICRA.
  27. Wu, Philipp et al. (2023). DayDreamer: World Models for Physical Robot Learning. CoRL.
  28. Ye, Seonghyeon et al. (2026). World Action Models are Zero-shot Policies. arXiv.
  29. Aditi et al. (2026). Cosmos 3: Omnimodal World Models for Physical AI. arXiv.
  30. Bhide, Asawaree et al. (2026). Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3. NVIDIA Technical Blog.
  31. NVIDIA Developer (2026). How to Post-Train NVIDIA Cosmos 3 for Robot Action Prediction. Official tutorial video.
  32. Li, Yang et al. (2026). ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation. arXiv.
  33. NVIDIA (2026). Cosmos3-Super Model Card. Hugging Face.
  34. Scott Fujimoto et al. (2018). Addressing Function Approximation Error in Actor-Critic Methods. ICML 2018.
  35. Jonathan Ho et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020.
  36. Scott Reed et al. (2022). A Generalist Agent. Transactions on Machine Learning Research.
  37. Nur Muhammad Mahi Shafiullah et al. (2022). Behavior Transformers: Cloning k Modes with One Stone. NeurIPS.
  38. Mohit Shridhar et al. (2022). Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation. CoRL.
  39. Siddhant Haldar et al. (2024). BAKU: An Efficient Transformer for Multi-Task Policy Learning. NeurIPS 2024 / arXiv.
  40. Taowen Wang et al. (2024). Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics. Primary publication.