데모 영상 말고 수치로 — VLA·로봇 파운데이션 모델 2026 해부

2026-09-19 · 약 77분
VLA로봇 파운데이션 모델피지컬 AI온디바이스 추론모방학습로보틱스
RT-2 에서 π0·GR00T N1·SmolVLA 까지, 비전-언어-액션 모델이 액션을 뽑아내는 세 갈래 구조와 가장 비싼 병목인 데이터, 데모 몇 개·GPU 몇 장이 드는지의 파인튜닝 실무, 제어 주파수와 모델 지연이 부딪히는 온디바이스 추론, 성공률 숫자를 믿기 전에 볼 평가 설계, 조작 밖 내비게이션 모델, 그리고 작은 로봇 회사의 12개월 도입 판단까지 8개 섹션으로 정리했다.

VLA 지형도 — RT-2 에서 2026년까지

VLA 는 RT-2(2023)의 55B·1–3 Hz 이산 토큰 모델에서 출발해, 2026년 9월 현재 3~5B VLM 에 수백 M 액션 헤드를 붙여 50~200 Hz 로 액션을 내는 구조로 수렴했다. 최전선 모델(π0.7, Gemini Robotics 2, Helix 02)은 폐쇄이고, 손에 쥘 수 있는 오픈 가중치(π0.5, GR00T N1.7, SmolVLA)는 한두 세대 뒤를 따라온다.

핵심 요점

  • VLA 는 사전학습 VLM 에 액션 출력을 붙인 정책이며, 액션 표현은 RT-2·OpenVLA 의 256-bin 이산 토큰에서 π0 이후의 flow matching·diffusion 액션 청크로 넘어갔다.
  • 모델 크기는 RT-2 의 55B 에서 OpenVLA 7B 를 거쳐 π0 3.3B, GR00T N1.7 3B, π0.7 약 5B 로 줄었고, VLM 은 수~10 Hz 로 돌고 액션은 50~200 Hz 로 나가는 이중 주파수 구조가 표준이 됐다.
  • 공개된 추론 지연은 대부분 데스크톱·데이터센터 GPU 기준이다 — π0 73 ms 는 RTX 4090, GR00T N1.7 27.9 ms 는 H100+TensorRT 수치다.
  • 오픈 가중치라도 코드와 가중치의 라이선스가 다르다 — OpenVLA 는 Llama 2 Community License, openpi 는 Gemma 라이선스, GR00T N1.7 은 NVIDIA Open Model License 가 가중치에 적용된다.
  • 2026년의 변화는 상업 이용 가능한 오픈 가중치(GR00T N1.7), 전신 제어(Helix 02·Gemini Robotics 2), 사람 영상·자율 실행 데이터로의 데이터 출처 이동(π0.7·EgoScale 20,854시간)이다.
  • Google DeepMind 는 추론 모델(ER)은 API 로 열고 액션 모델(VLA)은 파트너에게만 주며, Physical Intelligence 는 π0.5 를 발표 5개월 뒤에 공개했지만 π0.7 은 가중치 공개 언급이 없다.

VLA 를 한 문장으로 — VLM 에 액션 출력을 붙인 정책

VLA(Vision-Language-Action)는 인터넷 규모로 사전학습된 VLM 을 백본으로 두고, 출력단에 로봇 액션을 붙여 end-to-end 로 미세조정한 정책(policy) 이다. 입력은 카메라 이미지·자연어 지시·(대개) 고유수용감각, 출력은 관절 또는 엔드이펙터 명령이다. 이 글의 수치는 2026-09-19 기준으로 논문·모델 카드·공식 저장소에서 직접 확인한 것만 적었고, 확인하지 못한 칸은 "미공개/미확인"으로 남겼다.

계보는 네 단계로 읽으면 된다.

  • LLM → VLM: 언어 모델에 비전 인코더(SigLIP, DINOv2 등)를 붙여 이미지 토큰을 같은 시퀀스에 넣는다.
  • 1세대 VLA — 이산 액션 토큰: RT-2 는 연속 액션을 차원당 256 bin 으로 양자화해 텍스트 토큰처럼 출력하게 했다. VLM 구조를 건드리지 않는다는 점이 핵심이었고 OpenVLA 도 같은 방식이다. 대가는 속도다(RT-2 55B 는 1–3 Hz).
  • 2세대 VLA — 연속 액션 헤드: π0 는 VLM 옆에 별도 action expert 를 두고 flow matching 으로 액션 청크(H=50) 를 한 번에 생성한다. GR00T N1·Helix 는 이를 느린 System 2(VLM)와 빠른 System 1(DiT·visuomotor)의 이중 주파수 구조로 굳혔다.
  • 2026년의 확장: 서브골 이미지를 그려 주는 월드 모델(π0.7), 1 kHz 전신 제어 신경망(Helix 02 의 System 0), 사람 1인칭 영상 2만 시간 사전학습(GR00T N1.7)처럼 VLA 바깥에 모듈이 붙는다.

실무에서 의미 있는 구분은 "VLA 냐 아니냐"가 아니라 액션 표현(이산 토큰 vs flow/diffusion 청크)과 추론 주파수가 내 로봇의 제어 루프와 맞느냐다.

연도별 타임라인

시기 모델·데이터셋 주체 무엇이 새로웠나
2022-12 RT-1 Google 로봇 13대·17개월, 130k+ 에피소드·700+ 태스크, 3 Hz 폐루프
2023-07 RT-2 Google DeepMind "VLA" 라는 말의 출발점. 6,000회 실기 평가
2023-10 Open X-Embodiment, RT-X 21개 기관 로봇 22종·527 스킬, 60개 데이터셋을 묶은 1M+ 궤적
2024 Octo (RSS 2024) UC Berkeley 등 27M/93M 확산 정책, MIT 로 공개된 generalist
2024-06 OpenVLA Stanford 등 7B 오픈 가중치로 55B RT-2-X 를 앞섬
2024-10 π0 Physical Intelligence flow matching action expert, 최대 50 Hz
2025-02 Helix Figure 온보드 GPU 에서 도는 이중 시스템, 35-DoF
2025-03 GR00T N1 / Gemini Robotics NVIDIA / Google DeepMind 오픈 휴머노이드 모델 / Gemini 2.0 기반 폐쇄 VLA + ER
2025-04 π0.5 Physical Intelligence 처음 보는 집에서의 일반화, 서브태스크를 언어로 먼저 추론
2025-06 SmolVLA / Gemini Robotics On-Device Hugging Face / Google DeepMind 450M 커뮤니티 데이터 VLA / 로컬 실행, 50–100 데모 미세조정
2025-09 Gemini Robotics 1.5, π0.5 가중치 공개 Google DeepMind / PI "행동 전에 생각", ER 1.5 는 Gemini API 로 공개
2025-11 GEN-0 / π*0.6 Generalist / PI 27만 시간 데이터 스케일링 / 실기 RL(Recap)
2025-12 GR00T N1.6 NVIDIA DiT 16→32층, 상태-상대(state-relative) 액션 청크
2026-01 Helix 02 Figure 1 kHz System 0(10M 파라미터)로 전신 자율
2026-02 Xiaomi-Robotics-0 Xiaomi 4.7B, Apache 2.0 로 가중치 공개
2026-04 π0.7 / GR00T N1.7 PI / NVIDIA 약 5B 범용 모델 / 3B, 상업 이용 가능한 오픈 가중치
2026-07 Gemini Robotics 2 (+ER 2, On-Device 2) Google DeepMind 발끝부터 손끝까지 전신 제어 VLA

모델 스펙 비교표

모델 파라미터 제어·추론 주파수 학습 데이터 가중치·라이선스
RT-2 5B / 12B / 55B 55B 1–3 Hz, 5B 약 5 Hz (멀티 TPU 클라우드 서빙) RT-1 로봇 데이터 + 웹 VL 데이터 비공개
Octo 27M / 93M RTX 4090 에서 17 / 13 it/s OXE 800k 에피소드 공개, MIT
OpenVLA 7B RTX 4090 bf16 약 6 Hz, 15 GB(4-bit 7 GB) OXE 970k 데모, A100 64장×14일(21,500 GPU시간) 코드 MIT, 가중치는 Llama 2 Community License 승계
π0 3.3B (action expert 300M 포함) 최대 50 Hz, 청크 H=50, RTX 4090 추론 73 ms 약 10,000시간·로봇 구성 7종·68 태스크 (오픈 데이터 비중 9.1%) openpi: 코드 Apache-2.0, 가중치엔 Gemma 라이선스 별도
GR00T N1 2.2B (VLM 1.34B) S2 10 Hz / S1 120 Hz, 16-액션 청크 63.9 ms(L40) 실기 텔레옵 88 h + neural trajectory 827 h + 시뮬 6,500 h 상당, H100 약 5만 GPU시간 공개
Helix S2 7B + S1 80M 7–9 Hz / 200 Hz 텔레옵 약 500 h 비공개
SmolVLA 450M (action expert 약 100M) 비동기 추론으로 응답 30%↑·처리량 2× 커뮤니티 데이터셋 487개·약 1,000만 프레임(3만 에피소드 미만) 공개, Apache-2.0
Xiaomi-Robotics-0 4.7B README 에서 미확인 미공개 공개, Apache 2.0
GR00T N1.7 3B (Cosmos-Reason2-2B 백본) H100+TensorRT 27.9 ms(35.9 Hz), PyTorch eager 85.8 ms(11.7 Hz) EgoScale 사람 1인칭 영상 20,854 h + 로봇·시뮬 코드 Apache 2.0, 가중치 NVIDIA Open Model License(상업 이용 가능)
π0.7 약 5B (Gemma3 4B VLM + action expert 860M) 50 Hz(UR5e 는 20 Hz), 50스텝 청크 중 15/25스텝 실행 다기종 로봇·사람 데이터·자율 실행 에피소드(실패 포함) 가중치 공개 언급 없음
Gemini Robotics 2 / On-Device 2 미공개 미공개 미공개 early-access 파트너 / Trusted Tester 한정

표에서 바로 읽히는 것 세 가지.

  1. 파라미터는 작아졌다. 55B(RT-2) → 7B(OpenVLA) → 2~5B 대(π0, GR00T, π0.7). 2026년의 주류는 "3~5B VLM + 수백 M 액션 헤드"다.
  2. 주파수는 두 종류다. VLM 이 도는 속도(수 Hz~10 Hz)와 액션이 나가는 속도(50~200 Hz)를 구분해서 읽어야 한다. 청크를 길게 뽑아 나눠 실행하기 때문에 "50 Hz 제어"가 "50 Hz 추론"을 뜻하지 않는다.
  3. 벤더가 적은 지연은 대부분 데스크톱·데이터센터 GPU 기준이다. π0 의 73 ms 는 RTX 4090, GR00T N1.7 의 27.9 ms 는 H100+TensorRT 수치다. 엣지 보드 수치는 따로 확인해야 한다.

오픈 가중치 vs 폐쇄 — 실제로는 세 부류

  • 완전 폐쇄(제품 내장형): Helix/Helix 02, Gemini Robotics 2 VLA, GEN-0, π0.6·π0.7. 논문·블로그 수치는 있지만 재현할 수단이 없다.
  • 접근 제한형: Gemini Robotics-ER 은 API 로 열려 있고(ER 1.5 는 Gemini API, ER 2 는 Google AI Studio), On-Device 2 는 Trusted Tester 에게만 배포된다. 즉 추론(ER)은 팔고 액션(VLA)은 파트너에게만 준다.
  • 오픈 가중치: Octo, OpenVLA, π0/π0-FAST/π0.5(openpi), SmolVLA, GR00T N1~N1.7, Xiaomi-Robotics-0.

"오픈"이라도 코드 라이선스와 가중치 라이선스는 따로 읽어야 한다. OpenVLA 는 코드가 MIT 지만 가중치는 Llama 2 Community License 를 승계하고, openpi 는 Apache-2.0 코드에 Gemma 라이선스 파일이 별도로 붙으며, GR00T N1.7 은 Apache 2.0 코드 + NVIDIA Open Model License 가중치다. 2차 기사들이 "GR00T 는 Apache 2.0"이라고 뭉뚱그리는 경우가 있는데 모델 카드 기준으로는 그렇지 않다.

Physical Intelligence 의 공개 패턴도 기억해 둘 만하다. π0.5 는 2025-04 에 발표되고 2025-09 에 openpi 로 가중치가 나왔다. π0.7(2026-04)은 논문에 가중치 공개 언급이 없다. 오픈으로 손에 쥘 수 있는 것은 최전선보다 한두 세대 뒤라고 보고 계획을 세우는 편이 안전하다.

플레이어 지도

  • Google DeepMind — RT 계열의 원조. 2025-03 이후 Gemini 기반 폐쇄 노선. Gemini Robotics 2 발표 글이 공개한 정량치는 Apollo 2 + 22-DoF 5지 핸드의 전구 돌려 빼기 92% 정도다.
  • Physical Intelligence — flow matching action expert 를 사실상의 표준으로 만들었다. π*0.6 에서 실기 RL(Recap)로 처리량을 2배 이상 올렸고, π0.7 은 서브골 이미지를 14B 월드 모델(BAGEL 초기화)로 생성한다.
  • NVIDIA — 모델은 열고 GPU·Jetson·Isaac 시뮬을 파는 구조. N1(2025-03) 이후 N1.5·N1.6·N1.7(2026-04)까지 1년 남짓에 세 번 개정했다. N1.7 은 사람 영상을 1k→20k 시간으로 늘리면 평균 과제 완수율이 2배 이상 오른다는 스케일링 결과를 내세운다.
  • Figure — 수직 통합. Helix 02 는 System 0(1 kHz)이 수작업 C++ 109,504줄을 대체했다고 밝혔다. 외부에서 쓸 수 있는 것은 없다.
  • Hugging Face — LeRobot(Apache-2.0)이 오픈 진영의 허브다. 저장소 기준 Pi0, Pi0Fast, Pi0.5, GR00T N1.7, SmolVLA, XVLA, EO-1, MolmoAct2, WALL-OSS, EVO1 을 한 프레임워크에서 학습·평가한다.
  • 데이터 스케일 진영(Generalist) — GEN-0 는 실기 조작 데이터 27만 시간(주당 1만 시간 증가)을 내세우고, 7B 이상에서야 대규모 사전학습이 하류 과제로 전이된다고 보고했다.
  • 중국 오픈 진영(Xiaomi 등) — Xiaomi-Robotics-0 는 LIBERO 평균 98.7%, CALVIN ABC→D 4.75 를 README 에 적었다. 시뮬 벤치마크가 포화 구간이라는 신호이기도 하다.

2026년에 실제로 바뀐 것

  1. 상업 이용 가능한 오픈 가중치가 생겼다. GR00T N1.7 모델 카드는 상업·비상업 배포 모두 가능하다고 명시한다. 스타트업이 "오픈 모델 미세조정 → 제품 탑재"를 법무 검토 가능한 경로로 갖게 됐다.
  2. 조작에서 전신으로. Helix 02, Gemini Robotics 2, GR00T N1.6(Unitree G1 전신 loco-manipulation 데이터 추가)이 모두 같은 방향이다.
  3. 데이터의 출처가 바뀐다. 텔레옵 시연만으로는 부족하다는 합의 아래 사람 1인칭 영상(N1.7), 실패를 포함한 자율 실행 데이터(π0.7), 실기 RL(π*0.6)이 들어왔다.
  4. 온디바이스는 아직 제한적이다. On-Device 2 모델 카드는 새 로봇 적응 성능(SO101 6.7%→53.3%, Dexmate 33.3%→75.6%)을 보이면서도 분포 밖 과제와 고자유도 로봇 제어에 한계가 있다고 스스로 적었다.

이 지형도를 쓰는 체크리스트

  • 후보 모델마다 가중치 라이선스 원문(코드 라이선스 아님)을 확인했는가.
  • 공개된 지연·Hz 가 어떤 GPU·어떤 런타임(TensorRT/eager) 기준인지 적어 두었는가.
  • 사전학습 데이터에 내 로봇과 비슷한 embodiment 가 있는가(단일 팔·양팔·모바일·휴머노이드).
  • 최신 폐쇄 모델의 데모가 아니라 지금 내려받을 수 있는 세대(π0.5, GR00T N1.7, SmolVLA, OpenVLA 계열)로 PoC 를 설계했는가.
  • LIBERO·CALVIN 점수로 고르지 않았는가 — 공개 모델이 LIBERO 98.7% 를 적는 구간이라 변별력이 없다. 자기 과제를 반복 실기 평가한 성공률이 판정 기준이다.

구조 해부 — 액션을 어떻게 뽑아내는가

VLA가 액션을 뽑는 방식은 이산 토큰 자기회귀, 연속 액션 헤드(diffusion·flow matching), 듀얼 시스템 세 갈래로 나뉘며, 2026년 현재는 '학습은 FAST 이산 토큰, 추론은 flow matching'으로 수렴하는 중이다. 논문·모델 카드·공식 저장소에 적힌 파라미터 수, 추론 지연, 청크 길이, 라이선스를 표로 나란히 놓고 어떤 조건에서 무엇을 골라야 하는지 기준을 제시한다.

핵심 요점

  • 단순 256-bin 토큰화는 제어 주파수가 높아질수록 다음 토큰의 정보량이 0에 수렴해 학습이 무너지며, FAST는 DCT+BPE로 50Hz 1초 청크를 700토큰에서 53토큰으로 압축해 이를 해결하지만 추론은 약 750ms로 flow matching π0(약 100ms)보다 느리다.
  • π0는 PaliGemma 3B에 300M action expert를 붙인 3.3B 모델로 RTX 4090에서 50스텝 청크를 73ms에 생성하고, 후속 π0.6은 Gemma3 4B + 860M expert로 H100에서 63ms를 기록한다.
  • 무작위 초기화된 action expert의 그래디언트는 사전학습 VLM을 훼손하므로, 백본은 FAST 이산 토큰으로 지도하고 expert 그래디언트를 차단하는 knowledge insulation이 필요하며 백본 동결은 여러 과제에서 0%로 실패했다.
  • GR00T N1은 10Hz VLM과 120Hz DiT를 end-to-end로 묶고 Helix는 7–9Hz 7B와 200Hz 80M을 잠재 벡터 하나로 비동기 연결하는데, Helix 수치는 회사 블로그 외에 검증 가능한 출처가 없다.
  • GR00T N1.7 공식 벤치마크에서 3B 모델은 TensorRT 기준 Jetson AGX Thor 12.4Hz, Orin 6.6Hz에 그치고 Thor에서는 백본(26.2ms)보다 액션 헤드(46.9ms)가 더 무겁다.
  • OpenVLA 실험에서 SigLIP+DINOv2 융합 인코더는 LLaVA 백본 대비 절대 성공률이 약 10%p 높았고, 비전 인코더 미세조정이 결정적이었으며 해상도를 224에서 384로 올려도 성능 이득 없이 학습 시간만 3배였다.

분류 기준: 액션이 어디서, 어떤 분포로 나오는가

VLA 구조 논쟁은 한 질문으로 줄어든다. VLM이 만든 표현을 어떻게 모터 명령 수열로 바꾸는가. 2026년 9월 기준 공개 자료로 확인되는 갈래는 셋이다. ① 액션을 어휘에 넣어 다음 토큰 예측으로 뽑는다, ② VLM 옆에 연속값 생성 헤드(diffusion·flow matching)를 붙인다, ③ 느린 VLM과 빠른 정책을 서로 다른 주기로 돌린다. 아래 수치는 모두 논문·모델 카드·공식 저장소에 적힌 값이며, 측정 하드웨어가 제각각이라 행 간 직접 비교는 안 된다.

① 이산 액션 토큰 자기회귀 — RT-2, OpenVLA

  • RT-2(arXiv 2307.15818)는 종료 플래그를 뺀 각 액션 차원을 256개 구간으로 균등 분할해 1 128 91 241 5 101 127 같은 문자열로 출력한다. 55B는 1–3Hz, 5B는 약 5Hz였고, 온보드가 아니라 멀티 TPU 클라우드를 네트워크로 질의하는 구성이었다.
  • OpenVLA는 이를 7B로 내렸다. Llama 2 + 600M 비전 인코더(SigLIP·DINOv2 융합), 차원별 256 bin(1~99 분위), Llama 토크나이저에서 가장 덜 쓰이는 토큰 256개를 액션으로 덮어쓴다. 970k 에피소드를 A100 64장으로 14일(21,500 A100-시간) 학습했고, RTX 4090 bfloat16에서 약 6Hz·15GB, 4bit 양자화로 7.0GB까지 줄여도 성공률이 유지됐다(71.9±4.7%). 논문이 직접 밝힌 한계는 단일 이미지 입력, 그리고 50Hz로 도는 ALOHA급 제어에는 처리량이 모자란다는 점이다.

왜 고주파에서 무너지는가. FAST 논문의 설명: 부드러운 신호는 제어 주기가 짧아질수록 스텝 간 변화가 줄어 다음 토큰의 한계 정보량이 0에 수렴한다. 모델은 "직전 토큰 복사"만 배운다.

FAST 토크나이저는 이를 압축 문제로 푼다. 분위 정규화 → 차원별 DCT → 스케일 후 반올림 → 저주파 우선 평탄화 → BPE(어휘 1024).

데이터(1초 청크) 제어 주파수 단순 binning FAST 압축
BridgeV2 5Hz 35토큰 20 1.75×
DROID 15Hz 105 29 3.6×
티셔츠 접기 50Hz 700 53 13.2×

π0-FAST는 10k 시간 규모에서 diffusion π0와 동급 성능을 내면서 학습 연산을 5배 줄였다. 대가는 추론이다. RTX 4090에서 1초 청크 생성에 π0가 약 100ms(10스텝)인 반면, π0-FAST는 30–60토큰을 순차 디코딩해 약 750ms가 든다.

또 하나의 탈출구, 병렬 디코딩. OpenVLA-OFT는 자기회귀를 버리고 청크 전체를 순전파 한 번에 L1 회귀한다. LIBERO 평균 성공률 76.5%→97.1%, 처리량 4.2Hz→108.8Hz(청크 8, 지연 0.0735초), ALOHA에서는 청크 25로 77.9Hz(지연 0.321초). 같은 실험에서 L1 회귀와 diffusion 헤드는 성능이 비슷했고 L1 쪽이 수렴·추론 모두 빨랐다.

② 연속 액션 헤드 — Diffusion Policy에서 π0 계보까지

뼈대는 두 선행 연구다.

  • ACT(arXiv 2304.13705): 50Hz 제어에서 100스텝 청크를 예측해 유효 호라이즌을 k배 줄인다. 절제 실험에서 k=1일 때 1%이던 성공률이 k=100에서 44%가 됐다. 겹치는 예측은 w_i = exp(-m·i) 가중 평균(temporal ensembling)으로 합친다. 약 80M, 추론 0.01초.
  • Diffusion Policy(arXiv 2303.04137): 같은 상황에 정답 궤적이 여럿인 다봉 분포를 조건부 디노이징으로 다뤄 4개 벤치마크 12개 과제에서 평균 46.9% 개선. receding horizon 실행이 핵심 구성요소다.

Octo(27M/93M, OXE 25개 데이터셋 800k 궤적)는 트랜스포머 readout 토큰 위에 3층 MLP diffusion 헤드(20스텝)를 올렸다. 헤드만 바꾼 절제 실험 결과는 diffusion 83% / MSE 35% / 이산화 18%.

π0는 이를 VLM 규모로 올렸다. PaliGemma 3B에 300M action expert를 새로 붙여 총 3.3B, flow matching으로 H=50 청크를 10회 적분해 만든다. RTX 4090 온보드 추론은 이미지 인코더 14ms + 관측 순전파 32ms + 액션 순전파(×10) 27ms = 73ms. 관측은 한 번만 계산하고 작은 expert만 반복하므로 스텝 수가 비용을 지배하지 않는다. 사전학습 10,000시간 이상, 최대 50Hz 제어.

학습 안정성의 함정 — knowledge insulation. 무작위 초기화된 action expert의 그래디언트가 사전학습 VLM을 훼손해 학습 속도와 언어 추종이 함께 떨어진다. 처방은 세 가지를 동시에 거는 것이다: 백본은 FAST 이산 토큰으로 지도, VLM 데이터 co-training, expert→백본 stop-gradient. 테이블 정리 과제에서 π0는 같은 성능까지 7.5배 많은 스텝이 필요했고, 백본을 통째로 얼리면 여러 과제에서 0%였다. 결국 ①과 ②는 경쟁하다가 **"학습은 이산, 추론은 연속"**으로 합쳐졌다.

이 조합이 현행 표준이다. π0.6 모델 카드(2025-11-17)는 Gemma3 4B + 860M expert, 448×448 이미지 최대 4장, 디노이징 5스텝·카메라 3대 기준 H100 1장에서 63ms를 적는다. π0.7(arXiv 2604.15483, 2026-04-16)은 총 약 5B에 50스텝 청크·5스텝 디노이징을 유지하고, 학습 때 0~12스텝 지연(50Hz에서 최대 240ms)을 모사한다.

청크 경계 문제. 추론이 제어 주기보다 길면 청크 교체 시점에 멈칫하거나 튄다. Real-Time Chunking(arXiv 2506.07339)은 추론 도중 어차피 실행될 앞부분 액션을 고정하고 나머지를 inpainting해 비동기로 잇는다. diffusion·flow 기반 VLA에 재학습 없이 붙는다.

③ 듀얼 시스템 — GR00T N1, Helix

System 2 (느림) System 1 (빠름) 결합 방식
GR00T N1 (2025-03, 2.2B) Eagle-2 VLM 1.34B(SigLIP-2 + SmolLM2), L40에서 10Hz DiT flow matching, K=4, H=16, 120Hz 폐루프 LLM 12번째 층 임베딩에 cross-attention, end-to-end 공동 학습
Helix (2025-02) 7B 오픈웨이트 VLM, 7–9Hz 80M 인코더-디코더 트랜스포머, 200Hz, 35-DoF 연속 잠재 벡터 1개, 전용 GPU 2개에서 비동기 실행

GR00T N1은 액션 16개 샘플링에 L40에서 63.9ms, 사전학습에 약 50,000 H100 시간을 썼다. 마지막 층보다 중간 층 임베딩이 더 빠르고 성공률도 높았다는 보고는 그대로 가져다 쓸 설계 힌트다. Helix는 약 500시간 텔레옵 데이터를 표준 회귀 손실로 end-to-end 학습하고, 배포 시 S1·S2 추론 지연 차이만큼의 시간 오프셋을 학습 입력에 미리 넣는다. Helix 02(2026-01-27)는 그 아래에 1kHz·10M 파라미터 전신 제어기 S0를 추가해 109,504줄의 수작업 C++를 대체했다고 밝힌다. 다만 Helix 수치는 회사 기술 블로그가 유일한 출처이고 가중치·논문·제3자 재현이 없다.

최신 공개판 GR00T N1.7(3B, 2026-04)은 백본을 Cosmos-Reason2-2B(Qwen3-VL 구조)로 바꾸고 DiT를 32→16층, action horizon을 16→40으로 조정했으며, 상대 EEF 액션 공간으로 인간 1인칭 영상 20K 시간을 사전학습에 넣었다. 공식 저장소 벤치마크(디노이징 4스텝, 카메라 1대, E2E):

하드웨어 PyTorch Eager TensorRT 전체 파이프라인
H100 85.8ms (11.7Hz) 27.9ms (35.9Hz)
Jetson AGX Thor 112.8ms (8.9Hz) 80.4ms (12.4Hz)
Jetson Orin 354.0ms (2.8Hz) 150.9ms (6.6Hz)

Thor TensorRT 기준 백본 26.2ms, 액션 헤드 46.9ms로 헤드가 더 무겁다. "VLM만 줄이면 된다"는 가정은 엣지에서 틀린다. 또 이 표의 Hz는 추론 호출 빈도이지 제어 주파수가 아니다. 120Hz·200Hz는 청크를 풀어 실행하는 하위 루프의 값이다.

비전 인코더: SigLIP 단독인가, DINOv2 융합인가

  • OpenVLA의 백본 비교에서 SigLIP+DINOv2 융합(Prismatic)은 LLaVA 대비 절대 성공률이 약 10%p 높았다. 저자들은 DINOv2의 저수준 공간 정보와 SigLIP의 고수준 의미가 결합된 효과로 본다. 비전 인코더를 얼리지 않고 미세조정하는 것이 결정적이었고, 224px와 384px는 성능 차이 없이 학습 시간만 3배였다.
  • π0 계열은 SigLIP(400M) 단독이다. GR00T N1은 SigLIP-2로 224×224를 프레임당 64토큰으로 줄이고, SmolVLA(450M)도 프레임당 64토큰에 LLM 앞쪽 16개 층만 쓴다. Helix S1은 시뮬레이션에서 사전학습한 완전 합성곱 멀티스케일 백본을 따로 둔다.
  • 판단 기준: 융합 인코더는 공간 정밀도를 사는 대신 토큰 수와 인코딩 시간이 는다. 카메라가 3대 이상이면 프레임당 토큰 예산부터 정하라. 손목 카메라로 근접 공간 정보를 보강할 수 있다면 SigLIP 단독 + 토큰 축소가 지연 면에서 유리하다.

트레이드오프 요약

축 ① 이산 토큰 AR ② 연속 헤드(flow/diffusion) ③ 듀얼 시스템
지연 토큰 수에 비례. OpenVLA 6Hz, π0-FAST 1초 청크 ~750ms expert만 반복. π0 73ms(4090), π0.6 63ms(H100) S2가 7–10Hz여도 S1이 고주파 폐루프 유지
정밀도 256 bin 양자화 오차, 고주파에서 학습 신호 소실(FAST로 완화) 연속값·다봉 분포 표현, 50Hz 양손 조작 S1 용량이 작아 S2 잠재 표현 품질에 의존
학습 안정성 표준 CE 손실, VLM 지식 보존 쉬움, π0 대비 연산 1/5 새 expert 그래디언트가 백본 훼손 → knowledge insulation 필요 두 주기의 지연 차이를 학습에서 모사해야 함
운영 복잡도 낮음(LLM 서빙 스택 재사용) 중간(청크 경계 처리) 높음(프로세스 2개, 동기화, 장애 모드 증가)

모델 스펙 한눈에

모델 파라미터 액션 방식 청크·주파수 학습 데이터 라이선스
RT-2 5B/12B/55B 256-bin 토큰 1–3Hz(55B), ~5Hz(5B) — 비공개
OpenVLA 7B 256-bin 토큰 청크 없음, 6Hz@4090 970k 에피소드 MIT
Octo 27M/93M diffusion 헤드 청크, 20스텝 800k 궤적 MIT
π0 / π0-FAST 3.3B flow / FAST 토큰 H=50, 최대 50Hz 10,000시간+ Apache-2.0(openpi)
SmolVLA 450M flow expert(~100M) 청크 50, 10스텝 30k 에피소드 미만 Apache-2.0
GR00T N1 → N1.7 2.2B → 3B DiT flow matching H=16 → 40 N1.7: 인간 영상 20K시간 포함 코드 Apache-2.0, 가중치 NVIDIA Open Model License
Helix 7B + 80M S1 회귀 출력 200Hz, 35-DoF ~500시간 비공개

선택 체크리스트

  1. 제어 10Hz 이하·단일 팔 그리퍼라면 ①로 충분하다. OpenVLA에 OFT식 병렬 디코딩을 얹는 것이 가장 싸다.
  2. 30Hz 이상·양손·접촉이 많은 과제는 ②. 청크 길이는 "추론 지연 × 제어 주파수"보다 넉넉히 잡고, 경계 처리(RTC류)를 전제로 설계한다.
  3. 온보드가 Orin급이면 공개 수치상 3B 모델도 TensorRT로 6.6Hz다. 청크 실행 + 하위 고주파 루프, 즉 ③의 구조가 사실상 강제된다.
  4. VLM 백본을 미세조정한다면 knowledge insulation(이산 토큰 보조 손실 + stop-gradient)을 기본값으로 둔다. 백본 동결은 대안이 아니다.
  5. 벤더 수치에 GPU 기종, 디노이징 스텝 수, 카메라 대수, Eager/TensorRT 여부 네 가지가 빠져 있으면 숫자로 취급하지 않는다.

데이터 — 가장 비싼 병목

공개 로봇 데이터셋은 100만 궤적 규모까지 커졌지만 정렬·주파수·라이선스 한계 때문에 그대로 쓸 수 있는 양은 훨씬 적고, 상위 VLA의 학습 혼합에서 공개 데이터 비중은 10% 미만이다. 2026년 9월 기준 공개 근거는 시연 개수보다 환경·물체 다양성이 스케일링의 축이며, 합성 데이터와 인간 1인칭 비디오는 타깃 로봇 데이터를 대체하는 것이 아니라 증폭한다는 쪽을 가리킨다.

핵심 요점

  • π0는 10,000시간 이상의 로봇 데이터로 사전학습했고 그 혼합에서 OXE·Bridge v2·DROID 등 공개 데이터 비중은 9.1%에 불과해, 공개 데이터만으로는 상위 모델의 데이터 분포를 재현할 수 없다.
  • Open X-Embodiment는 액션을 7차원 엔드이펙터 벡터로 거칠게 맞췄을 뿐 좌표계를 통일하지 않았고 pick-place에 편중돼 있어, Octo(25개 데이터셋)와 OpenVLA(97만 시연)처럼 큐레이션해서 써야 한다.
  • Cross-embodiment 전이는 소량 데이터 영역과 환경·의미 일반화에서는 확인되지만, OXE 논문은 새 로봇 일반화를 다루지 않았고 CrossFormer는 유의한 양의 전이가 아직 없다고 명시했으므로 타깃 로봇 데이터 예산은 0이 되지 않는다.
  • NVIDIA는 78만 합성 궤적(6,500시간 상당)을 11시간에 생성해 실데이터 단독 대비 40% 향상을 보고했지만, 모든 합성 파이프라인은 시드가 되는 사람 시연을 요구하고 neural trajectory는 약 10.5만 L40 GPU시간이 들었다.
  • EgoScale은 인간 1인칭 비디오 20,854시간에서 log-linear 스케일링을, Physical Intelligence는 인간 영상 공동학습으로 약 2배 향상을 보고했으며 두 결과 모두 정렬용 로봇 데이터와 충분한 사전학습 규모를 전제로 한다.
  • Lin et al.의 실기 실험에 따르면 환경-물체 쌍당 약 50개 시연 이후에는 이득이 미미하고 쌍의 수가 일반화를 결정하므로, 자체 수집은 같은 장면의 반복이 아니라 장소·물체 다양성에 예산을 배분해야 한다.

구조는 수렴했고, 일정은 데이터가 정한다

2026년 9월 기준 공개 VLA의 구조는 "VLM 백본 + flow matching/diffusion 액션 헤드"로 거의 수렴했다. 격차는 데이터에서 난다. π0는 10,000시간 이상의 로봇 데이터(7개 로봇 구성, 68개 태스크)로 사전학습했는데, 그 혼합에서 OXE·Bridge v2·DROID 같은 공개 데이터의 비중은 **9.1%**뿐이다(arXiv 2410.24164). 공개 데이터만으로는 상위 모델의 데이터 분포를 재현할 수 없다는 뜻이다. 그래서 질문은 "무엇을 공짜로 쓰고, 무엇을 직접 모아야 하는가"로 바뀐다.

공개 데이터셋: 규모와 한계

데이터셋 규모(출처 표기) 로봇·수집 방식 라이선스
Open X-Embodiment (2023-10) 100만+ 궤적, 기존 데이터셋 60개 풀링, 22 embodiment, 527 스킬, 160,266 태스크 21개 기관, RLDS 포맷 저장소 자료 CC-BY 4.0, 코드 Apache 2.0. 개별 데이터셋은 각자 라이선스
DROID (2024-03) 76k 궤적·350시간, 564 장면, 태스크 84(논문 초록)~86(프로젝트 페이지) Franka Panda 7-DoF, Quest 2 텔레옵, ZED 스테레오 3대 데이터셋 페이지에서 직접 확인 필요
BridgeData V2 60,096 궤적(텔레옵 50,365 + 스크립트 9,731), 24 환경, 13 스킬 WidowX 250, 5 Hz, 640×480 CC BY 4.0
AgiBot World Beta (2025-03) 1,003,672 궤적, 217 태스크, 로봇 100대 5개 도메인 실환경 복제 CC BY-NC-SA 4.0(비상업)

숫자만 보면 넉넉하지만 그대로 쓸 수 있는 양은 훨씬 적다.

  • OXE는 정렬되지 않은 합집합이다. 액션을 7차원 엔드이펙터 벡터(x, y, z, roll, pitch, yaw, gripper)로 "거칠게" 맞췄을 뿐 좌표계는 통일하지 않아, 데이터셋마다 절대/상대 위치가 섞여 있다. 스킬 대부분은 pick-place 계열이다. 그래서 Octo는 60개 중 25개(80만 에피소드), OpenVLA는 97만 시연만 골라 썼다. OXE를 쓴다는 것은 곧 큐레이션 코드를 쓴다는 뜻이다.
  • DROID는 다양하지만 짧다. 76k 궤적·350시간을 역산하면 궤적당 평균 약 16.6초다. 공개 후에도 2024-12 언어 주석 재배포(성공 에피소드의 95%, 75k개에 3개씩), 2025-04 카메라 캘리브레이션 보정(36k 에피소드)이 이어졌다. 데이터셋은 공개 뒤에도 1년 넘게 보수가 필요한 자산이다.
  • BridgeData V2는 저주파다. 5 Hz, 평균 38스텝(약 7.6초)이라 20~50 Hz 액션 청크 정책의 정밀 제어를 학습시키기엔 해상도가 부족하다.
  • AgiBot World는 비상업 라이선스라 제품 학습에 쓰기 전에 법무 검토가 먼저다.

모델별 학습 데이터(공개 수치만)

모델 파라미터 제어 주파수 학습 데이터
RT-1 (2022) – – 13대·17개월, 130k+ 에피소드, 700+ 태스크
Octo 27M / 93M – OXE 25개 데이터셋, 80만 에피소드
OpenVLA 7B – 97만 실로봇 시연
π0 (2024-10) 3.3B(VLM 3B + 액션 전문가 300M) 20 Hz(UR5e·Franka) / 50 Hz, 청크 H=50 10,000시간+, 자체 9.03억 스텝
π0.5 (2025-04) – 50스텝(1초) 청크 모바일 매니퓰레이터 약 400시간·약 100개 가정. 1단계 학습 예제의 97.6%는 그 밖의 소스
GR00T N1 (2025-03) 2.2B(VLM 1.34B) System 1 120 Hz / System 2 10 Hz 실기 텔레옵 88시간 + neural trajectory 827시간 + 시뮬 78만 궤적(6,500시간) + 인간 비디오, 사전학습 약 5만 H100 GPU시간
GR00T N1.7 (2026-04-17, EA) 3B – 인간 1인칭 비디오 20,854시간 포함. "open, commercially licensed"

텔레오퍼레이션 비용: 공개 수치로 역산하기

단가를 공개한 곳은 거의 없지만 투입량은 공개돼 있다.

  • RT-1: 로봇 13대 × 17개월에 130k 에피소드 → 로봇 1대·월당 약 590 에피소드.
  • DROID: 13개 기관, 수집자 50명, 12개월에 350시간. 다기관 컨소시엄이 1년을 써도 "수백 시간" 단위라는 사례다.
  • NVIDIA 개발자 블로그: 사람이 고품질 시연 1건을 만드는 데 약 1분. 78만 궤적은 사람 시연 6,500시간, 연속 9개월 분량에 해당한다.
  • Lin et al.(arXiv 2410.18647): 로봇 없이 UMI 핸드헬드 그리퍼로 4명이 한나절 수집해 두 태스크에서 약 90% 성공률.

계획 단계에서는 아래처럼 환산해 본다(산식은 계획용 가정이며 출처 수치가 아니다).

필요 인시 = 목표 에피소드 × (시연 + 리셋 + 검수 시간) ÷ (장비 가동률 × 채택률)
예) 5,000개 × 150초 ÷ (0.7 × 0.8) ≈ 372 인시 ≈ 2인 × 약 5주

리셋과 검수가 시연보다 길어지는 경우가 흔하므로, 텔레옵 장비보다 리셋 자동화와 실패 에피소드 자동 태깅에 먼저 투자하는 편이 단가를 크게 낮춘다.

Cross-embodiment 전이: 실제로 되는 범위

되는 것

  • 소량 데이터 영역의 보강: RT-1-X는 데이터가 적은 도메인에서 개별 데이터셋 학습 대비 성공률 50% 향상. RT-2-X(55B)는 emergent skill 평가에서 RT-2의 3배.
  • 환경·의미 일반화: π0.5는 다중 환경(ME)·타 로봇(CE) 데이터 중 어느 하나만 빼도 성능이 유의하게 하락했고, 웹 데이터를 빼면 분포 밖 물체에서 나빠졌다.
  • 데이터 품질이 규모를 이긴다: AgiBot World로 학습한 정책은 OXE 학습 대비 평균 30% 높았다.

안 되는 것

  • OXE 논문 스스로 한계를 적었다. 센서·구동 방식이 크게 다른 로봇은 다루지 않았고, 새 로봇으로의 일반화도, 양의 전이가 언제 일어나는지의 판단 기준도 제시하지 않았다. RT-1-X는 데이터가 풍부한 도메인에서는 단일 로봇 기준선을 넘지 못했다. 전이는 용량이 큰 모델에서만 나타난다.
  • CrossFormer(90만 궤적, 20 embodiment; 팔·바퀴·쿼드콥터·4족)는 전문 정책과 "동급"을 달성했지만, 저자들은 "유의한 양의 전이는 아직 보이지 않았다"고 명시했다.
  • π0.7(2026-04, arXiv 2604.15483)이 zero-shot cross-embodiment를 보고했으나, 비공개 대규모 데이터 위의 결과다.

판단 기준: 같은 형태 계열(단일 팔 + 평행 그리퍼, EE 델타 액션)에 소량 데이터라면 사전학습 모델의 이득이 확실하다. 그래도 타깃 로봇 데이터는 0이 되지 않는다. Octo의 미세조정 평가도 타깃당 약 100개 시연을 썼다. 손가락 수·액션 공간·카메라 배치가 다르면 "전이"가 아니라 "재수집 + 미세조정" 예산으로 잡아야 한다.

합성·시뮬 데이터: 곱셈기이지 원천이 아니다

  • MimicGen: 약 200개 사람 시연에서 18개 태스크, 5만 개 이상 시연 생성.
  • GR00T-Mimic 블루프린트: GR00T-Teleop(Apple Vision Pro로 Isaac Lab 시뮬 원격조작) → GR00T-Mimic(궤적 증식) → GR00T-Gen(배경·조명 랜덤화) → Cosmos Transfer(포토리얼 변환) → Isaac Lab 학습. 78만 궤적을 11시간에 생성했고, 실데이터와 합치면 실데이터 단독 대비 GR00T N1 성능이 40% 올랐다. Franka 블록 쌓기는 합성 1천 개, RTX 4090 약 0.5시간 학습으로 84%.
  • Neural trajectory(DreamGen, GR00T-Dreams): 영상 생성 모델로 88시간을 827시간으로 늘렸지만 비용이 약 10.5만 L40 GPU시간이고, RoboCasa 이득은 30/100/300개 데이터 구간에서 평균 +4.2%/+8.8%/+6.8%다(논문 표기). DreamGen은 pick-and-place 텔레옵 하나로 휴머노이드의 새 행동 22가지를 보였다.
  • Isaac Lab(arXiv 2511.04831, 2025-11): GPU 병렬 물리·렌더링·액추에이터 모델·다중 주파수 센서·도메인 랜덤화를 한 프레임워크로 통합했다.

주의할 점은 셋이다. GR00T N1의 시뮬 78만 궤적은 source/target 용기 54개 조합의 재배치 계열이다. 모든 합성 파이프라인은 시드가 되는 사람 시연을 요구한다. 접촉·변형체 물리가 맞지 않는 태스크(케이블, 천, 액체)는 합성 이득을 실기로 검증하기 전에는 가정하지 말아야 한다.

인간 1인칭 비디오: 2026년의 가장 큰 변화

  • Physical Intelligence(2025-12-16): 웨어러블 카메라 1인칭 영상을 손 포즈를 액션으로 삼아 π0.5 미세조정에 섞자, 인간 데이터에만 있던 4개 일반화 시나리오에서 성능이 약 2배가 됐다. 핵심은 이 효과가 로봇 사전학습의 규모·다양성이 커질수록 커지는 창발적 성질이라는 점이다. 사전학습이 빈약한 모델에 인간 영상만 얹어서는 같은 이득을 기대하기 어렵다.
  • EgoScale(arXiv 2602.16710): 액션 라벨이 붙은 1인칭 비디오 20,854시간(선행 연구의 20배 이상)으로 사전학습했다. 인간 데이터 규모와 검증 손실 사이에 log-linear 관계가 있고, 22-DoF 손에서 사전학습 없는 기준선 대비 평균 성공률이 54% 올랐다. 레시피는 2단계다. 대규모 인간 사전학습 → 정렬된 인간-로봇 소량 mid-training. GR00T N1.7 발표는 1천→2만 시간에서 평균 태스크 완수율이 2배 이상이라고 밝혔다.

결론: 인간 비디오는 로봇 데이터를 대체하지 않고 증폭한다. 정렬용 로봇 데이터와 손 포즈 추정 파이프라인이 선행 조건이다.

데이터 스케일링의 공개 근거

근거 내용 신뢰 수준
Lin et al. 2024 일반화 성능이 환경 수·물체 수에 대해 대략 멱법칙. 4만+ 시연, 1.5만+ 실기 롤아웃으로 검증. 환경-물체 쌍당 50개 이후로는 추가 이득이 미미. 32쌍 × 50 = 약 1,600개로 미지 환경 약 90% 논문, 엄격한 프로토콜
π0.5 학습 장소 3→12→22→53→82→104로 늘릴수록 향상, 약 100곳에서 "테스트 환경을 직접 학습한" 기준선에 근접 논문
EgoScale 인간 데이터 시간 ↔ 검증 손실 log-linear, 실기 성능과 상관 논문
GEN-0 (2025-11-04) 27만 시간(주당 1만 시간 증가). 1B는 조기 ossification, 6B부터 이득, 7B+에서 흡수. L(D) = (D_c/D)^α 회사 블로그, 비동료심사

공통 메시지는 "같은 장면에서 시연을 더 찍는 것"은 빠르게 포화하고, 환경·물체 다양성이 스케일링의 축이라는 것이다.

자체 데이터 수집 설계 체크리스트

  1. 액션 표현부터 고정: EE 델타 vs 관절, 좌표계, 그리퍼 정규화, 제어 주파수(정책 목표가 30~50 Hz면 수집도 그 이상). 나중에 바꾸면 전량 재수집이다.
  2. 다양성 우선 배분: 환경-물체 쌍당 50개 안팎에서 끊고 쌍의 수를 늘린다. 같은 책상에서 500개 찍지 않는다.
  3. 카메라: 손목 1 + 외부 2를 기본으로, 외부 카메라 포즈는 의도적으로 흔들고(BridgeData V2 방식) 캘리브레이션 값을 에피소드마다 저장한다.
  4. 메타데이터 스키마: 에피소드 ID, 작업자, 장소, 물체 ID, 성공/실패, 언어 지시문(가능하면 3개 변형), 하드웨어·펌웨어 버전. 실패·준최적 에피소드는 버리지 말고 태깅한다(π0.7은 실패 포함 자율 데이터를 학습에 쓴다).
  5. 포맷: RLDS 또는 LeRobot 포맷으로 저장해 OXE 계열·GR00T 미세조정 도구와 호환시킨다.
  6. 수집 장치 이원화: 로봇 텔레옵(정렬·접촉 데이터)과 UMI류 핸드헬드·1인칭 카메라(다양성)를 섞는다.
  7. 합성은 시드 확보 후: 시연 수십~수백 개 → MimicGen/GR00T-Mimic 증식 → 실기 A/B로 이득을 확인한 태스크만 확대.
  8. 평가셋 격리: 장소·물체 단위로 홀드아웃하고, 수집 주차마다 같은 프로토콜로 실기 성공률을 재측정해 자기 스케일링 곡선을 그린다. 곡선이 꺾이면 양이 아니라 다양성 축을 바꾼다.
  9. 라이선스 원장: 혼합에 넣은 공개 데이터셋별 라이선스(NC 여부)를 모델 카드 수준으로 기록한다.

학습·파인튜닝 실무 — 데모 몇 개, GPU 몇 장

VLA 파인튜닝의 현실적 견적은 태스크당 수십~수백 데모(또는 1~20시간)와 24~80GB GPU 한 장에서 시작하며, 성패는 모델 크기보다 체크포인트와 내 로봇의 거리, 데모의 변이 커버리지, 액션 정규화·카메라 고정 같은 기본기에서 갈린다. OpenVLA·OFT·openpi·LeRobot의 공개 수치로 기법별 비용과 흔한 실패를 정리한다.

핵심 요점

  • OpenVLA 논문 기준 LoRA(r=32)는 파라미터 1.4%만 학습해 전체 파인튜닝과 같은 성공률(68.2% 대 69.7%)을 내며 A100 한 장에서 10~15시간이면 끝난다.
  • 비전 인코더를 동결하면 VRAM은 거의 줄지 않는데 성공률은 69.7%에서 47.0%로 떨어지므로, 카메라가 사전학습과 다르면 비전을 풀어야 한다.
  • OpenVLA-OFT는 LIBERO 평균을 76.5%에서 97.1%로, 처리량을 4.2Hz에서 108.8Hz로 올리지만 50~150K 스텝을 A100/H100 8장으로 돌리는 비용과 0.321초 지연을 감수해야 한다.
  • 공개된 데모 수는 SmolVLA 약 50 에피소드(25개는 실패), OFT ALOHA 20~300개, openpi 1~20시간이며, 총량보다 변이 수 × 변이당 반복으로 예산을 짜야 한다.
  • LeRobotDataset v3.0은 Parquet + MP4 + 메타데이터 구조이고 π0.5는 stats.json에 q01/q99가 없으면 첫 배치에서 실패하며, SO-100/101 두 팔 BOM은 미국 기준 $229.88다.
  • LIBERO-Plus는 카메라 시점·초기 상태를 조금만 흔들어도 성공률이 95%에서 30% 미만으로 떨어진다고 보고했고, 액션 정규화 통계의 작은 q01/q99/std는 손실 발산의 흔한 원인이다.

먼저 자릿수부터 — 2026년 9월 기준 견적

공개된 논문·모델 카드·공식 저장소(2026-09-19 확인)만 놓고 보면 VLA 파인튜닝의 자릿수는 이렇다. 데이터는 태스크당 수십~수백 데모(또는 1~20시간), GPU는 LoRA면 24~80GB 한 장, 전체 파인튜닝이면 80GB급 한 장에서 8장 노드. 사전학습은 남의 일이다 — OpenVLA 하나가 A100 64장 × 14일, 21,500 A100-시간(배치 2048)을 썼다. 스타트업이 고를 수 있는 것은 "어떤 체크포인트에서 출발해 어디까지 풀 것인가"뿐이다.

체크포인트 선택 — 벤치마크 점수보다 '내 로봇과의 거리'

모델 파라미터 제어·청크 사전학습 데이터 라이선스 파인튜닝 사양(공식)
OpenVLA 7B 청크 없음, RTX 4090 bf16 약 6Hz 실로봇 데모 970k 코드 MIT, 가중치 Llama 커뮤니티 라이선스 LoRA 최소 ~27GB(예시 설정 bs16은 ~72GB), 전체는 A100 8장 노드 + FSDP
OpenVLA-OFT 7B ALOHA 25Hz, 청크 K=8(LIBERO)/25(ALOHA) OpenVLA 기반 코드 MIT 27~80GB GPU 1~8장, 추론 16~18GB
π0 3.3B(PaliGemma 3B + 액션 전문가 300M) 최대 50Hz, H=50 약 10,000시간, 로봇 구성 7종·68개 태스크 Apache-2.0 LoRA >22.5GB, 전체 >70GB, 추론 >8GB
π0.5 openpi 동일 계열 LeRobot 기본 청크 50 모바일 매니퓰레이션 ~400시간 + 이종 데이터 공동학습 Apache-2.0 LeRobot 레시피는 80GB 한 장 기준
SmolVLA 0.45B(액션 전문가 약 100M) 비동기 청크 추론 커뮤니티 데이터셋 481개, 22.9K 에피소드, 10.6M 프레임 Apache-2.0 A100 한 장
GR00T N1.7 3B — — 코드 Apache 2.0, 가중치 NVIDIA Open Model License 40GB+ 권장(H100·L40), 추론 16GB+

선택 기준은 네 가지다.

  • 임바디먼트 일치. openpi는 사전학습에 쓴 정규화 통계를 trossen, droid, franka, ur5e, ur5e_dual, arx 등 asset id로 공개한다. 내 로봇이 이 목록에 있으면 π0 계열이 출발점으로 유리하다. 없으면 공식 블로그의 경고 — 체크포인트가 "로봇 셋업 전반에 꽤 민감할 수 있다" — 가 그대로 적용된다.
  • 제어 주파수. OpenVLA 저장소는 "5~10Hz로 수집하라, 액션 청킹 없이 학습돼 고주파 데이터에 약하다"고 명시한다. 25Hz 이상 양팔 작업이면 OFT나 플로 매칭 계열(π0, SmolVLA, GR00T)이 맞다.
  • 라이선스. 가중치 라이선스가 코드와 다르다(OpenVLA는 Llama 2 파생, GR00T는 NVIDIA 자체 라이선스). 납품물에 가중치가 들어가면 법무 검토 대상이다.
  • 정말 VLA가 필요한가. OpenVLA 논문 스스로 "Put Carrot in Bowl" 같은 좁은 단일 지시 태스크에서는 Diffusion Policy가 강하고, 사전학습 범용 정책은 다양한 파인튜닝 태스크에서 앞선다고 적었다. 물체·지시가 고정된 셀이면 ACT/Diffusion Policy를 처음부터 학습하는 쪽이 싸다.

전체 파인튜닝 vs LoRA vs OFT

OpenVLA 논문의 파라미터 효율 비교(Franka, 성공률 ± 표준오차)가 아직도 가장 깔끔한 기준점이다.

전략 성공률 학습 파라미터 VRAM
전체 파인튜닝 69.7 ± 7.2% 7,188.1M 163.3GB
마지막 층만 30.3 ± 6.1% 465.1M 51.4GB
비전 인코더 동결 47.0 ± 6.9% 6,760.4M 156.2GB
샌드위치 62.1 ± 7.9% 914.2M 64.0GB
LoRA r=32 68.2 ± 7.5% 97.6M 59.7GB
LoRA r=64 68.2 ± 7.8% 195.2M 60.5GB

읽는 법은 세 가지. ① LoRA는 파라미터 1.4%로 전체 파인튜닝과 같은 성능을 내고, A100 한 장에서 10~15시간 — 연산 8배 절감. ② 랭크를 32→64로 올려도 이득이 없다. ③ 비전 인코더 동결은 메모리를 거의 못 아끼면서 성능만 22.7%p 잃는다. 카메라가 사전학습과 다르면 비전을 풀어야 한다.

OFT(Optimized Fine-Tuning)는 "무엇을 학습하느냐"가 아니라 "액션을 어떻게 내느냐"를 바꾼다. 병렬 디코딩 + 액션 청킹 + 연속 액션 + L1 회귀 조합으로 LIBERO 평균 성공률이 76.5% → 97.1%, 처리량이 4.2Hz → 108.8Hz(K=8, 26배)로 올랐고 ALOHA(K=25)에서는 77.9Hz다. 대가도 분명하다.

  • 학습은 50~150K 스텝, A100/H100 8장, 배치 64~128(ALOHA는 총 32). LoRA 한 장짜리 견적과 자릿수가 다르다.
  • ALOHA 설정의 지연은 0.321초다. 처리량과 지연을 혼동하지 말 것.
  • 언어 조건에 FiLM을 빼면 언어 추종이 33%(무작위 선택 수준)로 떨어졌다 — 모델이 시각적 허위 상관에 과적합한다는 뜻이다.
  • 저자들이 직접 밝힌 한계: L1 회귀는 같은 입력에 유효한 행동이 여럿인 다봉 분포에서 약할 수 있다. 데모 전략을 통일해야 한다.

openpi 쪽 주의점: PyTorch 경로는 아직 LoRA·FSDP·혼합 정밀도·EMA·π0-FAST를 지원하지 않는다(README 기준). RTX 4090 한 장 LoRA는 JAX 경로 얘기다. LeRobot의 π0.5는 train_expert_only=true + freeze_vision_encoder=true로 VLM을 얼려 메모리를 줄일 수 있지만, 문서가 "성공률을 일부 희생한다"고 못박았다.

GPU별 현실적 선택지: 24GB 한 장 → SmolVLA 전체, π0 LoRA(JAX) / 80GB 한 장 → OpenVLA LoRA, π0.5 전체(gradient checkpointing + bf16), GR00T / 80GB 8장 → OFT, OpenVLA 전체.

데모 몇 개 — 공개 수치만

출처 수치
LeRobot SmolVLA 문서 시작점 ~50 에피소드. 예시 데이터는 큐브 위치 5곳 × 10회. 25 에피소드로는 부족해 성능이 나빴다
OpenVLA 파인튜닝 실험 타깃 태스크당 10~150 데모
OFT ALOHA 반바지 접기 20, 셔츠 접기 30, 재료 뜨기 45(재료당 15), 냄비에 넣기 300(물체당 100)
LIBERO 스위트당 10태스크 500 데모(태스크당 50)
openpi 공개 블로그 다양한 태스크에 1~20시간이면 충분했다
π0 논문 가장 단순한 태스크 5시간, 가장 복잡한 태스크 100시간 이상

숫자 자체보다 구조가 중요하다. "Data Scaling Laws in Imitation Learning"(데모 4만 개, 실기 롤아웃 1.5만 회)은 일반화 성능이 환경·물체 수에 대해 멱법칙을 따르고, 환경·물체당 데모가 임계치를 넘으면 추가 데모의 효과가 미미하다고 보고했다. 수집원 4명이 오후 한나절 모은 데이터로 미지 환경·물체에서 약 90%를 얻었다. 따라서 예산은 "총 N개"가 아니라 변이 수 × 변이당 반복(10~15회 이상) 으로 짠다. OFT에서 언어로 물체를 고르는 태스크만 물체당 100개를 쓴 것도 같은 맥락이다.

GPU·시간 견적표

작업 공개 수치
SmolVLA 파인튜닝 20k 스텝, 배치 64 → A100 한 장 약 4시간
OpenVLA LoRA A100 한 장 10~15시간
π0.5(LeRobot, LIBERO) 30,000 스텝, 배치 64, 80GB 한 장
GR00T N1.7 예시 명령 기준 global batch 32, max-steps 2000
OpenVLA-OFT 50~150K 스텝, A100/H100 8장
(참고) SmolVLA 사전학습 GPU 4장, 200,000 스텝, 배치 256. 프로젝트 전체 약 30k GPU-시간

LeRobot 생태계 — 포맷·스크립트·하드웨어

  • LeRobotDataset v3.0(lerobot >= 0.4.0): meta/info.json(스키마·FPS·경로 템플릿), meta/stats.json(정규화 통계), meta/tasks, meta/episodes/(청크 Parquet), data/(Parquet), videos/(카메라별 MP4). v2의 에피소드당 파일 1개 대신 여러 에피소드를 큰 파일에 이어 붙이고 경계는 메타데이터로 복원한다. StreamingLeRobotDataset이나 --dataset.streaming=true로 다운로드 없이 학습할 수 있다.
  • 함정: 직접 데이터셋을 만들 때 dataset.finalize()를 빼먹으면 Parquet 푸터가 안 써져 파일이 깨진다. GR00T는 "LeRobot v2 포맷의 변형 + meta/modality.json"을 쓰므로 v3와 그대로 호환되지 않는다.
  • 저가 하드웨어: SO-100/101 공식 BOM은 리더+팔로워 2대 $229.88(미국)·€226.3·¥1,343.16, 팔로워 1대 $121.94다(서보·제어보드·전원·클램프 기준, Apache-2.0).
lerobot-train \
  --policy.path=lerobot/smolvla_base \
  --dataset.repo_id=${HF_USER}/mydataset \
  --batch_size=64 --steps=20000 \
  --output_dir=outputs/train/my_smolvla --policy.device=cuda

--policy.path는 가중치와 config.json을 함께 읽고, --policy.pretrained_path는 가중치만 읽는다. 후자에서는 n_action_steps가 기본값 50, empty_cameras가 0으로 되돌아가므로 명시해야 한다.

흔한 실패와 점검법

  1. 액션 정규화. openpi 문서: 거의 안 쓰는 차원은 q01/q99/std가 매우 작아져 정규화 후 값이 폭발하고 손실이 발산한다. 학습 전 norm_stats.json을 눈으로 본다. 사전학습 통계 재사용은 액션 공간 정의(0~5번 왼팔 관절, 6번 그리퍼, 그리퍼 0.0=완전 열림·1.0=완전 닫힘)가 일치할 때만 성립하며, 공식 권고는 "재사용과 새 통계 둘 다 돌려 보고 나은 쪽을 택하라"다. π0.5는 분위수 정규화라 stats.json에 q01/q99가 없으면 첫 배치에서 ValueError가 난다 — lerobot-edit-dataset ... recompute_stats로 다시 계산. OpenVLA 계열은 추론 시 unnorm_key를 학습 데이터셋과 맞춘다.
  2. 카메라 배치 변화. LIBERO-Plus는 카메라 시점과 로봇 초기 상태를 조금만 흔들어도 성공률이 95% → 30% 미만으로 떨어지고, 모델이 언어 지시를 사실상 무시하는 경향을 보고했다. 카메라 마운트를 지그로 고정하고 설치 사진을 데이터셋과 함께 버전 관리한다. LeRobot의 이미지 증강(ColorJitter, SharpnessJitter)은 기본 비활성(enable=False)이고 시점 변화는 못 덮는다 — 수집 단계에서 의도적으로 흔들어야 한다.
  3. 수집 주파수·정지 액션. OpenVLA 저장소는 멈춤·미세 액션이 많으면 추론 중 로봇이 "갇힌다"고 경고한다. 텔레옵 중 망설인 구간은 잘라 낸다.
  4. 분포 이동. 25 에피소드 실패 사례처럼 부족한 것은 개수가 아니라 커버리지다. 평가 시 물체 위치를 학습 격자 밖에 놓아 보고, 실패 상태에서의 복구 데모를 추가한다.
  5. 청크 지연. 청크를 개루프로 끝까지 실행하면 관측이 낡는다. SmolVLA의 비동기 추론은 태스크 완료 시간을 13.75초 → 9.7초로 줄였고, lerobot-rollout에는 저전력 하드웨어용 RTC 옵션이 있다.

학습 전 체크리스트: 액션 차원 순서·그리퍼 부호 확인 → 통계 파일 육안 검사 → 학습·추론 카메라 키와 해상도 일치 → 학습 데이터 1 에피소드를 정책 없이 재생(replay)해 로봇이 같은 궤적을 그리는지 확인 → 그다음에 GPU를 켠다.

온디바이스 추론 — 제어 주파수와 모델 지연의 싸움

50Hz 제어는 20ms 마다 행동을 요구하지만 3B 급 VLA 는 RTX 4090 에서 70ms 이상, Jetson AGX Thor 에서 약 94~246ms, Orin 에서 200ms~1초가 걸린다. 이 간극은 없어지지 않으며, 양자화·경량 모델로 줄이고 action chunk + 비동기 추론으로 가리고 듀얼 시스템으로 빠른 루프만 엣지에 두는 세 가지 수단과 그 한계를 공개 수치로 정리한다.

핵심 요점

  • 처리량(Hz)과 지연(ms)은 다른 숫자다 — OpenVLA-OFT 의 77.9Hz 는 25스텝 청크를 321ms 에 뽑는다는 뜻이며, 로봇의 반응 속도를 정하는 것은 지연이다.
  • NVIDIA GR00T N1.7(3B) 모델 카드 기준 TensorRT 를 써도 AGX Thor 는 93.8ms(10.7Hz), Orin 은 216.5ms(4.6Hz)이고, 엣지에서는 메모리 대역폭에 묶인 액션 헤드가 백본보다 큰 병목이다.
  • 양자화는 정확도보다 실제 속도를 먼저 봐야 한다 — OpenVLA INT4 는 bf16 과 같은 성공률에 메모리를 16.8GB→7.0GB 로 줄였지만, INT8 은 1.2Hz 로 느려져 성공률이 58.1%로 떨어졌다.
  • 비동기 추론은 지연을 가릴 뿐이다 — SmolVLA 실기에서 작업 시간은 13.75초→9.70초로 줄었으나 평균 성공률은 78.3%→73.3%였고, RTC 계열은 d ≤ s ≤ H − d 와 학습 시 가정한 최대 지연(50Hz 에서 200ms) 안에서만 성립한다.
  • 상용에 가까운 시스템은 모두 분할했다 — Helix 는 7B(7~9Hz)+80M(200Hz), Gemini Robotics 는 클라우드 백본+온보드 디코더(종단 약 250ms)이며, 분할은 학습 단계에서 지연 오프셋까지 맞춰야 하는 설계다.
  • 폰급 NPU 는 비전 인코더(20~45배 가속)와 1Hz 급 의미 계층까지는 현실적이지만 flow 액션 헤드를 수십 Hz 로 돌린 공개 실측은 확인되지 않으며, 클라우드 오프로딩은 p99 지연과 큐 고갈 시 거동이 안전 요구사항이 된다.

간극의 크기 — 제어 주기는 20ms, 추론 한 번은 70ms 이상

VLA 를 로봇에 올릴 때 첫 질문은 "얼마나 똑똑한가"가 아니라 제어기가 요구하는 주기 안에 행동이 도착하는가다. 공개 논문이 직접 적은 요구 주기는 이렇다. π0 는 UR5e·Franka 를 20Hz, 나머지 로봇을 50Hz 로 제어한다(제어 스텝 Δt = 20ms). GR00T N1 의 행동 모듈은 120Hz, Figure Helix 의 저수준 정책은 200Hz 로 35자유도 상체를 구동한다. OpenVLA 가 학습한 BridgeData V2 제어기는 5Hz 다.

반대편의 추론 시간은 다음과 같다(2026-09 기준 공개 자료).

  • π0(3.3B): RTX 4090 에서 이미지 인코더 14ms + 관측 forward 32ms + flow 10스텝 27ms = 온보드 73ms, 오프보드는 네트워크 13ms 가 붙어 86ms(논문 Table I).
  • Real-Time Chunking(RTC) 논문은 같은 계열 모델이 RTX 4090 에서 KV 캐시 prefill 에만 46ms 를 쓴다고 적는다. 디노이징 전에 이미 제어 스텝 두 개가 지나간다.
  • OpenVLA(7B): RTX 4090·bfloat16 에서 약 6Hz. 자기회귀 디코딩이라 A100 에서 한 스텝 행동에 0.33초가 든다(OpenVLA-OFT 논문).
  • π0-FAST: 자기회귀 토큰 방식은 청크당 약 750ms, flow 방식 π0 는 약 100ms(FAST 논문, RTX 4090). 학습은 5배 싸지만 엣지에서는 불리하다.

여기서 흔한 착시 하나를 짚어야 한다. 처리량(Hz)과 지연(ms)은 다른 숫자다. OpenVLA-OFT 는 LIBERO 에서 108.8Hz 를 내지만 이는 8스텝 청크를 73.5ms 에 뽑는다는 뜻이고, ALOHA 구성(K=25, 이미지 3장)의 77.9Hz 는 지연 321ms 와 한 쌍이다(모두 A100). "N Hz 로 돈다"는 문장을 보면 청크 길이와 지연을 같이 확인해야 한다. 로봇이 새 관측에 반응하는 속도를 정하는 것은 지연 쪽이다.

엣지 실측 — Jetson Orin/Thor 공개 수치

2026년 9월 현재 가장 상세한 공식 수치는 NVIDIA GR00T N1.7(3B) 모델 카드의 추론 표다(디노이징 4스텝, 카메라 1대, BF16).

장치 모드 백본 액션 헤드 E2E 추론 주파수
H100 PyTorch eager 31.3ms 48.2ms 85.8ms 11.7Hz
H100 TensorRT 전체 8.8ms 12.3ms 27.9ms 35.9Hz
AGX Thor PyTorch eager 55.26ms 81.65ms 144.9ms 6.9Hz
AGX Thor TensorRT 전체 28.89ms 56.64ms 93.8ms 10.7Hz
Orin PyTorch eager 127.6ms 205.39ms 342.8ms 2.9Hz
Orin TensorRT(DiT 만) 128.38ms 78.6ms 216.5ms 4.6Hz

읽을 점이 세 가지다.

  1. Thor 에서도 3B 모델은 10Hz 언저리다. 같은 저장소의 하드웨어 권고 문서는 Thor 8.9→12.4Hz, Orin 2.9→6.6Hz 로 모델 카드와 다른 값을 싣고 있다. 공식 문서끼리도 측정 조건에 따라 어긋나므로 자기 카메라 수·해상도·전력 모드로 다시 재야 한다. 이 문서는 10Hz 이상을 "일반 조작의 권장 최소", 10Hz 미만(Orin)을 "느리고 비반응적인 작업에만 적합"으로 분류한다.
  2. TensorRT 이득이 엣지에서 작다. H100 은 3.08배, Thor 는 1.54배다. Orin 은 TRT 10.3 이 백본 엔진을 지원하지 않아 DiT 만 가속된다.
  3. 엣지에서는 액션 헤드가 병목이다. Thor TRT 기준 백본 28.89ms 대 액션 헤드 56.64ms. 이기종 하드웨어 특성화 논문(arXiv 2604.24447, 2026-04)은 VLM 백본은 compute-bound, 액션 전문가는 memory-bound 라고 분석했고, 같은 논문의 π0 지연은 RTX 4090 102.3ms, Thor 246.0ms, AGX Orin 920.6ms 다. Thor 는 FP4 기준 2070 TFLOPS·128GB 를 내세우지만 메모리 대역폭은 273GB/s 다. 반복 디노이징이 대역폭을 먹는 구조에서는 연산 성능 수치만 보고 고르면 빗나간다.

NVIDIA 개발자 포럼에는 수작업 CUDA 커널로 Thor 에서 π0.5 44ms(23Hz)를 냈다는 커뮤니티 게시물(2026-05)도 있다. 공식 벤치마크가 아니고 정밀도·재현 조건이 공개되지 않았으므로 "가능성의 상한" 정도로만 읽는 것이 안전하다.

모델별 비교표

모델 파라미터 제어/청크 학습 데이터 라이선스 공개 추론 수치
OpenVLA 7B 5Hz 제어기 기준 OXE 97만 에피소드 MIT 4090 약 6Hz, bf16 16.8GB
π0 (openpi) 3.3B H=50, 최대 50Hz 1만 시간 이상 Apache-2.0(코드) 4090 73ms, 추론 GPU 메모리 8GB 초과(openpi README)
SmolVLA 0.45B 청크 50, flow 10스텝 481개 데이터셋·2.29만 에피소드·1,060만 프레임 Apache-2.0 추론 메모리 약 2GB, 같은 문서에서 π0 는 14GB(LeRobot 문서)
GR00T N1 2.2B S2 10Hz / S1 120Hz — — L40 에서 16스텝 청크 63.9ms
GR00T N1.7 3B 디노이징 4스텝 2,160만 데이터 포인트 NVIDIA Open Model License 위 표
Helix S2 7B + S1 80M 7~9Hz / 200Hz 약 500시간 비공개 임베디드 GPU 2개에 분리
Gemini Robotics 비공개 실효 50Hz 비공개 비공개 백본 160ms 미만, 종단 약 250ms

지연을 줄이는 법 — 양자화·경량화의 실제 성적

양자화는 "정확도"보다 "속도가 실제로 빨라졌는가"를 먼저 본다. OpenVLA 논문의 표가 교과서적이다. INT4 는 성공률 71.9%로 bf16(71.3%)과 같으면서 메모리가 16.8GB→7.0GB 로 줄었다. 그런데 INT8 은 58.1%로 떨어졌다. 원인은 정밀도가 아니라 양자화 오버헤드로 A5000 에서 1.2Hz 밖에 못 돌아 5Hz 로 학습된 시스템 동역학이 깨진 것이라고 저자들이 직접 설명한다. 느려지는 양자화는 하지 않느니만 못하다.

flow/DiT 액션 헤드는 그냥 양자화하면 무너진다. QuantVLA(arXiv 2602.20309)에서 π0.5 의 DiT 만 W4A8 로 낮추면 LIBERO 평균이 97.1%→71.6%, LLM+DiT 를 일반 PTQ 로 낮추면 76.3%가 된다. 어텐션 Q·K·V·O 를 부동소수로 두고 스케일을 보정한 방식은 97.6%를 유지하며 해당 부분 메모리를 4.27GB→1.28GB(70% 절감)로 줄였고 W4A4 는 95.3%였다. 다만 이것은 메모리와 시뮬레이션 성공률이다. 지연 이득은 타깃 칩의 INT4 커널 유무에 달려 있으니 반드시 실측한다.

구조적 경량화는 SmolVLA 가 좋은 레퍼런스다. VLM 층의 앞쪽 절반만 쓰고(N = L/2), 프레임당 시각 토큰을 64개로 줄이고, 액션 전문가를 약 1억 파라미터로 두었다. 그 밖의 손잡이는 디노이징 스텝 수(π0 10, RTC 실험 5, GR00T 4)와 캐싱이다. 앞의 특성화 논문은 디퓨전 스텝 캐시(DP-Cache)로 2.1배 가속에 성공률 3.6% 하락을, 파이프라인 병렬화까지 조합하면 GPU 최대 2.9배·엣지 NPU 6배를 보고한다. 가속은 공짜가 아니고 성공률로 값을 치른다.

지연을 가리는 법 — action chunk + 비동기 추론

청크는 지연을 없애지 않고 가린다. GR00T 문서의 표현대로 추론률은 "재계획률"이고, 약 10Hz 추론으로도 청크와 비동기 추론을 쓰면 약 30FPS 실행을 유지할 수 있다. 문제는 방식이다.

  • 동기(synchronous): π0 원 논문은 20Hz 로봇에서 16스텝, 50Hz 로봇에서 25스텝을 개루프로 실행한 뒤 다시 추론한다. 추론 동안 로봇이 멈추고, 이 정지는 학습 데이터에 없던 동작이다.
  • LeRobot 비동기 스택: PolicyServer(추론)와 RobotClient(실행 큐)를 분리하고, 큐 잔량이 임계 비율 g 아래로 내려가면 새 관측을 보낸다. SmolVLA 논문 실기에서 작업 시간이 13.75초→9.70초, 고정 시간 내 처리량이 9개→19개가 됐다. 단 평균 성공률은 78.3%→73.3%로 약간 내려갔다. 빨라지는 것과 정확해지는 것은 별개다.
  • RTC(Physical Intelligence): 추론 중에 어차피 실행될 앞쪽 d 스텝을 고정하고 나머지를 인페인팅해 청크 경계의 불연속을 없앤다. π0.5(H=50, 5스텝) 기준 모델 지연이 76ms→97ms 로 늘지만, +100ms 주입에서 동기 방식은 크게 나빠지고 +200ms 에서 temporal ensembling 은 동작하지 않는 반면 RTC 는 300ms 넘는 지연에서도 성냥 켜기 같은 정밀 작업을 해냈다.
  • 학습 시점 RTC(arXiv 2512.05964): 지연을 학습 때 시뮬레이션해 추론 오버헤드를 없앤다. 원격 H100 종단 지연이 135ms→108ms. 지연을 0~10스텝으로 뽑아 학습하므로 50Hz 로봇에서 최대 200ms 까지가 설계 범위다. 네 방식을 같은 코드베이스로 비교한 연구(arXiv 2605.08168)도 학습 시점 방식이 가장 견고하고, 추론 시점 인페인팅은 긴 청크·큰 지연에서 급격히 나빠진다고 정리했다.

설계 부등식은 간단하다.

d = ceil((모델 지연 + 네트워크 왕복 p99) / Δt)   # 지연을 제어 스텝 수로
조건: d ≤ s ≤ H − d                             # s 실행 구간, H 예측 구간 (RTC)
예) Δt=20ms, 지연 97+20ms → d=6, H=50 이면 s 는 6~44
큐가 비면: 마지막 청크 연장이 아니라 감속·정지로 떨어지게 설계
python -m lerobot.async_inference.robot_client \
  --policy_type=smolvla --actions_per_chunk=50 \
  --chunk_size_threshold=0.5   # 0 에 가까우면 동기, 1 이면 매 스텝 전송. 문서 권장 0.5~0.6

듀얼 시스템 — 빠른 루프만 엣지에 둔다

수 B 모델을 200Hz 로 돌릴 방법은 없으니, 상용에 가까운 시스템은 모두 나눴다.

  • Helix: S2(7B VLM, 7~9Hz)가 잠재 벡터를 내고 S1(80M, 200Hz)이 이를 받아 구동한다. 각각 전용 임베디드 GPU 에서 돌고, S2 는 비동기 백그라운드 프로세스다. 핵심은 학습 때 S1·S2 입력 사이에 배포 지연만큼 시간 오프셋을 넣었다는 점이다. 분할은 배포 기법이 아니라 학습 설계다.
  • Gemini Robotics: 백본은 클라우드, 액션 디코더는 로봇 온보드. 백본 응답 160ms 미만, 관측→청크 종단 약 250ms, 청크 덕에 실효 50Hz. DeepMind 가 2025-06-24 에 On-Device 판을 따로 냈고 현재 On-Device 2 를 신뢰 테스터에게 제공하며 "네트워크 지연이나 연결 없이 동작해야 하는 로봇"을 이유로 든다는 사실이 하이브리드의 한계를 말해 준다.
  • 주행: NaVILA 는 8B VLM 이 RTX 4090 에서 약 1FPS 로 "75cm 전진" 같은 중간 수준 명령만 내고, 실시간 장애물 회피는 별도 보행 정책이 맡는다. 이동 로봇에서 VLA 는 목표 설정기이고, 충돌 회피·비상 정지는 VLA 루프 밖의 결정론적 계층에 있어야 한다.

폰급 NPU — System 2 속도는 되지만 빠른 루프는 아직

Snapdragon 8 Elite 에서 VLM 추론을 실측한 연구(arXiv 2606.27906, FastVLM-0.5B)가 현실적인 기준선이다. 비전 인코더는 NPU 의 주력 구간이라 CPU 대비 20~45배 빠르다(ViT-B/16 663.0ms→14.9ms, INT8). 반면 LLM prefill 은 197.43 tok/s(CPU 의 1.64배), decode 는 1.18배에 그친다. 100회 연속 실행에서 NPU 경로는 스로틀링이 없었고 온도는 10.47°C 낮았으며 에너지는 2.52배 적었다. 제약도 분명하다. 정적 shape 강제, Flash Attention·커스텀 rotary 연산 미지원, INT8 전제, 콜드 스타트 536ms(CPU 84ms).

산술로만 보면 시각 토큰 64개짜리 카메라 3대에 지시문을 더한 200여 토큰 prefill 이 0.5B 모델에서도 1초 안팎이다(측정값이 아니라 위 처리량으로 나눈 추정). 즉 폰 NPU 는 지금 1Hz 급 의미 계층은 감당하지만, flow 액션 헤드를 수십 Hz 로 돌린 공개 실측은 이 글을 쓰는 시점에 확인하지 못했다. 실무 분할은 폰에서 지각(검출·추적·깊이)과 소형 비-VLA 정책을 빠른 루프로 돌리고, VLA 급 추론은 느린 계층이나 도킹된 컴퓨트에 두는 것이다. 로보틱스 전용 SoC 들이 VLA 구동을 내세우기 시작했지만 모델별 지연표가 공개되기 전에는 구매 근거로 쓰지 않는 편이 낫다.

클라우드 오프로딩의 위험

  • 평균이 아니라 꼬리가 문제다. 논문 속 오프보드 수치는 LAN 기준 13ms(π0), 10~20ms(RTC)이고 RTC 저자들도 현실 환경에서는 네트워크만으로 20ms 를 쉽게 넘는다고 적는다. 비동기 방식은 d 를 최악값으로 잡아야 하므로 p99 RTT 가 곧 설계 입력이다.
  • 학습 분포 밖 지연: 학습 시점 RTC 의 설계 범위는 200ms 다. Wi-Fi 로밍이나 LTE 폴백으로 그 밖에 나가면 정책은 본 적 없는 조건에서 동작한다.
  • 큐 고갈 시 거동이 안전 요구사항이다. 연결이 끊기면 남은 청크를 소진한 뒤 무엇을 할지(감속 정지, 파지 유지)를 엣지에서 결정해야 하고, 비상 정지는 어떤 경우에도 클라우드 경로를 타면 안 된다.
  • 다중 카메라 영상의 상시 업링크는 대역폭·비용·현장 영상 반출 문제를 같이 끌고 온다.

도입 판단 체크리스트

  1. 작업의 반응 시간 요구(접촉·동적 물체 여부)에서 필요한 재계획률을 정한다. 정적 픽앤플레이스는 10Hz 미만 + 청크로도 된다.
  2. 후보 모델을 타깃 보드에서 카메라 수·해상도·전력 모드까지 맞춰 재고, 백본/액션 헤드 분해 시간과 p50·p99 를 기록한다.
  3. d = ⌈지연/Δt⌉ 를 구해 d ≤ s ≤ H − d 가 성립하는지, 지연이 학습 때 가정과 같은지 확인한다.
  4. 부족하면 TensorRT/컴파일 → 디노이징 스텝 축소 → 가중치 양자화(실측 필수) → 소형 모델 → 듀얼 시스템 순으로 손댄다.
  5. 비동기 전환 뒤에는 속도뿐 아니라 성공률을 다시 잰다.
  6. 오프로딩을 쓰면 큐 고갈 거동과 워치독을 먼저 구현하고, 안전 정지는 엣지의 결정론적 계층에 둔다.

평가 — 성공률 숫자를 믿기 전에

LIBERO·CALVIN·SimplerEnv의 높은 성공률은 한 고정 설정에서의 값일 뿐이며, 2025~2026년의 교란·감사 연구는 같은 모델이 물체·시점·지시를 조금만 바꿔도 무너진다는 것을 수치로 보여 준다. 시뮬 점수는 자기 로봇에서 실기와의 순위 상관을 확인한 뒤에만 근거로 쓰고, 도입 판단은 축별로 분리한 블라인드 실기 평가의 95% 신뢰구간 하한으로 내려야 한다.

핵심 요점

  • 2026년 6월 감사 연구에서 언어 인코더가 없는 0.09B 프로브가 LIBERO SOTA 근처 점수를 냈고, LIBERO SOTA 주장 중 통계적으로 입증 가능한 것은 19.8%에 그쳤다.
  • LIBERO-PRO와 LIBERO-Plus는 표준 설정에서 90% 이상인 VLA가 물체·초기 상태·카메라 시점 교란에서 0~30% 수준으로 떨어지고 무의미한 지시문에도 같은 궤적을 실행한다는 것을 보였다.
  • 시뮬-실기 상관은 절대 성공률이 아니라 순위 보존(MMRV, Pearson r)으로 판단하며, SIMPLER Visual Matching은 MMRV 0.056·r 0.924인 반면 오프라인 검증 MSE는 0.375·0.308로 실기 순위를 거의 예측하지 못했다.
  • RoboArena는 7개 기관의 이중 블라인드 쌍대 비교로 실기 순위를 매기고, 고정 과제 방식(17개 과제·정책당 44 에피소드)보다 오라클 순위에 가까운 결과를 약 100회 비교 안에서 얻었다.
  • 10회 중 8회 성공의 95% 구간은 49~94%이고 80% 대 90% 정책을 가르려면 정책당 약 200회가 필요하므로, 시행 수와 중단 규칙은 평가 전에 고정해야 한다.
  • vla-eval 재현 작업은 상태 소스·행동 표현·쿼터니언 정규화 같은 미문서 설정 하나가 성공률을 97.8%에서 42%나 0%로 바꾼다는 것을 보였으므로, 공개 수치 재현을 모델 도입의 첫 관문으로 삼아야 한다.

성공률은 "한 고정 설정에서의 성공"일 뿐이다

VLA 논문의 헤드라인 숫자(LIBERO 97%, CALVIN 4.3 등)는 특정 시뮬레이터·카메라·초기 상태·지시문 집합에서 잰 값이다. 2026년 6월 공개된 감사 논문 What Are We Actually Benchmarking in Robot Manipulation?(Jiang 외)은 LIBERO·CALVIN·SimplerEnv·RoboCasa·RoboTwin 2.0을 네 가지 실패 모드 — 지름길 풀이 가능성, 통계적 유의성 부족, 누적 과적합(creeping overfitting), 데이터 출처 의존 — 로 점검했고, 가장 자주 인용되는 LIBERO와 CALVIN이 여러 진단에서 탈락했다고 보고했다. 아래는 2026년 9월 19일 기준으로 공개된 논문·공식 저장소의 수치만으로, 숫자를 어디까지 믿을지와 자체 평가를 어떻게 짤지를 정리한 것이다.

벤치마크가 재는 것과 못 재는 것

벤치마크 설계 의도·프로토콜 공개 자료로 확인된 한계
LIBERO (시뮬 · 코드 MIT, 데이터 CC BY 4.0) 130개 과제, Spatial/Object/Goal/LIBERO-100 스위트. 원래 목적은 멀티태스크·평생학습의 지식 전이 연구. 과제당 50회, 스위트당 500회 언어 인코더가 없는 0.09B DINO+MLP 프로브가 Spatial 99.0 / Object 100.0 / Goal 98.8 / Long 92.4% (2026-06 감사). LIBERO-PRO: 표준 90%+ 모델이 교란 설정에서 0.0%. LIBERO-Plus: 95% → 30% 미만
CALVIN (시뮬 · MIT) 언어 지시를 연달아 수행하는 장기 과제. 환경 A·B·C 학습 → D 평가, 연쇄당 평균 완료 과제 수로 보고 블록 포즈를 학습 범위 안에서 다시 뽑기만 해도 평균 완료 수가 X-VLA −1.03, GR-1 −0.75, RoboFlamingo −0.50
SimplerEnv (시뮬 · 실기 데이터로 학습한 정책을 평가) Google Robot·WidowX 두 셋업에서 RT-1·RT-1-X·Octo 등을 재현. 실기-시뮬 짝 평가 약 1,500 에피소드 강체 조작 한정, 그린스크린 방식은 고정 카메라 전제, 환경 제작에 수작업. 22M DINOv2-S+MLP 정책이 시뮬 안에서 뽑은 스크립트 시연 120개만으로 94.8%(91/96)
RoboArena (실기 · DROID 플랫폼) 7개 기관 분산 평가. 평가자가 과제·환경을 자유롭게 고르되 두 정책을 이중 블라인드 쌍대 비교하고 선호를 집계해 순위 산출. 7개 정책, 600회 이상 쌍대 에피소드 절대 성공률이 아니라 상대 순위. 임바디먼트는 DROID 하나

표를 읽는 법은 두 가지다.

  • 포화된 벤치마크는 회귀 테스트다. 언어를 보지도 않는 90M 프로브가 SOTA 근처라면, LIBERO 97%와 98%의 차이는 조작 능력 차이의 증거가 아니다. "학습·추론 파이프라인이 깨지지 않았다"는 확인용으로만 쓴다.
  • 높은 점수가 지시 이해를 뜻하지 않는다. LIBERO-PRO(OpenVLA·π0·π0.5 평가)에서는 대상 물체를 엉뚱한 물체로 바꿔도 원래 물체를 향해 파지 동작을 했고, 지시문을 fdsgfdsgsd 같은 무의미 문자열로 바꿔도 거의 같은 궤적을 실행했다. 장면-궤적 암기에 가깝다는 뜻이다.

RoboArena가 다른 이유는 과제를 고정하지 않기 때문이다. 논문은 전체 정책을 전체 과제에 돌린 4,284회 평가로 "오라클 순위"를 만들고, 통상적 방식(17개 과제, 정책당 44 에피소드)보다 쌍대 비교 집계가 오라클에 더 가까운 순위를 낸다고 보고했다. 100회 안팎의 쌍대 비교로 순위가 수렴한다는 점도 실무적으로 중요하다.

시뮬-실기 상관: 절댓값이 아니라 순위를 본다

SIMPLER 논문이 정착시킨 지표는 두 개다. Pearson r(선형 상관)과 MMRV(Mean Maximum Rank Violation — 시뮬이 정책 순위를 뒤집는 정도, 낮을수록 좋음). Google Robot 셋업 평균값은 다음과 같다.

평가 방식 MMRV ↓ Pearson r ↑
검증 MSE(오프라인) 0.375 0.308
SIMPLER Variant Aggregation 0.143 0.778
SIMPLER Visual Matching 0.056 0.924

오프라인 검증 손실은 실기 순위를 거의 예측하지 못한다. 체크포인트 선택을 val loss로만 하는 팀은 이 표를 기억해야 한다. 후속 연구의 흐름은 이렇다.

  • PolaRiS(2025-12): 실제 장면을 짧은 영상으로 스캔해 가우시안 스플래팅 기반 시뮬로 바꾼다. DROID VLA 4종(π0, π0-FAST, PaliGemma-binning, π0.5), 짝 환경 6곳, 정책·환경당 실기 20회로 평균 r=0.9, 최악 0.81. 같은 논문은 거의 모든 정책이 LIBERO에서 90~95%인데 실기에서는 상위부터 하위까지 전 범위에 흩어졌다고 적었다.
  • A Practical Recipe…(2026-06): DROID에서 VLA 5종(π0, π0-FAST, π0.5, GR00T N1.6·N1.7)을 실기와 시뮬 3종(VLA-Arena/MuJoCo, SIMPLER/Sapien, REALM/Isaac Sim)에서 짝 평가했다. 레시피는 ① 실기 순위와 실패 패턴을 가장 잘 보존하는 시뮬을 고르고(REALM) ② 평가 분포의 시뮬 데이터 소량으로 정책을 짧게 후학습하는 것. 후학습 전후 Pearson 0.785 → 0.878, MMRV 0.030 → 0.015. 격차는 물체 불일치보다 시뮬레이터 수준의 충실도가 지배하며, 좋은 시뮬은 "정책이 실기에서처럼 실패하게" 만들어야 한다는 결론이다.
  • SureSim(2025-10): 소수의 실기-시뮬 짝 평가로 시뮬 편향을 보정(prediction-powered inference)해 신뢰구간을 내고, 하드웨어 평가를 약 20~25% 줄였다.

의사결정 기준은 단순하다. 시뮬 점수를 도입 근거로 쓰려면 자기 로봇·자기 과제에서 짝 평가로 상관을 먼저 잰다(공개 연구 규모는 정책 4~5개 × 환경 몇 곳 × 20회 수준). 상관을 확인하지 못한 시뮬은 회귀 게이트로만 쓴다.

일반화 축을 분리해서 보고하라

STAR-Gen(2025-03, Stanford·Google DeepMind)은 VLA의 입출력에 맞춰 일반화를 시각·의미·행동 세 축으로 나눈다. BridgeV2 기반 실기 평가에서 OpenVLA·MiniVLA·π0를 돌린 결과, 인터넷 규모 언어 사전학습에도 의미 축 일반화가 특히 약했다.

질문 대응 축 공개 근거
새 물체 시각+의미 π0.5: 학습 장소가 늘수록 분포 밖 물체 성능도 오르지만 분포 내보다 느리다
새 환경 시각(배경·조명·시점) LIBERO-Plus 7개 교란(배치·시점·초기 상태·언어·조명·배경·센서 노이즈) 중 카메라 시점·로봇 초기 상태에 특히 민감. π0.5는 학습에 없던 실제 가정 3곳, 과제당 10회, 학습 장소 3→104곳 스케일링으로 평가
새 지시 의미 LIBERO-Plus: 언어 변형에 둔감 — 지시를 사실상 무시한다는 뜻
새 임바디먼트 행동 위 벤치마크는 모두 고정 임바디먼트(SimplerEnv 2종, RoboArena 1종). 직접 재는 수밖에 없다

현장 관점에서 중요한 함의: 카메라 브래킷을 몇 cm 옮기는 것이 "새 방"보다 큰 하락 요인일 수 있다. 축을 섞어 평균 내면 이 사실이 묻힌다.

시행 횟수와 신뢰구간

이항분포 가정으로 직접 계산한 95% Wilson 구간이다.

관측 95% 구간
8/10 (80%) 49~94%
16/20 (80%) 58~92%
40/50 (80%) 67~89%
80/100 (80%) 71~87%
400/500 (80%) 76~83%
  • 10회 시연의 "80%"는 50%짜리 정책과 구분되지 않는다.
  • 두 정책을 가르는 데 필요한 정책당 시행 수(양측 α=0.05, 검정력 0.8, 직접 계산): 80% vs 90%는 약 200회, 60% vs 80%는 약 80회, 50% vs 80%는 약 40회.
  • STEP(Snyder 외, RSS 2025)은 로봇 평가가 보통 10~60회에 그친다는 점에서 출발한다. 8%p 차이는 약 100회로도 α=0.05 유의에 못 미쳤고, 순차 검정으로 시행 수를 최대 32% 줄였다. 결과를 보고 시행을 추가하는 것은 p-hacking이라는 경고도 담겨 있다.
  • 2026-06 감사 논문에 따르면 LIBERO SOTA 주장 중 통계적으로 입증 가능한 것은 **19.8%**뿐이다.
  • Kress-Gazit 외(2024-09)의 권고 네 가지: 실험 조건 명시(시행 수·초기 조건·성공 기준), 성공률을 보완하는 지표, 통계 분석, 실패 모드의 서술적 기록.

재현성: 평가 설정도 모델의 일부다

vla-eval(Choi 외, arXiv 2026-03 v1 · 2026-09-14 v3, Apache 2.0)은 모델 서버와 Docker 격리 벤치마크를 분리한 하니스로, 6개 코드베이스 × 3개 벤치마크의 공개 수치를 재현하면서 문서화되지 않은 함정을 기록했다.

함정 영향
X-VLA(LIBERO): 고유수용 상태 소스 선택 오류 97.8% → 42%
X-VLA: 절대/델타 행동 표현 혼동 0%
OpenVLA-OFT: 쿼터니언 부호(antipodal) 정규화 불일치 LIBERO-Goal 97→83%, Long 95→56%
OpenVLA: 평가 시 center crop 누락 약 −3%p
GR00T(SimplerEnv): EE 포즈 입력 누락 30~55% → 0%

재현 결과 LIBERO는 대체로 ±1%p 안(OpenVLA 76.2, π0.5 97.7, OpenVLA-OFT 96.7)이었지만, SimplerEnv는 GR00T N1.6 59.7%(−8.0), DB-CogACT 63.5%(−6.0)로 벌어졌다. H100 1장에서 LIBERO 2,000 에피소드를 약 18분에 돌린다. 모델 도입의 첫 관문은 **"공식 체크포인트로 공개 수치를 ±2%p 안에 재현"**으로 잡는 것이 합리적이다. 재현이 안 되면 모델이 아니라 전처리·행동 표현·상태 소스부터 의심한다.

자체 평가 프로토콜 설계

  1. 고정 시나리오 카드: 과제·초기 배치·조명·카메라 포즈·지시문·성공 기준·제한 시간을 파일로 고정하고 버전 관리한다.
  2. 축별 분리: 기준(in-dist) / 새 물체 / 새 환경 / 새 지시 / 새 임바디먼트를 따로 집계한다. 평균 하나로 합치지 않는다.
  3. 블라인드 A/B: RoboArena처럼 평가자가 어떤 정책인지 모르게 하고 같은 초기 조건에서 번갈아 돌린다.
  4. 진행도 루브릭: 성공/실패 이진값에 더해 0~100 진행도(RoboArena), 단계별 완료율(π0.5)을 기록한다.
  5. N과 중단 규칙 사전 등록: 시행 수를 미리 정하거나 STEP 같은 순차 검정을 쓴다.
  6. 실패 분류: 인식 오류(엉뚱한 물체) / 지시 무시 / 파지 실패 / 배치·정밀 / 멈춤·회복 실패 / 안전 개입 / 시스템(지연·통신)으로 태깅하고 영상을 남긴다.
  7. 보고 형식: k/N, 95% 구간, 축별 표, 실패 분포를 함께 낸다.
scenario: pick_place_bin_v3
axis: new_object            # baseline | new_object | new_env | new_instruction | new_embodiment
init: {object_pose_set: grid_12, camera_pose: cam_front_v2, lighting: 500lux}
instruction: "파란 컵을 왼쪽 상자에 넣어"
success: "물체가 상자 안 + 그리퍼 개방 + 60s 이내"
progress_rubric: {reach: 25, grasp: 50, transport: 75, place: 100}
trials: 50                  # 사전 등록, 결과를 보고 추가 금지
blind: true
failure_tags: [perception, ignore_instruction, grasp, place, stall, safety_stop, system]

도입 판단은 점추정이 아니라 95% 구간의 하한으로 한다. "하한이 목표 성공률 이상이고, 안전 개입 0건, 축별 최저값이 허용선 이상"처럼 기준을 평가 전에 적어 두면 데모 영상에 흔들리지 않는다.

조작 밖으로 — 모바일 로봇과 내비게이션 파운데이션 모델

주행 파운데이션 모델은 19M~50M 급 이미지 목표 정책(GNM·ViNT·NoMaD)과 7~8B 급 언어 지시 VLA(NaVid·Uni-NaVid·NaVILA·NavFoM·OmniVLA)로 갈리며, 후자는 추론 한 번에 0.2~1.5초가 걸려 대부분 로봇 밖 GPU 서버에서 돈다. 독립 실세계 평가에서 학습 정책 단독은 충돌과 장소 혼동이 잦았으므로, 학습 정책이 웨이포인트를 내고 Nav2 제어기와 스캔 직결 안전 계층이 집행하는 하이브리드가 2026년 9월 기준 현실적인 구성이다.

핵심 요점

  • ViNT 는 31M 파라미터·85×64 입력·4 Hz 로 웨이포인트를 내고 PD 제어기가 추종하며, NoMaD 는 19M 로 ViNT 의 335M 서브골 확산 시스템(탐색 성공률 77%·충돌 1.7회)을 98%·0.2회로 앞섰다.
  • 7~8B 내비 VLA 의 추론 속도는 NaVid 1.2~1.5초/액션(A100), Uni-NaVid 약 5 Hz(A100), NaVILA 약 1 FPS(RTX 4090), NavFoM 최대 0.5초/궤적(RTX 4090)으로, Nav2 기본 제어 주기 20 Hz 와는 자릿수가 다르다.
  • 2026년 6월 개정된 제로샷 실세계 평가는 GNM·ViNT·NoMaD·NaviBridger·CrossFormer 모두에서 잦은 충돌, 비슷한 장소의 혼동, 분포 이동 시 성능 저하를 확인했고 충돌 회피를 로봇 내장 제어기에 넘긴 뒤에야 시각 주행 능력을 분리해 측정했다.
  • OmniVLA 결과에서 이미지 목표 주행은 약 50M 의 edge 판도 7B 와 같은 성공률 1.00 을 냈고 격차는 언어 지시(0.60 대 0.73)에서만 났으므로, 7B 급은 언어 목표가 제품 요구일 때만 값을 한다.
  • 학습 기반이 의미 있는 곳은 사전 지도를 만들 수 없는 공간·의미 기반 목표·단안 카메라 기체이고, 고정 레이아웃·정밀 도킹·다중 로봇 교행은 SLAM+Nav2 가 여전히 낫다.
  • 하이브리드의 세 가지 설계 규칙은 인터페이스를 웨이포인트로 고정할 것, 원격 추론의 낡은 출력을 포즈 버퍼로 재투영하거나 폐기할 것, 코스트맵과 플래너를 우회하는 Collision Monitor 급 필터를 학습과 무관하게 맨 아래에 둘 것이다.

조작 VLA와 같은 잣대로 보면 안 되는 이유

조작 쪽 VLA 논의를 모바일 로봇에 그대로 옮기면 판단이 틀어진다. 이유는 세 가지다.

  • 기준선이 이미 강하다. 조작에는 "범용 고전 해법"이 없지만, 주행에는 SLAM + Nav2 라는 검증된 스택이 있다. 학습 모델은 빈자리를 메우는 게 아니라 돌아가는 시스템을 이겨야 한다.
  • 실패 비용의 성격이 다르다. 팔은 작업 셀 안에서 실패하지만 이동체는 사람 사이에서 실패한다. 성공률 90% 는 조작에선 데모감이고, 주행에선 열 번에 한 번 부딪힌다는 뜻이다.
  • 출력이 관절 토크가 아니라 "어디로 갈지"다. 그래서 학습 정책과 고전 제어기 사이에 웨이포인트라는 깔끔한 절단면이 있고, 이 절단면이 이 섹션의 결론(하이브리드)을 가능하게 한다.

아래 수치는 모두 2026-09-19 기준으로 논문 본문·공식 저장소에서 직접 확인한 것이며, 확인하지 못한 칸은 "미기재"로 남겼다.

계보 1 — 이미지 목표 기반: GNM → ViNT → NoMaD

UC Berkeley 계열의 세 모델은 "현재 카메라 영상 + 목표 이미지 → 상대 웨이포인트"라는 같은 문제를 푼다. 지도도, 깊이도, 오도메트리도 입력에 없다. 장거리는 토폴로지 그래프(이미지 노드)를 따로 두고, 정책은 다음 노드까지만 책임진다.

모델 파라미터 입력 학습 데이터 실행 라이선스
GNM (arXiv 2210.03370) 초록 미기재 RGB + 목표 이미지 60시간, 로봇 6종 미기재 MIT
ViNT (CoRL 2023) 31M (탐색용 서브골 확산 모델은 별도 318M) 85×64 RGB, 과거 5프레임 본문 "100시간 이상·8개 플랫폼", 부록 표 7 은 수집 160h 중 80h 사용 4 Hz, 예측 웨이포인트를 PD 제어기가 추종 MIT
NoMaD (arXiv 2310.07896) 19M 96×96 RGB, 과거 5스텝 GNM + SACSoN, 100시간 이상 확산 디노이징 10스텝, Jetson Orin 급 온보드 (Hz 미기재) MIT

세 모델은 robodhruv/visualnav-transformer 한 저장소에 체크포인트와 함께 MIT 로 공개돼 있고, 참조 배포 구성은 LoCoBot + Jetson Orin Nano + 광각(어안) RGB 카메라다.

읽어야 할 수치는 두 개다.

  • NoMaD 는 "작아서 이겼다." 논문 표 1 에서 미지 환경 탐색 성공률 98%·평균 충돌 0.2회로, ViNT 의 서브골 확산 시스템(335M, 77%, 1.7회)을 15배 적은 파라미터로 앞섰다. 목표 마스킹으로 탐색과 목표 주행을 한 정책에 합친 효과다.
  • ViNT 의 적응 비용은 시간 단위다. 학습에 없던 과제(CARLA 도로 주행)에서 파인튜닝 없이 40%, 1시간 미만의 데이터로 80% 성공을 보고했고, 같은 도메인만으로 5배 데이터를 학습한 모델보다 나았다. 논문은 새 환경·새 기체 적응에 "1시간 분량의 주행 데이터"를 기준선으로 제시한다.

독립 재현이 보여준 한계

2026년 6월 개정된 Polytechnique Montréal 의 제로샷 실세계 평가(arXiv 2603.25937)는 GNM·ViNT·NoMaD·NaviBridger·CrossFormer 를 로봇 2종·환경 5곳에서 돌렸다. 결론은 세 줄이다. (a) 확산·트랜스포머 모델도 충돌이 잦다 — 기하 이해가 없다. (b) 비슷하게 생긴 장소를 구분 못 한다 — 반복적인 복도에서 목표 도착을 오판한다. (c) 블러·역광 같은 분포 이동에 성능이 떨어진다.

모델 복도 충돌 사무실 루프 충돌
GNM 0/3 5/10
ViNT 0/3 1/10
NoMaD 3/3 2/10
NaviBridger 2/3 9/10
CrossFormer 3/3 —

저자들은 이후 실험에서 충돌 회피를 Spot 내장 제어기에 넘기고 시각 주행 능력만 따로 쟀다. 학습 정책 단독으로는 물리적으로 안전하지 않다는 것을 평가 설계로 인정한 셈이다.

계보 2 — 언어 지시 주행(VLN)과 내비 VLA

두 번째 계보는 7~8B VLM 을 주행 데이터로 미세조정해 "복도 끝에서 우회전해 소파 앞에 서라" 같은 지시를 따른다. 입력은 대부분 단안 RGB 영상뿐이다.

모델 백본 학습 데이터 추론 속도·위치 실세계 결과 공개
NaVid (2024-02) Vicuna-7B + EVA-CLIP 내비 510k + 웹 763k 샘플 액션당 1.2~1.5초, 원격 A100 서버 지시 200개, 약 66% —
Uni-NaVid (2024-12) Vicuna-7B + EVA-CLIP 내비 3.6M 샘플, 4개 과제 통합 평균 0.2초, A100 에서 약 5 Hz, 한 번에 다음 4액션 원격 A100 MIT, 가중치 공개
NaVILA (2024-12) VILA 계열 8B YouTube 투어 영상 2K + R2R/RxR-CE 등 RTX 4090 에서 약 1 FPS (AWQ W4A16 으로 메모리 절반·속도 약 40%↑) 지시 25개 88%, 복잡 지시 75% Apache-2.0
NavFoM (2025-09) Qwen2-7B 내비 8.02M + QA 4.76M 샘플, 학습 4,032 H100 GPU-시간 8-웨이포인트 궤적에 최대 0.5초, 원격 RTX 4090 사족·휴머노이드·드론·바퀴 미확인
OmniVLA (2025-09) OpenVLA 7B (edge 판은 ViNT 기반 약 50M) 9,500시간, 10개 플랫폼 액션 청크 8개 @3 Hz(2.4초분), RTX 4090 PC 에서 원격 명령 표 2 참조 MIT

벤치마크로는 NaVILA 가 R2R-CE Val-Unseen 성공률 54.0 으로 NaVid(37.0)를 17%p 앞선다. OmniVLA 표 2 에서는 이미지 목표 성공률이 ViNT 0.50·NoMaD 0.63 인 데 비해 OmniVLA 와 edge 판이 모두 1.00 이고, 언어 지시는 7B 가 0.73, edge 가 0.60 이다. 이미지·좌표 목표라면 50M 급으로 충분하고, 7B 가 값을 하는 곳은 언어 이해뿐이라는 뜻이다.

표에서 읽어야 할 진짜 메시지

  • 온보드로 도는 7B 는 없다. NaVid·Uni-NaVid 는 A100, NaVILA·NavFoM·OmniVLA 는 RTX 4090 에서 돌렸고 대부분 로봇 밖 서버다. OmniVLA 저장소는 디버그 모드에도 GPU 메모리 20GB 이상을 요구한다.
  • 0.2~1.5초 주기는 제어 루프가 아니다. Nav2 기본 파라미터의 controller_frequency 는 20 Hz 이고 MPPI 는 56스텝×0.05초(2.8초 지평)를 매 주기 2,000개 샘플로 굴린다. 1 m/s 로봇은 VLM 한 번 추론하는 1.2초 동안 1.2 m 를 "눈 감고" 간다.
  • 그래서 최신 설계는 전부 2계층이다. NaVILA 는 VLA 가 "75cm 전진" 같은 중간 수준 언어 명령만 내고 실시간 보행은 RL 정책이 맡는다. NavFoM 은 예측 궤적을 각 로봇의 기성 로컬 플래너로 추종시킨다. DualVLN(arXiv 2512.08186)은 7B VLM 을 2 Hz, 경량 확산 정책을 30 Hz 로 분리했다.

고전 스택과의 비교 — 언제 의미 있고 언제 아닌가

조건 권장 근거
고정 레이아웃(창고·공장·병원 복도), 반복 경로, cm 급 도킹 고전 스택 결정적 거동·재현 가능한 실패·안전 규격 대응. 반복 복도는 학습 모델의 지각 혼동이 실측된 조건
사전 지도를 만들 수 없거나 매주 바뀌는 공간, 보도·캠퍼스·오프로드 학습 정책 + 고전 집행 ViNT/NoMaD 는 지도 없이 탐색, 새 기체 적응이 시간 단위
목표가 좌표가 아니라 의미("정수기 옆 회의실") VLM 을 목표 생성기로 7B 의 우위는 언어 이해에만 있음
센서가 단안 카메라뿐인 저가 기체 학습 정책, 단 근접 안전 센서는 별도 시각만으로는 장애물 기하를 안정적으로 부호화하지 못함
다중 로봇 교통 관제, 좁은 통로 교행 고전 스택 상대 로봇이 예측할 수 있는 거동이 필요

경쟁 환경 데이터도 같은 방향이다. ICRA 2024 BARN Challenge 회고(arXiv 2407.01862)에 따르면 실물 대회에서 종단간 모방학습이 처음 우승했지만, 그 팀도 별도 안전 점검 계층을 하드웨어에 얹었고 모든 참가팀이 유한상태기계 기반 하이브리드였다.

하이브리드 구성 — 학습은 "어디로", 고전은 "어떻게·멈춤"

[카메라] ─▶ 학습 정책 (온보드 4 Hz 급 또는 원격 0.2~1.5 s/회)
             출력: 로봇 좌표계 웨이포인트 N개 + 관측 타임스탬프
        ─▶ 지연 보정: 포즈 버퍼로 관측 시점→현재 SE(2) 재투영, 만료분 폐기
        ─▶ Nav2 controller (MPPI/RPP, 20 Hz) + 로컬 코스트맵
        ─▶ velocity smoother ─▶ Collision Monitor ─▶ cmd_vel ─▶ 드라이버 / 안전 PLC
  • 인터페이스는 웨이포인트로 고정한다. 속도 명령을 직접 내는 정책은 교체도, 검증도 어렵다. AsyncShield(arXiv 2604.24086)는 클라우드 VLA 출력을 20 cm 간격 웨이포인트 5개로 표준화해 모델을 건드리지 않고 끼운다.
  • 낡은 의도는 기하로 고친다. 원격 추론이면 웨이포인트는 "과거 자세 기준"이다. 포즈 버퍼로 현재 프레임에 재투영하고, 만료 시간을 넘긴 출력은 버린다. UCLA·Amazon 의 2026-06 연구(arXiv 2606.20458)는 VLM 질의가 1~3초 걸려 5~20 Hz 루프를 직접 몰 수 없다는 전제에서, VLM 을 플래너 후보 궤적의 선택기로만 써 약 2,000개 난제 장면에서 ADE 를 30% 줄이고 5초 지연에서도 시뮬 성공률 80% 이상을 유지했다.
  • 마지막 필터는 학습과 무관해야 한다. Nav2 Collision Monitor 는 README 표현대로 "코스트맵과 궤적 플래너를 우회해" 센서 데이터로 직접 비상정지 수준의 충돌을 막는 노드다. 기본 설정은 cmd_vel_smoothed → cmd_vel 필터, 소스 타임아웃 1.0초, approach 모델 충돌 전 여유 1.2초다. 상위가 무엇을 내든 이 계층의 판정이 이긴다.

AMR·서비스 로봇 도입 체크리스트

  1. 50M 급부터 시작한다. NoMaD(19M)·ViNT(31M)·OmniVLA-edge 는 Jetson 급에서 돌고 MIT 라 상용 검토가 쉽다. 7B 는 언어 목표가 제품 요구일 때만.
  2. 카메라 광학을 맞춘다. 참조 구성은 광각 어안이다. 화각이 다르면 제로샷 수치는 재현되지 않는다 — 자사 기체로 1~2시간 수집해 파인튜닝할 예산을 잡는다.
  3. 성공률만 보지 않는다. 충돌 발생률, 기준 경로 이탈, 목표 도착 오판을 따로 잰다. 반복 구조(호텔 복도·병동)에서 반드시 시험한다.
  4. 네트워크 단절 시 거동을 정의한다. 원격 추론 구성이면 출력 만료 → 감속 → 정지 → 고전 복귀 경로가 설계에 있어야 한다.
  5. 안전 기능은 학습 밖에 둔다. 근접 정지는 스캔 직결 필터와 인증된 안전 센서·PLC 가 맡고, 학습 정책은 안전 논거에 포함하지 않는다.
  6. 가중치와 데이터 라이선스를 따로 본다. 코드가 MIT·Apache-2.0 이어도 백본(Vicuna·LLaMA 계열)과 학습 데이터(YouTube 영상 등)의 조건은 별개다.

도입 판단 — 작은 로봇 회사의 12개월 계획

작은 로봇 회사의 기본값은 상업 이용이 허용된 오픈 가중치(π0/π0.5, GR00T N1.7, SmolVLA)를 자기 로봇 시연 1~20시간으로 후학습하는 것이고, 비상정지·속도·작업영역 같은 안전 기능은 학습 정책 밖의 결정론 계층에 둬야 한다. 가중치와 라이선스는 세대마다 바뀌므로 12개월 뒤에도 남는 자산은 모델 중립 포맷의 자기 데이터와 봉인된 평가 세트다.

핵심 요점

  • 사전학습은 π0 가 로봇 데이터 1만 시간 이상, GR00T N1.7 이 1인칭 사람 영상 20,854시간을 쓴 규모라 작은 회사의 선택지가 아니며, 공개 수치상 후학습은 시연 1~20시간(π0) 또는 50~100회(Gemini Robotics On-Device)로 가능하다.
  • 라이선스는 계열이 아니라 버전 단위로 확인해야 한다 — GR00T 는 N1.5 카드가 비상업 전용이고 N1.7 에서 NVIDIA Open Model License 로 상업 이용이 열렸으며, OpenVLA 는 코드가 MIT 여도 가중치는 Llama Community License 를 승계한다.
  • NVIDIA Open Model License 는 파생 모델 소유권을 인정하지만 가드레일 우회 시 권리 자동 종료, 재배포 고지문, Cosmos 표시 의무 같은 조건이 붙는다.
  • EU 기계류 규정 2023/1230 은 2027년 1월 20일부터 의무 적용되고 머신러닝이 안전 기능을 보장하는 부품·기계를 제3자 평가 대상 고위험 범주로 두므로, 학습 정책은 동작 제안까지만 맡기고 정지·제한·감시는 결정론 코드와 하드웨어 경로에 둔다.
  • 50스텝 액션 청크를 내는 모델은 추론이 밀리면 낡은 계획을 계속 실행하므로 청크 나이와 추론 하트비트 감시가 속도 제한만큼 중요하다.
  • 데이터 moat 는 시연 시간의 양이 아니라 자기 임보디먼트의 실패·개입 에피소드, 모델 중립(LeRobot) 포맷, 봉인된 고정 평가 세트, 고객 계약으로 확보한 학습 이용권에서 나온다.

결론부터: 기본값은 "fine-tune, 그리고 안전은 모델 밖에"

2026년 9월 19일 기준, 상업 이용이 가능한 오픈 가중치 VLA 는 최소 세 계열(π0/π0.5, GR00T N1.7, SmolVLA)이고 모두 자기 로봇 데이터로 후학습하는 것을 전제로 나온다. 반대로 사전학습 규모는 따라갈 수 없다. π0 는 1만 시간이 넘는 로봇 데이터, GR00T N1.7 은 20,854시간의 1인칭 사람 영상을 썼다. 텔레옵 장비 한 대가 하루 순수 4시간을 모은다고 가정하면 1만 시간은 2,500 로봇·일이다. 그래서 12개월 계획의 질문은 "어떤 모델을 만들까"가 아니라 "어떤 과제에, 어떤 라이선스의 가중치를, 몇 시간의 자기 데이터로 맞추고, 무엇을 모델에 맡기지 않을까" 다.

Build vs Fine-tune vs Buy 의사결정표

선택지 고르는 조건 공개된 비용 수치 걸리는 지점
안 쓴다 (고전 제어+소형 전용 정책) 주행·추종·정형 픽앤플레이스처럼 상태 공간이 좁다 기존 스택 물체·배치 다양성이 커지면 규칙이 폭발
Fine-tune (기본값) 조작 과제이고 물체·장면이 매번 다르며, 자기 로봇 시연을 모을 수 있다 π0: 시연 1~20시간, LoRA 22.5GB↑·풀 파인튜닝 70GB↑ GPU. OpenVLA LoRA: A100 80GB 1장(최소 약 27GB) 새 임보디먼트는 zero-shot 이 안 된다 — OpenVLA 모델 카드가 직접 명시
Buy (비공개 모델·파트너십) 수집 인력이 없고 벤더가 내 로봇을 지원한다 Gemini Robotics On-Device: 시연 50~100회로 적응(2025-06-24 발표) 접근이 trusted tester 로 제한. 데이터 귀속·오프라인 동작·단가를 계약으로 확보해야 한다
Build (사전학습부터) 수천 시간 데이터와 학습 클러스터가 이미 있다 π0 급 = 로봇 데이터 1만 시간+ 작은 회사에는 해당 없음

첫 줄을 진지하게 보라. VLA 가 값을 하는 곳은 언어로 지정되는 다양한 조작이다. 과제를 한 문장으로 고정할 수 있고 실패가 기하학적으로 정의된다면 VLA 는 추론 비용과 검증 부담만 늘린다. Physical Intelligence 도 공개 글에 "π0 may or may not work for you" 라고 적었다 — 자기 로봇이 ALOHA·DROID 같은 공개 플랫폼과 다르기 때문이다.

오픈 가중치 라이선스 — 모델 카드에서 직접 확인한 것

모델 파라미터 제어·추론 사전학습 데이터 라이선스 상업 이용
π0 / π0.5 (openpi) π0 3.3B (액션 전문가 300M) 최대 50Hz, 50스텝 청크, RTX 4090 추론 73ms. 추론 메모리 8GB↑ 로봇 데이터 1만 시간+ (7개 로봇 구성·68개 과제) 저장소 Apache-2.0, LICENSE_GEMMA.txt 동봉 가능. Gemma 조건을 함께 읽을 것
GR00T N1.7-3B (2026-04-17) 3B (Cosmos-Reason2-2B + 32층 DiT) H100+TensorRT 27.9ms = 35.9Hz (PyTorch eager 85.8ms) 1인칭 사람 영상 20,854시간 외 코드 Apache 2.0, 가중치 NVIDIA Open Model License 카드 문구 "ready for commercial/non-commercial use"
GR00T N1.5 / N1.6 3B 카드에 수치 없음 실기·합성 혼합 "Nvidia License" N1.5 카드 "ready for non-commercial use", N1.6 카드는 OneWay Noncommercial License 로 연결
OpenVLA-7B 7B급 (HF 표기 8B) 저장소에 수치 없음 Open X-Embodiment 97만 에피소드 코드 MIT, 가중치는 Llama-2 파생이라 Llama Community License 승계 가능하나 Llama 조건 확인
SmolVLA 450M CPU·소비자 GPU 1장. 비동기 추론으로 과제 완료 13.75초→9.7초 커뮤니티 데이터셋 487개, 약 1천만 프레임, 3만 에피소드 미만 Apache-2.0 가능
Gemini Robotics On-Device 비공개 비공개 비공개 비공개 가중치 계약

(π0 수치는 논문, GR00T 구버전은 N1.5·N1.6 카드 기준.)

표에서 읽어야 할 것 네 가지.

  • 같은 계열도 버전마다 라이선스가 다르다. GR00T 는 N1.5·N1.6 이 비상업, N1.7 에서 상업 허용으로 바뀌었다. "GR00T 는 오픈"이라는 기억으로 구버전 체크포인트를 제품에 넣으면 위반이다. 저장소에 모델 ID + 리비전 해시 + 라이선스 전문 사본을 매니페스트로 고정하라.
  • NVIDIA Open Model License 는 상업 이용과 파생 모델 소유권을 인정하지만 조건이 있다. 모델에 포함된 가드레일을 동등한 대체 없이 우회하면 권리가 자동 종료되고, 재배포 시 고지문이 필요하며, Cosmos 모델에는 "Built on NVIDIA Cosmos" 표시 의무가 붙는다. N1.7 백본이 Cosmos-Reason2 이므로 해당 여부를 법무로 확인하라.
  • "오픈"은 최신이 아니다. openpi 에는 π0·π0-FAST·π0.5 까지 올라와 있고, π0.6 공개를 묻는 이슈 #791(2025-11-18)은 이 글 작성 시점까지 메인테이너 답변 없이 열려 있다. 공개 가중치는 벤더 최신 세대보다 뒤라는 전제로 계획하라.
  • 데이터셋 라이선스는 가중치와 별개다. Open X-Embodiment는 코드 Apache 2.0·그 외 CC-BY 4.0 이지만 구성 데이터셋마다 인용·조건이 따로 있다. 공개 데이터를 섞어 학습한다면 데이터셋 단위 매니페스트가 필요하다.

덧붙여, 검색 상위의 비교 사이트 중에는 OpenVLA 를 Apache 2.0 으로, π0 를 "다운로드 불가"로 적은 곳이 있다. 둘 다 틀렸다. 라이선스 판단의 근거는 모델 카드와 저장소 LICENSE 파일뿐이다.

안전·인증: 학습 정책은 "제안"까지, 안전 기능은 결정론 계층에

EU 기계류 규정 (EU) 2023/1230 은 2027년 1월 20일부터 의무 적용된다. 부속서 I 의 고위험 범주에 "안전 기능을 보장하는, 머신러닝 기반의 완전·부분 자가진화 동작을 갖는 안전 부품"과 그런 시스템을 내장한 기계가 들어가 있고, 이 범주는 제3자 적합성 평가가 강제된다(Baker McKenzie 해설). 설계 원칙은 단순하다. 학습 모델이 안전 기능을 "보장"하는 구조를 만들지 않는다.

국내도 같다. 실외이동로봇 운행안전인증(지능형로봇법 제40조의2, 최대 15km/h·500kg 이하)의 심사 항목은 운행속도·동적 특성·주변 인식·비상정지·횡단보도 통행·관제장치처럼 재현 가능한 시험으로 증명하는 성질이다. 확률적 정책의 성공률로는 서류를 채울 수 없다. Google DeepMind 도 Gemini Robotics On-Device 발표에서 모델을 저수준 안전 필수 제어기와 연결해 실행하라고 권고했다.

계층 담당 학습 허용
과제 해석·동작 생성 VLA 허용 (가중치 동결·서명·버전 관리)
궤적 검증 속도·가속도·힘·작업영역 한계, 충돌 검사 불허 — 결정론 코드
감시 추론 하트비트, 청크 나이, 센서 유효성 불허
정지 비상정지·보호정지, 정책과 독립된 경로 불허 — 가능하면 하드웨어
# 정책 출력이 반드시 통과하는 거버너 (값은 위험성 평가에서 정한다 — 아래는 예시)
governor:
  max_tcp_speed_mps: 0.25
  workspace: {frame: base, box_min: [0.2, -0.4, 0.02], box_max: [0.8, 0.4, 0.6]}
  chunk_max_age_ms: 200          # 오래된 액션 청크는 폐기하고 감속 정지
  policy_heartbeat_timeout_ms: 300
  on_violation: clamp_then_stop
estop: {path: hardware, depends_on_policy: false}

50스텝 청크를 내는 모델은 추론이 밀리면 낡은 계획을 계속 실행한다. 그래서 chunk_max_age_ms 같은 감시가 속도 제한만큼 중요하다. 현장 온라인 학습(배포 후 자가 갱신)은 금지하고, 가중치 교체는 서명된 OTA·카나리·롤백으로만 한다.

데이터를 moat 로 만드는 법

가중치 세대는 계속 바뀌고 라이선스도 함께 바뀐다(GR00T N1.5→N1.7 이 그 예다). 남는 자산은 내 로봇·내 현장의 데이터와 평가 장치다. 근거는 공개 수치에 있다. OpenVLA 는 새 임보디먼트에 zero-shot 이 안 된다고 명시하고, π0 는 1~20시간, Gemini 는 50~100회 시연을 요구한다. SmolVLA 는 커뮤니티 데이터 사전학습만으로 SO100 실기 성공률이 51.7%→78.3% 로 올랐다. 즉 승부는 "누가 같은 임보디먼트의 좋은 시연을 갖고 있나"다.

  • 모델 중립 포맷으로 저장한다. GR00T N1.7 후학습과 SmolVLA 가 모두 LeRobot 데이터셋 포맷을 쓴다. 특정 모델 전용 포맷에 묶이면 베이스 교체 때 자산이 증발한다.
  • 에피소드마다 남길 것: 제어 주기로 동기화된 카메라·고유수용·액션, 캘리브레이션, 로봇·펌웨어·그리퍼 버전, 작업자 ID, 언어 지시, 성공/실패 라벨, 사람 개입 시각.
  • 실패와 개입이 가장 비싸다. 성공 시연은 누구나 모은다. 현장에서 정책이 막힌 순간과 사람이 고친 궤적은 그 현장에 들어간 회사만 가진다.
  • 고정 평가 세트를 데이터와 분리해 봉인한다. 장면·물체·조명 조합을 정해 두고 베이스 모델을 바꿀 때마다 같은 세트로 잰다.
  • 권리를 계약으로 확보한다. 고객 현장 영상의 학습 이용권, 얼굴·번호판 등 개인정보 처리, 계약 종료 후 파생 가중치의 귀속을 도입 계약서에 넣는다.

12개월 로드맵

기간 할 일 통과 기준
1~2개월 과제 1개 선정, 고전 기준선 구현, 거버너·로깅을 먼저 만든다 기준선 성공률 측정 완료, VLA 필요성 go/no-go
3~4개월 텔레옵·수집 파이프라인, 시연 50~100회, SmolVLA 와 π0/π0.5 LoRA 로 첫 후학습 고정 평가 세트에서 기준선과 비교, 시행 수·신뢰구간 명시
5~7개월 시연 1~20시간으로 확대, 베이스 2종 동일 평가, 목표 하드웨어에서 지연 실측, 섀도 모드 목표 제어 주기에서 청크 고갈 0건
8~10개월 고객 현장 1곳 감독 파일럿, 개입→재라벨→재학습 주기 가동 시간당 개입 횟수가 주 단위로 감소
11~12개월 위험성 평가서·안전 기능 분리 문서, 라이선스 감사, buy 전환 여부 재판단 인증기관 사전 상담 완료

하지 말아야 할 것

  • 사전학습부터 시작하지 마라. 모을 수 있는 수십 시간과 π0 의 1만 시간 사이는 수백 배 차이다.
  • "모델이 멈추는 법을 배웠다"를 안전 근거로 쓰지 마라.
  • LIBERO 같은 시뮬 벤치마크 점수로 현장 성공률을 추정하지 마라.
  • 10회 미만 시행으로 성공률을 보고하지 마라.
  • 데모 영상이나 요약 사이트로 라이선스를 판단하지 마라.
  • 배포 후 가중치가 스스로 바뀌게 두지 마라.

도입 체크리스트

  • [ ] 과제가 한 문장으로 고정되지 않고, 고전 기준선의 한계를 수치로 보였다
  • [ ] 체크포인트 ID·리비전·라이선스 전문을 저장소에 고정했다 (Gemma·Llama·NVIDIA 조건 포함)
  • [ ] 학습에 섞은 공개 데이터셋의 라이선스·인용을 데이터셋 단위로 기록했다
  • [ ] 비상정지·속도·작업영역 제한이 정책 프로세스가 죽어도 동작한다
  • [ ] 청크 나이·추론 하트비트 감시가 있고 위반 시 정지한다
  • [ ] 목표 하드웨어에서 종단 지연을 직접 쟀다 (모델 카드 수치는 H100·RTX 4090 기준이다)
  • [ ] 데이터가 모델 중립 포맷이고 개입 시각이 라벨로 남는다
  • [ ] 봉인된 고정 평가 세트가 있고 시행 수와 신뢰구간을 보고한다
  • [ ] 가중치 배포가 서명·카나리·롤백을 갖췄다
  • [ ] 고객 계약에 데이터 학습 이용권과 파생 가중치 귀속이 있다
이 글은 AI 리서치 파이프라인으로 작성되고 사람이 검수했습니다. 섹션마다 1차 출처를 표기합니다.