예측을 넘어 이론으로 — Learning-to-Theorize와 NEO(Neural Theorizer) 논문 해부

2026-07-30 · 약 81분
세계모델논문리뷰프로그램귀납
KAIST Sungjin Ahn 그룹의 ICML 2026 논문(arXiv 2605.03413)은 세계모델의 목표를 "미래 예측"에서 "설명 가능한 이론 구성"으로 옮긴다. 원시 관측쌍만으로 잠재 프로그램(학습된 사고언어)을 유도·실행하는 NEO는, 단일 벡터 베이스라인이 전이 0.000으로 붕괴하는 조합·길이 일반화 구간에서 0.85~0.93을 유지한다. 패러다임 정식화부터 아키텍처·OTIB 벤치마크·로보틱스 시사점까지 12개 섹션으로 해부했다.

논문 개요 — 한눈에 보기

KAIST Sungjin Ahn 그룹(MLML)의 ICML 2026 논문 "Learning to Theorize the World from Observation"(arXiv:2605.03413, v1 2026-05-05 / v2 2026-06-04)은 세계모델의 목표를 '미래 예측'에서 '설명 가능한 이론 구성'으로 옮기는 Learning-to-Theorize(L2T) 패러다임을 제안하고, 이를 잠재 프로그램(learned Language of Thought)을 유도·실행하는 확률적 신경 모델 Neural Theorizer(NEO)로 구현한다. 언어·태스크 라벨·프로그램 정답 없이 원시 관측쌍 (x,y)만으로 재사용 가능한 프리미티브를 발견하며, 자체 벤치마크 OTIB에서 단일 벡터 기반 latent action model 계열 베이스라인이 전이 성능 0.000으로 붕괴하는 구간에서도 0.845~0.933의 전이 정확도를 유지한다.

핵심 요점

  • 서지: KAIST MLML(Doojin Baek*, Gyubin Lee*, Junyeob Baek, Hosung Lee, Sungjin Ahn), arXiv:2605.03413 [cs.LG/cs.AI], v1 2026-05-05 / v2 2026-06-04, ICML 2026(PMLR 306, 서울) 게재. arXiv HTML 렌더는 실험 섹션(4~5)이 누락되어 PDF 확인 필요.
  • 패러다임: Learning-to-Theorize(L2T) = 언어·태스크 라벨·프로그램 주석 없이 원시 관측쌍 (x,y)만으로 실행 가능한 이론 τ를 유도. 이론=프리미티브 시퀀스 τ=(z_i1,…,z_iK), 실행=함수 합성 f_τ. 저자들은 NEO를 'World Theory Model'로 위치시킴.
  • NEO 구성: 인코더 p_θ(s1|x) + theory programmer q_φ(z_ik|s_k,y)(목표조건 정책) + 공유 전이 모델 p_θ(s_{k+1}|s_k,z_ik) + 디코더 D_θ. VQ-VAE 코드북으로 프리미티브 이산화, MDL(k*=argmin λ_MDL^k ℓ(y,ŷ_k), λ_MDL>1)로 설명 길이 자동 선택, state grounding 손실로 중간 상태를 관측 매니폴드에 고정.
  • 기여 4가지: (1) L2T 패러다임 정식화 (2) NEO 모델 (3) OTIB 벤치마크(self-explainability vs transferability, α∈{0.33,0.66,1.00}) (4) 프로그램 전이·프리미티브 재조합·학습 길이 초과 일반화 실증.
  • 핵심 수치: GridWorld α=0.33 전이 성능에서 Disc-Mono/Cont-Mono/Cont-Mono-Opt는 comp-OOD·length-OOD 모두 0.000~0.001로 붕괴, NEO는 0.933/0.845, NEO-S(B=64)는 0.976/0.907. 산술 길이-OOD는 NEO 단독 0.019~0.038이지만 NEO-S(B=1024)가 0.696~0.707로 도약 — 조합 구조가 테스트타임 탐색을 가능케 함. 이미지 편집 L1은 NEO 0.09~0.12 vs 항등 베이스라인 0.212/0.271.
  • 한계(저자 명시): 작은 이산 프리미티브 집합·짧은 프로그램·통제된 합성 벤치마크 한정, 프리미티브 의미의 인간 해석성/인과성 미보장, 결정적 실행·복원 기반 정지 기준의 취약성. 비용은 단일-패스 대비 학습 약 1.5배(75.4 vs 49.8 ms/batch), NEO-S는 추론 174.0 ms/batch.

논문 개요 — 한눈에 보기

1. 서지정보

항목 내용
제목 Learning to Theorize the World from Observation
저자 Doojin Baek*, Gyubin Lee*, Junyeob Baek, Hosung Lee, Sungjin Ahn (*동등 기여)
소속 KAIST (Machine Learning and Mind Lab, MLML) · 교신 sungjin.ahn@kaist.ac.kr
arXiv ID 2605.03413 [cs.LG; cs.AI]
버전 v1: 2026-05-05 / v2: 2026-06-04 (본 위키는 v2 기준)
게재 Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea. PMLR 306, 2026
지원 한국연구재단(NRF) Brain Pool Plus(2021H1D3A2A03103645), GRDC Cooperative Hub(RS-202400436165)
분량 본문 9쪽 + 부록 포함 총 42쪽

⚠️ 참고: arXiv의 HTML 렌더(v1·v2 모두)는 Section 4~5(관련연구·실험)와 부록 A~D가 누락되어 있다. 실험 수치·표는 PDF에서만 확인 가능하다.

2. 초록 전문 번역

"세계를 이해한다는 것은 무엇을 의미하는가? 오늘날의 세계모델(world model)은 이해를 흔히 잠재 공간 또는 관측 공간에서의 정확한 미래 예측으로 조작적 정의한다. 그러나 발달인지과학은 다른 관점을 제시한다. 인간의 이해는 성숙한 언어를 획득하기 이전부터도, 세계가 어떻게 작동하는지에 대한 내적 이론(internal theories)을 구성하는 과정에서 발현된다는 것이다. 이러한 이론 구축적 인지관에 착안하여, 우리는 Learning-to-Theorize를 제안한다. 이는 원시적이고 비-텍스트적인 관측으로부터 세계에 대한 명시적이고 설명적인 이론을 추론하는 학습 패러다임이다. 우리는 이 패러다임을 Neural Theorizer (NEO) 로 구현한다. NEO는 학습된 사고 언어(Language of Thought) 로서 잠재 프로그램을 유도하고, 이를 공유 전이 모델(shared transition model) 을 통해 실행하는 확률적 신경 모델이다. NEO에서 이론은 실행 가능하고 조합적인 프로그램으로 표현되며, 학습된 프리미티브들은 새로운 현상을 설명하기 위해 체계적으로 재조합될 수 있다. 실험 결과 이 정식화는 설명 주도 일반화(explanation-driven generalization) 를 가능하게 하여, 관측을 그것을 생성한 프로그램의 관점에서 이해할 수 있게 함을 보인다."

3. 한 문단 요약

이 논문은 세계모델의 학습 목표를 "다음에 무슨 일이 일어나는가(prediction)"에서 "왜·어떻게 그렇게 되는가(explanation)"로 이동시킨다. 하나의 현상을 관측쌍 (x, y)로 두고, 그 뒤에 관측되지 않는 프로그램 τ가 있다고 가정한다(p(y|x,τ)). 프로그램은 프리미티브 시퀀스 τ = (z_{i₁}, …, z_{i_K}) 이고 실행은 함수 합성 f_τ = f_{z_{i_K}} ∘ ⋯ ∘ f_{z_{i₁}} 이다. NEO는 τ와 실행 궤적 s = (s₁,…,s_{K+1}) 두 잠재변수로 p_θ(y|x)를 ELBO 최대화한다. 핵심 부품은 ① 인코더 p_θ(s₁|x), ② theory programmer q_φ(z_{i_k} | s_k, y) — 현재 상태와 목표 관측 y에 조건화된 프리미티브 선택 정책, ③ 모든 예제가 공유하는 전이 모델 p_θ(s_{k+1}|s_k, z_{i_k}), ④ 디코더 D_θ. 프리미티브 어휘는 VQ-VAE 코드북 E = {e₁,…,e_{M′}} 로 이산화되며, 심볼의 의미는 사전 정의 없이 전이 모델이 부여한다(즉 LoT의 문법과 의미론을 동시에 학습). 과분해를 막기 위해 MDL 원리로 설명 길이를 인스턴스별 선택한다: k* = argmin_k λ_MDL^k · ℓ(y, ŷ_k), λ_MDL > 1이 길이에 지수적 페널티를 준다. 실용 구현은 결정적 실행 s_{k+1} = f_θ(s_k, z_{i_k})을 쓰고, 중간 상태가 유효 관측 매니폴드를 벗어나 "지름길 전이"로 붕괴하는 것을 막는 state grounding 손실 L_state = Σ‖s_k − sg[E_θ(D_θ(s_k))]‖²을 더한다. 최종 목적함수는 L_NEO = E[ℓ(y, ŷ_τ)] + λ_vq L_VQ + λ_state L_state.

4. 핵심 기여 4가지

  1. L2T 패러다임 정식화 — 언어 설명·태스크 라벨·프로그램 정답 주석 없이 원시 관측만으로 실행 가능한 이론을 추론하는 문제 설정. 학습 프로그램 집합 T_train ⊂ Z*_K와 테스트 집합 T_test ⊂ Z*_{K′} (T_test ∩ T_train = ∅, K′ > K)를 분리해 조합 일반화 + 길이 일반화(productivity) 를 동시에 요구한다. 저자들은 NEO를 "World Theory Model" 의 한 사례로 위치시킨다.
  2. NEO 아키텍처 — theory programmer + 공유 전이 모델 + VQ-VAE 코드북 + MDL + state grounding의 결합.
  3. OTIB(Observation-to-Theory Induction Benchmark) — 프로그램 감독도, ARC식 few-shot 태스크 그룹핑도 없이 i.i.d. 관측쌍만으로 학습하고, 지지쌍 (x⁽¹⁾,y⁽¹⁾)에서 유도한 τ̂를 다른 입력 x⁽²⁾에 적용해 평가. 두 지표: self-explainability d(ŷ⁽¹⁾,y⁽¹⁾) vs transferability d(ŷ⁽²⁾,y⁽²⁾). 학습 커버리지 α ∈ {0.33, 0.66, 1.00}로 난이도를 조절하며, 일부 프리미티브는 단독으로 한 번도 관측되지 않고 긴 얽힌 프로그램 안에만 등장한다.
  4. 설명 주도 일반화 실증 — 3개 도메인(10×10 GridWorld, 산술 인수분해 {×2,×3,×5,×7}, CIFAR-10 이미지 편집 8종 연산)에서 프로그램 전이·프리미티브 재조합·학습 길이 초과 일반화를 입증.

5. 이 논문이 왜 주목할 만한가

(a) "예측 잘함 = 이해함"이라는 등식을 정면으로 문제 삼는다. 논문의 진단은 날카롭다 — 예측·복원 손실만으로는 모델이 얽힌 합성 변환(entangled composite transformation) 을 통째로 외워도 목적함수가 만족된다. Figure 1의 대비가 핵심이다: L2T 없이는 Left-Down을 분해 불가능한 단일 단위로 기억하고, 그래서 Down-Paint-Rotate 같은 새 조합에서 무너진다.

(b) 수치가 이 주장을 극적으로 뒷받침한다. GridWorld α=0.33에서 latent action model 계열 베이스라인의 전이 성능은 사실상 완전 붕괴한다.

α=0.33, GridWorld ID (Transf.) Comp-OOD (Transf.) Length-OOD (Transf.)
Disc-Mono (≈ LAPO/Genie, 조건부 VQ-VAE 단일 코드) 0.983 0.000 0.000
Cont-Mono (≈ AdaWorld, 조건부 β-VAE 단일 벡터) 0.001 0.000 0.000
Cont-Mono-Opt (≈ LPN, 테스트타임 경사 탐색) 0.000 0.000 0.001
NEO 0.911 0.933 0.845
NEO-S (B=64 샘플링 탐색) 0.970 0.976 0.907

Cont-Mono가 self-explainability는 높은데(0.975) 전이는 0.001이라는 점이 특히 중요하다 — 잠재 벡터가 이론이 아니라 y 자체를 인코딩하고 있었다는 증거다. 이미지 편집에서는 L1 거리(낮을수록 좋음)로 NEO가 0.09~0.12를 기록해 항등 베이스라인(comp-OOD 0.212, length-OOD 0.271)과 단일 벡터 베이스라인(0.16~0.21)을 모두 넘어선다.

(c) 테스트타임 스케일링이 "이론"에서만 작동한다. 산술 도메인 길이-OOD에서 NEO 단독은 0.019~0.038로 약하지만, 확률적 theory programmer에서 B개 후보 이론을 뽑아 다수결하는 NEO-S(B=1024) 는 0.02 → 0.696(α=0.66) / 0.707(α=1.00) 로 도약한다. 반면 단일 벡터 베이스라인은 예산을 늘려도 평평하다. 즉 조합 구조 자체가 탐색 가능성(searchability)을 만든다 — 추론-시간 연산 투입이 성능으로 환산되려면 표현이 분해 가능해야 한다는, LLM 밖에서 나온 드문 증거다.

(d) 배경 지식과의 관계(논문 주장과 구분). theory-theory / "baby as a scientist"(Gopnik), Fodor의 Language of Thought, MDL(Grünwald), VQ-VAE(van den Oord)는 논문이 직접 인용·차용한 배경이다. 반면 DreamCoder·NTM·NPI·LEAPS·HPRL·LPN 같은 프로그램 합성 계열은 대개 사전 정의된 심볼 공간을 전제하고, ARC-AGI는 동일 프로그램을 공유하는 few-shot 예제 그룹과 고정 프리미티브를 전제하는데, NEO는 둘 다 제거한다. 예측 중심 세계모델 비판의 표적으로 논문이 실제로 인용한 것은 RSSM/Dreamer(Hafner et al.) 계열이며, JEPA는 본문에 명시 인용되지 않는다(같은 "예측 목적함수" 계보로 묶어 이해하는 것은 독자의 배경 해석임을 구분할 것).

(e) 엔지니어가 알아야 할 비용과 한계. 학습 비용은 순차 전이 때문에 단일-패스 대비 약 1.5배(GridWorld 75.4 vs 49.8 ms/batch), 추론은 41.1 vs 28.3 ms/batch이며 NEO-S(B=64)는 174.0 ms/batch로 뛴다. 어블레이션은 state grounding이 필수임을 보인다 — 제거 시 primitiveness가 0.002로 떨어지고 전 구간 지표가 0.000으로 학습이 붕괴한다. λ_MDL=1.2로 과하게 주면 짧고 얽힌 설명을 택해 primitiveness가 0.213으로 무너진다. 반대로 코드북을 과잉(|E|=36)으로 줘도 NEO는 조합을 통째로 외우지 않고 primitiveness 1.000을 유지한다. 저자 스스로 밝힌 한계는 명확하다: 작고 이산적인 프리미티브 집합·짧은 프로그램·통제된 합성 벤치마크에 국한되며, 프리미티브 의미는 복원 손실로만 유도되므로 인간 해석 가능성이나 진짜 인과성은 보장되지 않고, 결정적 실행과 복원 기반 정지 기준은 노이즈·부분관측에 취약할 수 있다. 논문은 스스로를 "proof of concept" 로 규정한다.

문제의식 — "세계를 이해한다"는 것

「Learning to Theorize the World from Observation」(arXiv 2605.03413v2, Sungjin Ahn 그룹)의 문제의식 섹션을 논문 Introduction·Section 2 원문 기반으로 집필했습니다. 핵심은 현대 세계모델이 "이해"를 잠재/관찰 공간에서의 정확한 미래 예측으로 조작적 정의해 왔으나, 그 목적함수는 재사용 가능한 명시적 메커니즘의 발견을 *요구하지 않으며* entangled composite transformation 암기로도 충족되므로, 이해를 theory-building(실행 가능한 조합적 프로그램 유도)으로 재정의해야 한다는 논증입니다.

핵심 요점

  • 논문은 초록 첫 문장 "What does it mean to understand the world?"로 시작해, 현대 world model이 이해를 '잠재/관찰 공간에서의 정확한 미래 예측'으로 조작적 정의해 온 관행 자체를 문제 삼는다.
  • 핵심 부정 논증: 미래 예측·재구성 품질·태스크 성능 목적함수는 명시적·재사용 가능한 메커니즘 발견을 '요구하지 않으며(do not require)', 입출력 상관을 포착한 entangled composite transformation 암기로도 충족될 수 있다 → 분포 이동·조합 일반화에서 brittle.
  • 대안 관점은 발달인지과학의 theory-theory / 'baby as a scientist'(Gopnik 1999): 아이는 성숙한 언어 습득 이전에 이미 내부 이론을 구성·수정하는 theory-building system이다. 이해의 요건은 재사용성·조합성·개입/반사실을 지지하는 명시성(lake2023human, scholkopf2021toward).
  • 열린 문제: "원시적·비언어적 감각 입력의 관찰만으로 명시적 설명 이론을 구성하는 법을 배울 수 있는가?" → 목적함수를 입출력 매핑 적합에서 구조적·조합적 메커니즘 발견으로 전환.
  • 이해를 측정 가능하게: 현상 (x,y)는 미관측 프로그램 τ=(z_i1,…,z_iK), f_τ=f_ziK∘⋯∘f_zi1가 생성. NEO는 p_θ(τ,s|x)와 q_φ(τ,s|x,y)로 τ를 추론하고, Program Transferability(τ̂를 다른 인스턴스 x⁽²⁾에 적용해 d_obs 측정)로 '전이 가능한 이론 vs 인스턴스 특수 매핑'을 분리 평가한다.
  • 데이터 가정이 매우 느슨함 — 𝒟_train은 i.i.d. (x,y) 쌍이며 ARC-AGI식 few-shot 태스크 그룹을 가정하지 않는다. world-model 세팅에서는 시간 인덱스·시차가 모두 미관측인 두 프레임(x_{t_n}, x_{t_n+t′_n})이면 충분. 테스트는 𝒯_test∩𝒯_train=∅, K′>K로 조합 일반화 + 길이 일반화(productivity)를 함께 요구.

문제의식 — "세계를 이해한다"는 것

논문은 제목이 아니라 초록의 첫 문장으로 시작한다. "What does it mean to understand the world?" 그리고 곧바로 현행 관행을 진단한다. "Contemporary world models often operationalize understanding as accurate future prediction in latent or observation space." 즉 오늘날 세계모델 연구는 이해를 예측 정확도로 조작적 정의(operationalize) 해 왔고, 이 논문의 문제의식은 정확히 그 등치(예측 = 이해)를 겨냥한다.

Turing의 아이, 그리고 theory-theory

논증의 출발점은 Turing(1950)의 제안이다 — "성인의 마음을 시뮬레이션하는 프로그램 대신 아이의 마음을 시뮬레이션하는 프로그램을 만들면 어떤가." 저자들은 이를 child-centered view로 읽는다. 성숙한 지능 행동을 모방하는 법이 아니라, 그런 행동을 애초에 발생시키는 학습 과정을 묻자는 것.

여기에 발달인지과학의 관찰이 결합된다. 아이는 감각 입력의 수동적 예측기(passive predictor)도, 언어 행동의 모방자도 아니다. 성숙한 언어를 습득하기 훨씬 전부터 세계가 어떻게 작동하는지에 대한 내부 이론을 구성하고 수정한다(goddu2024development, dragoi2024generative 등). 이것이 인지발달의 theory-theory, 또는 Gopnik(1999)의 "baby as a scientist" 관점이며, 초기 인지가 "구조적·재사용 가능·조합적(structured, reusable, compositional) 설명의 발견"에 의해 이끌린다고 본다. 논문의 정식화:

아이의 마음은 단순히 다음에 무엇이 일어날지 예보하는 기계가 아니라, 세계가 어떻게 그리고 왜 변하는지를 설명하는 법을 배우는 theory-building system이다.

이해의 요건: 설명 구조(explanatory structure)

이 관점은 "이해"에 더 강한 요건을 부과한다. 논문이 명시하는 세 가지 조건은 엔지니어에게 그대로 설계 스펙으로 읽힌다.

  • 재사용성(reusable across instances) — 개별 사례가 아니라 사례군을 가로질러 재사용될 것
  • 조합성(compositional across novel situations) — 새 상황에서 기존 구성요소를 조합해 확장될 것
  • 명시성(explicit) — 개입(intervention)과 반사실 추론(counterfactual reasoning)을 지지할 만큼 명시적일 것 (lake2023human, scholkopf2021toward)

세 조건 모두 "다음 프레임을 잘 맞히는가"로는 검증되지 않는다. 그래서 논문은 학습 목표 자체가 미래 예측 너머로 가야 한다고 본다 — 관찰을 생성·변환하는 추상 메커니즘의 추론으로.

핵심 논증: 예측 목적함수는 메커니즘 발견을 "요구하지 않는다"

Introduction의 결정적 단락은 부정적 논증이다. 최근 세계모델을 포함한 대부분의 AI 시스템은 (a) 잠재/관찰 공간에서의 미래 예측, (b) 재구성 품질, (c) 태스크별 성능으로 최적화된다(논문은 LeCun 계열 world model, Sora, Dreamer를 인용). 문제는 성능이 낮다는 게 아니라 목적함수의 논리적 느슨함이다.

These objectives do not require models to discover explicit, reusable mechanisms... Instead, they can often be satisfied by learning entangled composite transformations that capture correlations among observed inputs and outputs.

즉 예측 손실은 "얽힌 복합 변환"을 통째로 암기하는 해(solution)로도 완전히 만족될 수 있다. Figure 1이 이 논증의 그림 버전이다. 같은 데이터에서 (b) L2T는 Rotate, Left, Down, Paint라는 재사용 가능한 프리미티브를 발견하지만, (c) L2T 없이는 Left-Down을 분해되지 않은 단일 단위로 암기한다. 그 결과 (d) 전자는 Down-Paint-Rotate 같은 처음 보는 현상을 재조합으로 설명하지만, (e) 후자는 실패한다. 이런 표현은 분포 이동이나 조합적 일반화 테스트에서 취약(brittle) 하다(chollet2019measure).

예측 중심 세계모델 Learning-to-Theorize (L2T)
학습 대상 입력→출력 매핑 적합 관찰을 생성·변환하는 메커니즘
표현 형태 얽힌 복합 변환(entangled composite) 실행 가능한 조합적 프로그램 τ
만족 조건 재구성/예측 오차 최소화 프리미티브 발견 + 조합 + 신규 조합으로 설명
취약점 분포 이동·조합 일반화에서 붕괴 (목표) explanation-driven generalization

논문이 세운 열린 문제

논증은 하나의 질문으로 수렴한다.

인공 시스템이 오로지 원시적·비언어적(raw, non-textual) 감각 입력만을 관찰함으로써, 세계에 대한 명시적 설명 이론을 구성하는 법을 배울 수 있는가?

그리고 해법의 방향을 목적함수 전환으로 못박는다 — "from fitting input–output mappings to discovering structured, compositional mechanisms." 여기서 "언어 없이"가 중요하다. 언어 라벨·태스크 라벨·정답 프로그램 주석 없이(nye2020learning, mao2019neuro 대비), 아이가 언어 습득 이전에 이론을 세운다는 발달심리 관찰을 그대로 학습 설정으로 옮긴 것이다.

"이해"를 측정 가능하게 만들기

문제의식이 수사에 그치지 않는 이유는 Section 2가 이해를 조작적으로 정의하기 때문이다. 세계를 이론화하는 능력이란 (i) 현상들을 가로질러 재사용 가능한 추상 프리미티브를 발견하고, (ii) 그것들을 구조적 설명으로 조합하는 법을 학습하며, (iii) 같은 프리미티브의 새로운 조합으로 미지의 현상을 설명하는 능력이다.

  • 형식화: 현상은 관찰 쌍 (x, y). 각 쌍은 미관측 프로그램(=인과 메커니즘) τ가 x를 y로 변환해 생성된다고 가정하며, τ = (z_{i₁},…,z_{i_K})는 프리미티브 z ∈ 𝒵의 순서열, 실행은 함수 합성 f_τ = f_{z_{i_K}} ∘ ⋯ ∘ f_{z_{i₁}}. 이후 NEO는 τ와 실행 궤적 s를 잠재변수로 두고 생성모델 p_θ(τ, s | x) 와 변분 사후분포 q_φ(τ, s | x, y) 로 이를 추론한다.
  • 데이터 가정의 느슨함: 𝒟_train은 i.i.d. 현상들의 집합일 뿐이다. ARC-AGI처럼 같은 프로그램을 공유하는 few-shot 예제 그룹을 가정하지 않는다. 표준 world-model 세팅에서는 x_n = x_{t_n}, y_n = x_{t_n + t′_n} — 시간 인덱스 t_n도 시차 t′_n도 관찰되지 않는 시간적으로 떨어진 두 프레임이면 충분하다.
  • 평가 = Program Transferability: 같은 잠재 τ가 만든 두 현상 (x⁽¹⁾,y⁽¹⁾), (x⁽²⁾,y⁽²⁾)에 대해, 첫 쌍에서 τ̂를 추론한 뒤 다른 인스턴스 x⁽²⁾에 적용해 ŷ⁽²⁾ = D_θ(f_τ̂(x⁽²⁾))를 얻고 관찰공간 오차 d_obs(ŷ⁽²⁾, y⁽²⁾)로 측정한다. 이는 "재구성을 잘했는가"와 "인스턴스 특수적 매핑이 아니라 전이 가능한 이론을 배웠는가"를 분리해 재는 장치다.
  • 테스트 조건: 𝒯_test ∩ 𝒯_train = ∅ 이고 K′ > K. 즉 미지 조합에 대한 조합적 일반화뿐 아니라 학습 시보다 긴 프로그램에 대한 길이 일반화(productivity) 까지 요구한다.

엔지니어 관점의 함의

Dreamer/RSSM 계열은 planning을 위한 compact latent dynamics를, LAPO·AdaWorld·LAPA·Genie 같은 latent action model은 action 라벨 없이 dynamics를 복원하는 확장 가능한 사전학습을 목표로 한다. 저자들은 자신들의 문제 설정이 이와 다르다고 명시한다 — 임의의 관찰 쌍 (x, y)가 주어졌을 때 변환 그 자체를 설명하는 이론을 유도하는 것이며, 따라서 single-step next-frame prediction에 국한되지 않는다. NEO는 이 의미에서 World Theory Model, 즉 추론의 중심 대상이 "다음 관찰"이 아니라 "현상의 실행 가능한 이론"인 세계모델로 자리매김된다.

배경 구분: theory-theory(Gopnik), Language of Thought(Fodor 1975), MDL, ARC-AGI(Chollet 2019), DreamCoder류 프로그램 합성은 모두 논문 바깥의 기존 개념이며, 논문은 이들을 각각 인지적 동기·표현 형식·단순성 편향·일반화 기준·대비군으로 끌어 쓴다. 논문 고유의 주장은 "이 요소들을 원시 관찰 쌍만으로, 문법·프로그램 주석 없이 신경망 안에서 학습 가능한 하나의 목적함수로 묶을 수 있다"는 것이다.

인지과학적 뿌리 — 아이는 언어 이전에 이론을 만든다

이 섹션은 NEO 논문이 발달인지과학의 theory-theory("아이는 예측기가 아니라 이론 구축기")와 Fodor의 Language of Thought 가설에서 무엇을 차용했는지, 그리고 그 철학적 주장을 τ(프로그램)·q_φ(theory programmer)·p_θ(공유 전이 모델)·MDL·OTIB라는 계산 장치로 어떻게 번역했는지를 논문 원문 인용을 근거로 정리한다. 아울러 논문이 의도적으로 옮기지 않은 것(생득적 심볼, 명시적 이론 수정 메커니즘)까지 구분해 서술한다.

핵심 요점

  • 논문은 Turing(1950)의 '아이의 마음을 시뮬레이션하라'를 에피그래프로 걸고, 발달인지과학의 theory-theory(gopnik1999scientist, 'baby as a scientist')를 직접 인용해 '아이의 마음은 다음을 예측하는 기계가 아니라 세계가 어떻게·왜 변하는지 설명하는 theory-building system'이라고 못박는다. 이것이 Dreamer/Sora류 예측 중심 세계모델에 대한 적대적 대조축이다.
  • '언어 이전'은 수사가 아니라 데이터 제약으로 번역된다 — 학습 데이터는 잠재 프로그램 τ로 생성된 관측 쌍 (xₙ, yₙ)뿐이고, 자연어 설명·태스크 라벨·프로그램 주석이 없다. ARC-AGI가 전제하는 same-program support set조차 없는 i.i.d. phenomena 설정이며, '시간차가 미관측인 두 프레임'을 그대로 쓸 수 있다.
  • Fodor(1975)의 Language of Thought에서 구성성과 생산성 요구조건만 차용하고 생득적 심볼 전제는 버렸다. 부록 G.1: NEO은 LoT의 '어휘와 의미'를 모두 신경망으로 학습하며, 프리미티브 {z_i}는 사전 의미가 없는 추상 심볼이고 그 의미는 공유 전이 모델 p_θ(s_{k+1}|s_k, z_{i_k})가 부여하는 operational semantics다.
  • 인지과학 개념이 1:1 계산 장치로 매핑된다 — 이론=프로그램 τ, mentalese 어휘=VQ-VAE 코드북 𝓔, 가설 세우기=목표조건 정책 q_φ(z_{i_k}|s_k, y)(theory programmer), 오컴의 면도날=MDL k*=argmin_k λ_MDL^k·ℓ(y,ŷ_k), 생산성=length generalization(K′>K), 이론의 전이성=program transferability 평가.
  • 베이스라인 3종은 '이론화하지 않는 학습자'의 초상이다. Disc-Mono/Cont-Mono는 1스텝(K=1) 모놀리식이라 복합 변환을 통째로 외워야 하고, GridWorld 코드북이 36개 필요한 반면 NEO은 6개(K=4)로 충분하다(산술 40 vs 16, 이미지 편집 64 vs 16). Cont-Mono-Opt의 테스트타임 경사 탐색은 이미지 편집 571.35 ms/batch로 NEO 38.06 ms보다 훨씬 비싸다.
  • 논문이 옮기지 않은 것도 명확하다 — 생득적 심볼 집합, 이론 수정(revision)의 명시적 메커니즘(서론은 'construct and revise'라 하지만 모델은 amortized 추론에 집중), 그리고 서론이 요건으로 언급한 개입·반사실 추론은 실험 범위 밖이다.

인지과학적 뿌리 — 아이는 언어 이전에 이론을 만든다

튜링의 오래된 제안이 논문의 첫 문장이다

논문은 Turing(1950)의 문장을 에피그래프로 걸고 시작한다: "Instead of trying to produce a programme to simulate the adult mind, why not rather try to produce one which simulates the child's?" 저자들(Doojin Baek, Gyubin Lee, Junyeob Baek, Hosung Lee, Sungjin Ahn)은 이를 "성숙한 지능 행동을 흉내 내는 법"이 아니라 **"그런 행동을 낳는 학습 과정"**을 물어야 한다는 목표 재정의로 읽는다. Learning-to-Theorize(L2T)라는 패러다임 이름 자체가 이 재정의의 산물이다.

theory-theory: 예측기가 아니라 이론 구축기

논문이 1차 근거로 삼는 발달인지과학 명제는 서론에 그대로 적혀 있다.

"children are not merely passive predictors of sensory inputs or imitators of linguistic behavior. Long before acquiring mature language, they appear to construct and revise internal theories of how the world works"

논문은 이 관점을 theory-theory of cognitive development, 또는 "baby as a scientist" 관점(gopnik1999scientist — Gopnik 계열의 The Scientist in the Crib)이라 명시하고, 초기 인지가 **"structured, reusable, and compositional explanations"**의 발견에 의해 인도된다고 요약한다. 그리고 논문 전체의 표적을 정하는 한 문장:

"the child's mind is not simply a machine for forecasting what will happen next, but a theory-building system that learns to explain how and why the world changes."

적대적 대조군은 명확하다. 논문은 Dreamer·Sora류 세계모델(dreamer, zhu2024sora, leworldmodel)이 잠재/관측 공간의 미래 예측·재구성 품질로 "이해"를 조작적 정의한다고 보고, 그런 목적함수는 얽힌 복합 변환(entangled composite transformations)을 통째로 외워도 충족된다고 지적한다. Figure 1의 예시가 정확히 이것이다 — Left-Down을 분해 불가능한 한 덩어리로 기억한 모델은 Down-Paint-Rotate 같은 새 조합 앞에서 무너진다.

언어 이전 = 텍스트도 라벨도 없는 (x, y) 쌍

"언어 이전"은 이 논문에서 수사가 아니라 데이터 제약으로 번역된다. L2T의 학습 데이터 𝒟_train = {(xₙ, yₙ)}는 잠재 프로그램 τₙ로 생성된 관측 쌍뿐이며, 프로그램도 실행 함수 f_τ도 관측되지 않는다. 논문은 이 설정을 "temporally separated observations"(시점 tₙ과 시간차 t′ₙ 모두 미관측)로 바로 채울 수 있다고 말한다 — 로보틱스 엔지니어에겐 라벨 없는 주행 로그의 두 프레임이 곧 하나의 phenomenon이라는 뜻이다.

  • 언어 감독 없음: 자연어 설명·태스크 라벨·ground-truth 프로그램 주석을 쓰지 않는다(nye2020learning, mao2019neuro와의 차별점).
  • 태스크 그룹핑 없음: ARC-AGI(chollet2019measure)는 같은 프로그램을 공유하는 few-shot support set을 전제하지만, L2T의 𝒟_train은 i.i.d. phenomena다. 논문은 ARC류가 "primitives와 표현 편향을 학습 대상이 아니라 고정된 것으로 취급"한다고 비판한다.
  • 논문 자체의 직관 물리 예시: x = 나무에 매달린 사과, y = 땅에 떨어진 사과. 이 전환을 설명하는 잠재 인과 메커니즘이 τ다.

(배경 지식 — 논문이 직접 논증하지는 않음) 발달심리에서 언어 이전 영아의 직관 물리(대상 영속성·고체성·접촉 인과)와 직관 심리(목표 지향 행위 해석)는 주로 기대 위반 응시시간 패러다임으로 보고돼 왔다. 논문은 이 실험 문헌을 상세히 다루지 않고, "언어 습득 이전에 이론이 존재한다"는 결론만 설계 제약으로 가져온다.

Language of Thought: Fodor의 가설을 신경망으로 뒤집기

NEO의 핵심 문장은 이것이다. "NEO induces a discrete program as a learned Language of Thought (fodor1975language)". 부록 G.1은 차용과 결별을 함께 명시한다.

"Our work is inspired by this perspective but departs from symbolic modeling: NEO learns both the vocabulary and semantics of a Language of Thought in a neural and data-driven manner. Programs are latent and continuous in execution, while remaining discrete and compositional in structure."

즉 Fodor식 LoT에서 구성성(compositionality)과 생산성(productivity)이라는 요구조건만 가져오고, 심볼이 생득적으로 주어진다는 전제는 버린다. 프리미티브 {z_i}는 "abstract symbols without predefined semantics"이며, 그 의미는 공유 전이 모델이 상태를 어떻게 바꾸는지로 사후에 부여된다(operational semantics). NEO은 프로그램의 문법(어떻게 합성되는가)과 의미(그 합성이 어떤 상태 전이를 실현하는가)를 관측만으로 동시에 학습한다.

인지과학 개념 → 계산 장치 대응표

인지과학 쪽 개념 논문의 계산적 구현
이론(theory) 실행 가능한 프로그램 τ = (z_{i₁}, …, z_{i_K}), 실행은 함수 합성 f_τ = f_{z_{i_K}} ∘ ⋯ ∘ f_{z_{i₁}}
mentalese 어휘 VQ-VAE 코드북 𝓔 = {e₁, …, e_{M′}} (참 프리미티브 수 M은 미지 → M′는 하이퍼파라미터)
개념의 의미 공유 전이 모델 p_θ(s_{k+1} | s_k, z_{i_k}) — 심볼이 상태를 어떻게 바꾸는지가 곧 의미
"가설을 세우는 아이" theory programmer q_φ(z_{i_k} | s_k, y) — 목표 조건부 정책. 목표 관측 y의 인코딩 s_y = E_θ(y)를 보고 다음 프리미티브를 고른다
오컴의 면도날 / 단순성 선호 MDL: k* = argmin_k λ_MDL^k · ℓ(y, ŷ_k) — 길이에 지수 페널티를 걸어 가장 짧은 정확한 설명을 고르고, 그 지점에서만 역전파
중간 추론 단계도 세계의 상태여야 함 state grounding ℒ_state = Σ‖s_k − sg[E_θ(D_θ(s_k))]‖² — 중간 상태를 유효 관측 매니폴드에 붙잡아 shortcut 전이를 막음
생산성(productivity) length generalization: 𝒯_test ∩ 𝒯_train = ∅ 이면서 K′ > K
이론은 사례를 넘어 전이된다 program transferability: (x⁽¹⁾, y⁽¹⁾)에서 τ̂를 추론해 다른 x⁽²⁾에 적용, ŷ⁽²⁾ = D_θ(f_τ̂(x⁽²⁾))의 관측공간 오차로 평가

이 대응이 실험 설계에도 그대로 박혀 있다. OTIB(Observation-to-Theory Induction Benchmark)는 프로그램 감독·태스크 그룹핑 없이 재사용 가능한 이론을 뽑아내는지를 묻는 벤치마크이고, 베이스라인 3종은 "이론화하지 않는 아이"의 계산적 초상이다.

  • Disc-Mono — 이산(VQ) 행동공간의 1스텝 모델(Max Transition Length K = 1). 합성을 분해하지 않고 복합 변환을 통째로 코드에 할당한다. GridWorld에서 코드북이 36개 필요한 반면 NEO은 6개(K = 4)로 충분하다. 산술 인수분해는 40 대 16, 이미지 편집은 64 대 16.
  • Cont-Mono — 연속(VAE) 행동공간의 1스텝 모델. 얽힌 복합 변환을 그대로 학습.
  • Cont-Mono-Opt — 테스트 시점 경사 탐색(GridWorld 기준 5스텝)으로 연속 잠재행동을 새 예시에 맞추는 변형. GridWorld 추론 91.2 ms/batch vs NEO 41.1 ms, 이미지 편집에선 571.35 ms vs NEO 38.06 ms로 테스트타임 최적화보다 이론 추론이 더 싸다는 점을 보인다.

데이터 규모도 "few-shot 퍼즐"이 아니라 대규모 i.i.d. 관측이라는 주장을 뒷받침한다 — GridWorld 학습 100,000 / ID 테스트 10,000 / compositional OOD 10,000 / length OOD 20,000, 이미지 편집은 α = 0.33 기준 학습 720,000 / compositional OOD 840,000 쌍.

무엇을 옮기지 않았나

  • 생득적 심볼 집합: Fodor의 LoT가 전제하는 고정 어휘를 버리고 M′을 하이퍼파라미터로 남겼다.
  • 이론 수정(revision)의 명시적 메커니즘: 서론은 아이가 이론을 "construct and revise"한다고 말하지만, NEO의 모델링 대상은 amortized 변분 사후분포 q_φ를 통한 추론이며, 신념 갱신·반증에 따른 이론 교체를 별도 장치로 두지는 않는다. (원문 대조에 근거한 본 위키의 해석)
  • 개입·반사실 추론: 서론은 좋은 설명 구조가 intervention과 counterfactual을 지원해야 한다(lake2023human, scholkopf2021toward)고 요건을 밝히지만, 실험은 program transferability와 compositional/length OOD로 한정된다.

엔지니어링 관점의 함의는 분명하다. NEO을 논문 표현대로 World Theory Model(추론 대상이 미래 프레임이 아니라 현상의 실행 가능한 이론인 세계모델)로 본다면, 로봇 로그처럼 라벨이 없고 시간차가 불명확한 관측 쌍이 그대로 이론 학습 데이터가 된다. "아이는 언어 이전에 이론을 만든다"는 명제가 여기서는 텍스트 감독 없이 재사용 가능한 스킬 프리미티브를 발견하라는 구체적 요구로 번역된다.

Learning-to-Theorize 패러다임 정식화

Learning-to-Theorize는 관찰 쌍 (x,y)만 주어지고 이를 생성한 잠재 프로그램 τ·원시 연산 어휘·태스크 그룹핑이 전부 비관찰인 조건에서, 훈련보다 긴(K′>K) 서로소 프로그램 집합으로 외삽하는 조합·길이 일반화를 요구하는 패러다임이다. 이는 예측 정확도를 목적으로 하는 world model과, 기호 입력·DSL·태스크 감독을 가정하는 고전 프로그램 귀납 양쪽과 설정 자체가 다르며, 논문은 이를 OTIB 벤치마크로 정식화한다.

핵심 요점

  • 문제 정식화의 핵심은 관찰 쌍 (x,y)만 주어지고 이를 생성한 프로그램 τ=(z_i1,…,z_iK)와 그 함수 f_τ = f_{z_iK}∘⋯∘f_{z_i1}은 '잠재이며 결코 관찰되지 않는다'는 것 — 프로그램 실행이 곧 함수 합성이다.
  • 무감독 조건이 3중이다: 프로그램 라벨 없음, DSL/언어 없음(원시 어휘 𝒵 자체를 VQ-VAE 코드북 ℰ로 학습), 태스크 라벨·그룹핑 없음. 논문은 ARC-AGI가 가정하는 '동일 프로그램 공유 few-shot 그룹'을 명시적으로 거부하고 𝒟_train을 i.i.d. 현상으로 둔다 — 대신 대규모 학습(100K~1.17M)이 가능해진다.
  • 테스트 조건 𝒯_test ⊂ 𝒵*_{K'}, 𝒯_test ∩ 𝒯_train = ∅, K′ > K 가 조합 일반화와 길이 일반화(= 생산성, productivity)를 동시에 강제한다. 조합 공간 𝒵*가 길이에 지수적이라 훈련은 극히 일부만 커버할 수밖에 없다는 것이 근거.
  • 추론 구조는 목표 조건부 theory programmer q_φ(z_ik|s_k,y)가 실행 트레이스를 y를 설명하는 상태로 조종하고, 전이 p_θ(s_{k+1}|s_k,z_ik)를 모든 스텝이 공유한다(Eq.1~3). 프로그램 길이는 라벨이 없으므로 MDL 기준 k*=argmin_k λ_MDL^k·ℓ(y,ŷ_k)로, 중간 상태는 ℒ_state 접지 손실로 잡는다.
  • 기존 설정과의 차이: world model은 '예측 정확도'라 재사용 가능한 메커니즘 발견을 요구하지 않고, 고전 프로그램 귀납은 '기호적 입력·명시적 DSL·태스크 수준 감독'을 가정한다. L2T는 원시 비기호 관찰에서 출발해 조합성과 현상 간 전이를 성공 기준으로 삼는다.
  • OTIB(Observation-to-Theory Induction Benchmark)는 같은 τ가 생성한 두 현상에서 τ̂를 추론해 다른 입력에 적용(ŷ⁽²⁾=D_θ(f_τ̂(x⁽²⁾)))하는 전이 평가. 3개 도메인(GridWorld K=4, Arithmetic K=3, Image Editing K=3) × α∈{1.00,0.66,0.33}. 대조군 Disc-Mono/Cont-Mono/Cont-Mono-Opt는 모두 K=1 모놀리식이라 재조합할 부품이 없다.

Learning-to-Theorize 패러다임 정식화

1. 목적함수의 교체: "예측 정확도"에서 "설명 프로그램"으로

논문의 출발점은 현행 world model의 목적함수 비판이다. 저자들은 최근 world model이 "잠재 공간 또는 관찰 공간에서의 미래 예측, 복원 품질, 태스크별 성능"으로 최적화되며, 이런 목적은 "모델이 명시적이고 재사용 가능한 메커니즘을 발견하도록 요구하지 않는다(do not require models to discover explicit, reusable mechanisms)"고 지적한다. 즉 얽힌 합성 변환(entangled composite transformation) 하나만 외워도 손실은 충분히 내려간다.

대안으로 제시하는 것이 Learning-to-Theorize(L2T) — 원시적·비텍스트(non-textual) 관찰만으로 세계에 대한 명시적 설명 이론을 유도하는 학습 패러다임이다. 이론은 자연어 문장이 아니라 실행 가능한 조합적 프로그램으로 표현된다.

배경(논문 외): 이 구도는 발달인지과학의 theory-theory(아이는 언어 습득 이전에 세계에 대한 내적 이론을 세우고 개정한다)와 Fodor의 Language of Thought 가설에 대응한다. 논문은 이 계보를 동기로 명시하되, LoT를 **학습된 것(learned LoT)**으로 재해석한다는 점이 차별점이다.

2. 문제 정식화: 관찰 쌍 (x, y)와 비관찰 프로그램 τ

현상(phenomenon)은 관찰 쌍으로 모델링된다.

  • x ∼ p(x): 소스 관찰(source observation), y: 타깃 관찰(target observation)
  • 둘을 잇는 것은 관찰되지 않는 프로그램 τ: p(y | x, τ)

프로그램은 원시 연산의 순서열이다.

τ = (z_i1, z_i2, …, z_iK),   z_ik ∈ 𝒵 = {z_1, …, z_M}
f_τ = f_{z_iK} ∘ f_{z_iK-1} ∘ ⋯ ∘ f_{z_i1}

즉 프로그램 실행 = 함수 합성이다. 훈련 집합은

𝒟_train = {(x_n, y_n)}_{n=1}^N,   y_n = f_{τ_n}(x_n),   τ_n ∼ p_train(τ), τ_n ∈ 𝒯_train

이고, 핵심 조건은 **"프로그램 {τ_n}과 그에 연동된 함수 {f_{τ_n}}는 잠재이며 결코 관찰되지 않는다"**는 것이다.

기호 의미 관찰 여부
x, y 소스/타깃 관찰 관찰됨 (유일한 지도신호)
τ 잠재 프로그램(이론) 비관찰
𝒵 원시 연산 집합(크기 M) 비관찰 — 학습으로 발견해야 함
𝒵*_K 길이 K 이하 프로그램 공간 —
s_1…s_{K+1} 실행 트레이스의 잠재 상태 비관찰
p_θ 생성 모델(공유 transition) —
q_φ 목표 조건부 theory programmer —

확률 모델은 다음과 같이 인수분해된다.

  • (Eq.1) p_θ(y|x) = ∫ p_θ(y|s_{K+1}) p_θ(τ, s|x) dτ ds
  • (Eq.2) p_θ(τ, s|x) = p_θ(s_1|x) ∏_k p_θ(z_ik|s_k) p_θ(s_{k+1}|s_k, z_ik)
  • (Eq.3) q_φ(τ, s|x, y) = p_θ(s_1|x) ∏_k q_φ(z_ik|s_k, y) p_θ(s_{k+1}|s_k, z_ik)

직관: p_θ는 "지금 상태 s_k만 보고 다음 원시 연산을 고르는" 전방 정책이고, q_φ는 정답 y를 함께 보는 목표 조건부 사후 추론기다. 논문 표현으로 q_φ는 "다음 원시 z_ik를 선택해 실행 트레이스를 y를 설명하는 잠재 상태로 조종한다". 전이 p_θ(s_{k+1}|s_k, z_ik)가 모든 스텝에서 공유된다는 점이 결정적이다 — 이 공유가 없으면 원시 연산이 재조합 가능해지지 않는다.

3. 무감독 조건: 무엇이 주어지지 않는가

NEO는 "언어, 태스크 라벨, 프로그램 감독(language, task labels, or program supervision) 없이 오직 원시 관찰 쌍만으로" 학습한다. 구체적으로 다음이 모두 부재한다.

  • 프로그램 라벨: τ의 길이·구성·정답 시퀀스 어느 것도 없음
  • DSL/언어: 원시 연산 어휘 자체를 VQ-VAE 코드북 ℰ = {e_1, …, e_M'}으로 학습해야 함 (배경: VQ-VAE는 van den Oord 등의 이산 잠재 표현 기법)
  • 태스크 그룹핑: "ARC-AGI 같은 데이터셋은 동일 프로그램을 공유하는 few-shot 예제 그룹을 가정하지만, 우리 정식화는 그런 구조를 부과하지 않는다 — 𝒟_train은 i.i.d. 현상으로 구성된다"

세 번째가 실무적으로 가장 가혹하다. 같은 τ를 공유하는 예제가 묶여 오지 않으므로, 모델은 어떤 쌍들이 같은 메커니즘을 공유하는지조차 스스로 추론해야 한다. 반대급부로 이 설정은 few-shot 벤치마크와 달리 대규모 학습이 가능하다(논문 실험 규모: 훈련 100K~1.17M 예제).

프로그램 길이도 라벨이 없으므로 MDL 기준으로 스스로 정한다: k* = argmin_k λ_MDL^k · ℓ(y, ŷ_k), 여기서 λ_MDL > 1이 "단순성 편향의 강도를 조절하고 긴 프로그램에 지수적 페널티"를 준다. 추가로 상태 접지 손실 ℒ_state = Σ_k ‖s_k − sg[E_θ(D_θ(s_k))]‖²가 중간 상태를 유효 잠재 매니폴드 위에 묶어 둔다.

4. 테스트 시 요구: 조합 일반화 + 길이 일반화(productivity)

평가는 훈련과 서로소인 프로그램 집합에서 이뤄진다.

𝒯_test ⊂ 𝒵*_{K'} ⊂ 𝒵*,   𝒯_test ∩ 𝒯_train = ∅,   K' > K

논문의 근거는 조합 폭발이다 — "조합적 프로그램 공간 𝒵*가 길이에 대해 지수적으로 커지므로, 가능한 프로그램의 아주 작은 부분집합만 훈련 중 실현될 수 있다." 따라서 요구되는 것은 두 가지다.

  1. 조합 일반화: 본 적 없는 원시 연산 조합
  2. 길이 일반화 = 생산성(productivity): "훈련 중 실현된 것보다 더 긴 조합으로"

전이 가능성 평가(OTIB 프로토콜): 같은 잠재 τ ∈ 𝒯_test가 생성한 두 현상 (x⁽¹⁾,y⁽¹⁾), (x⁽²⁾,y⁽²⁾)에 대해, 첫 쌍에서 τ̂를 추론한 뒤 두 번째 입력에 적용해 ŷ⁽²⁾ = D_θ(f_τ̂(x⁽²⁾))를 얻는다. 추론된 이론이 재사용·전이 가능한 설명인지를 직접 측정하는 설계다. 논문은 이 평가 스위트를 OTIB(Observation-to-Theory Induction Benchmark) — "프로그램 감독이나 태스크 그룹핑 없이 관찰로부터 재사용 가능한 이론을 추론할 수 있는지 평가하는 벤치마크"로 기여 항목에 명시한다.

구성: GridWorld(K=4), Arithmetic Factorization Reasoning(K=3), Image Editing(K=3) 3개 도메인 × 조합 난이도 α ∈ {1.00, 0.66, 0.33}(훈련/테스트 조합 분할 비율; α=1.00은 조합-OOD 없음, 낮을수록 조합 일반화 요구 증가). 테스트 규모는 조합-OOD 10K~840K, 길이-OOD 15.3K~393.8K.

5. 기존 설정과의 차이

축 지도학습 / world model 고전 프로그램 귀납 (예: DreamCoder류) Learning-to-Theorize
입력 관찰 "기호적 입력, 명시적 DSL" 가정 원시·비기호 관찰 쌍 (x,y)
감독 라벨/재구성 태스크 수준 감독, 프로그램 공간 명시 프로그램·언어·태스크 라벨 전무
데이터 구조 i.i.d. 동일 프로그램 공유 few-shot 그룹 i.i.d. 현상 (그룹핑 없음)
원시 어휘 해당 없음 사람이 설계(고정) 학습된 LoT (VQ 코드북)
성공 기준 예측 정확도 태스크별 정확성 조합성 + 현상 간 전이
일반화 i.i.d. 또는 완만한 OOD 조합 조합 + 길이(K′>K)

ARC-AGI 계열에 대해서는 "이 벤치마크들은 저데이터 영역의 추론·일반화를 주로 강조하며, 기저 원시와 표현 편향은 학습 대상이 아니라 고정된 것으로 취급한다"고 선을 긋는다.

배경(논문 외): JEPA류 잠재 예측 자기지도 학습도 "예측을 이해로 본다"는 점에서 논문이 비판하는 축에 속한다 — 다만 이 대응은 논문이 직접 서술한 것이 아니라 독자 편의를 위한 정리다.

6. 비교 기준선 (설정의 의미를 드러내는 대조군)

기준선 프로그램 구조 잠재 표현 테스트 시
Disc-Mono 단일 스텝 (K=1) 이산 VQ 코드북 추론만
Cont-Mono 단일 스텝 (K=1) 연속 VAE 잠재 액션 추론만
Cont-Mono-Opt 단일 스텝 (K=1) 연속 그래디언트 탐색(도메인별 5~30 스텝)
NEO 다중 스텝 조합 (K=3~4) 이산 VQ + 상태 접지 추론 + MDL 길이 선택

세 기준선은 모두 "한 방에 x→y를 매핑"하는 모놀리식 변환이다. 이 대조가 곧 논문의 논지다 — 얽힌 단일 변환은 in-distribution에서는 통하지만, 𝒯_test ∩ 𝒯_train = ∅이고 K′ > K인 순간 재조합할 부품이 없어 무너진다.

로보틱스 엔지니어를 위한 함의: 이 정식화는 "스킬 라이브러리를 사람이 정의하고 라벨링해 학습시킨다"는 통상적 접근의 정반대다. (x, y) = (실행 전 관찰, 실행 후 관찰)만 대량 수집하면 원시 스킬 어휘 자체가 VQ 코드북으로 창발하고, 더 긴 스킬 시퀀스로 외삽되어야 한다는 것이 성공 기준이 된다.

NEO 아키텍처 — 3개 모듈의 협주

NEO는 조건부 우도 p_θ(y|x)의 곱셈 분해를 그대로 아키텍처로 옮겨, Encoder E_θ(관찰→잠재상태), Theory Programmer q_φ(목표 조건부 정책으로 VQ 코드북에서 프리미티브 선택), Transition Model f_θ(하나의 공유 실행엔진으로 상태 변환) 세 모듈이 K스텝 언롤을 돌며 잠재 프로그램 τ를 추론·실행한다. 심볼 자체엔 의미가 없고 공유 전이 모델이 operational semantics를 부여하며, State Grounding과 MDL 길이 선택이 이 협주를 붕괴 없이 지탱한다.

핵심 요점

  • 아키텍처 3분할은 임의 설계가 아니라 조건부 우도 p_θ(y|x)의 곱셈 분해(Eq. 1–2)를 그대로 모듈로 옮긴 것 — Encoder p_θ(s_1|x), Theory Programmer p_θ(z_ik|s_k)→변분 q_φ(z_ik|s_k,y), 공유 Markov 전이 p_θ(s_{k+1}|s_k,z_ik). 변분 사후분포(Eq. 4)에서 인코더와 실행모델은 생성모형과 공유되고 프리미티브 선택 항만 목표 조건부 q_φ로 교체된다.
  • Theory Programmer는 (s_k, s_y=E_θ(y))를 입력받아 M′개 프리미티브에 대한 범주형 분포를 내는 goal-conditioned policy이며, VQ-VAE 코드북 ℰ={e_1..e_M′}로 이산화된다. Algorithm 3에 따르면 정책은 연속 질의 벡터를 내고 로짓 ℓ_j = −‖q_φ(s_k,s_y) − c_j‖²/T 로 최근접 코드를 고른다. 코드북 크기는 NEO GridWorld 6 / Arithmetic 16 (Disc-Mono는 36/40).
  • 프리미티브 심볼은 사전 정의된 의미가 없는 학습된 Language of Thought 어휘이고, 의미(operational semantics)는 공유 전이 모델 f_θ가 부여한다 — NEO는 프로그램의 syntax(조합 방식)와 semantics(상태 변환)를 관찰만으로 동시에 학습한다.
  • 실행은 결정론적 s_{k+1}=f_θ(s_k,z_ik)로 구현되며(축퇴 전이분포), 스텝·프리미티브별 개별 네트워크가 아닌 단 하나의 공유 엔진이다. 구현체는 GridWorld/Image Editing=FiLM-MLP(정책·전이 모두), Arithmetic=Transformer 정책(4heads/6layers) + Cross-Attention 전이(2heads/4layers), action dim 16, commitment β=0.25.
  • 실행 루프: s_1=E_θ(x), s_y=E_θ(y) → K스텝 언롤(선택→실행→모든 중간 상태 디코드 ŷ_k=D_θ(s_k)) → MDL로 k*=argmin λ_MDL^k ℓ(y,ŷ_k) 선택 → ŷ_{k*}에서만 역전파(truncated) → L_NEO = ℓ(y,ŷ_τ) + λ_vq L_VQ + λ_state L_state. 테스트 시엔 ℓ(y,ŷ_k) ≤ ε에서 조기 종료하고, 지원쌍에서 뽑은 τ̂를 질의 입력에 재실행해 transferability를 잰다.
  • State Grounding L_state = Σ_k ‖s_k − sg[E_θ(D_θ(s_k))]‖² (전이 모델만 갱신)이 없으면 학습이 완전 붕괴한다(primitiveness 1.000→0.002, 전 지표 0.000). 인코더/디코더는 사전학습 state VAE이며 NEO와 모든 베이스라인이 공유해 비교 공정성을 확보한다.
  • GridWorld α=0.33 transfer: NEO는 comp OOD 0.933 / length OOD 0.845인 반면 Disc-Mono·Cont-Mono·Cont-Mono-Opt는 모두 0.000. 학습 비용은 75.4 vs 49.8 ms/batch(약 2배), 추론 41.1 vs 28.3 ms로 Cont-Mono-Opt(91.2 ms)보다 오히려 싸다.

NEO 아키텍처 — 3개 모듈의 협주

Neural Theorizer(NEO)는 관찰쌍 (x, y) 하나만 보고 "이 현상을 만들어낸 프로그램은 무엇인가"를 역추론하는 확률 모형이다. 핵심은 두 개의 잠재변수다: 프로그램(=이론) τ = (z_i1, …, z_iK)와 그 실행 트레이스 s = (s_1, …, s_{K+1}). 논문은 조건부 우도를 이렇게 쓴다(Eq. 1–2).

  • p_θ(y|x) = ∫ p_θ(y|s_{K+1}) · p_θ(τ, s|x) dτ ds
  • p_θ(τ,s|x) = p_θ(s_1|x) · Π_{k=1..K} p_θ(z_ik|s_k) · p_θ(s_{k+1}|s_k, z_ik)

이 곱셈 분해가 그대로 아키텍처 3분할이 된다. p_θ(s_1|x)=Encoder, q_φ(z_ik|s_k,y)=Theory Programmer, p_θ(s_{k+1}|s_k,z_ik)=Transition Model(공유 실행엔진). 주변화가 불가능하므로 변분 사후분포 q_φ(τ,s|x,y)를 두고 ELBO(Eq. 3)를 최적화하는데, 여기서 인코더와 실행모델은 생성모형과 그대로 공유되고 프리미티브 선택 항만 q_φ로 대체된다(Eq. 4). 추론기는 "무엇을 고를까"만 담당하고, "고른 것이 무엇을 하는가"는 생성모형이 쥔다.

모듈 1 — Encoder E_θ: 관찰 → 잠재상태

s_1 = E_θ(x). 이후 모든 연산은 픽셀이 아니라 이 잠재공간에서 일어난다. 구현상 인코더/디코더는 사전학습된 state VAE이며(GridWorld·Image Editing은 CNN, Arithmetic은 학습된 임베딩 레이어 + Linear 디코더), NEO와 모든 베이스라인이 동일한 사전학습 모델을 공유한다 — 성능 차이가 표현 품질이 아니라 프로그램 구조에서 온다는 것을 담보하는 설계다. 목표 관찰 y도 같은 인코더를 통과해 s_y = E_θ(y)가 되고, 이것이 프로그래머의 목표 조건이 된다(GridWorld 기준 state dim 32, d_model 32).

모듈 2 — Theory Programmer q_φ: 목표 조건부 정책

q_φ(z_ik | s_k, y)는 goal-conditioned policy다. 입력은 현재 잠재상태 s_k와 인코딩된 목표 s_y, 출력은 M′개 프리미티브 카테고리에 대한 범주형 분포. 강화학습 정책과 형태는 같지만 보상 대신 "목표 관찰을 설명하는 상태로 트레이스를 몰고 가라"가 목적이며, 프로그램 정답 레이블 없이(무감독) 학습된다.

이산 선택은 VQ-VAE 코드북 ℰ = {e_1, …, e_M′}로 실현된다. Algorithm 3이 메커니즘을 그대로 노출한다: 정책이 뱉은 연속 벡터 q_φ(s_k, s_y)와 각 코드 c_j 사이의 음의 제곱거리로 로짓을 만든다 — ℓ_j = −‖q_φ(s_k,s_y) − c_j‖² / T. 즉 정책은 코드북 공간의 질의 벡터를 내고, 최근접 코드가 선택된 프리미티브가 된다. 참 프리미티브 수 M은 모르므로 M′는 하이퍼파라미터다(NEO: GridWorld 6, Arithmetic 16 — 반면 Disc-Mono는 36/40).

논문이 강조하는 지점: 이 코드들은 사전 정의된 의미가 없는 추상 심볼, 곧 학습된 Language of Thought의 어휘다. "Their meaning is not specified a priori, but is induced through the shared execution model." 심볼의 operational semantics를 부여하는 주체는 전이 모델이다.

모듈 3 — Transition Model f_θ: 공유 실행엔진

일반 정식화는 확률적 전이 p_θ(s_{k+1}|s_k, z_ik)지만, 구현은 단순성·안정성을 위해 결정론적 특수 case s_{k+1} = f_θ(s_k, z_ik)를 쓴다(모든 확률질량이 한 점에 몰린 축퇴 분포). 여기서 shared가 핵심어다 — 스텝마다·프리미티브마다 별도 네트워크를 두지 않고 단 하나의 엔진이 (상태, 심볼)을 받아 다음 상태를 낸다. 이 공유가 재사용성과 길이 일반화의 물리적 근거다.

도메인 Policy (q_φ) Transition (f_θ) 코드북
GridWorld / Image Editing FiLM-MLP FiLM-MLP 6 (NEO) vs 36 (Disc-Mono)
Arithmetic Transformer (4 heads / 6 layers) Cross-Attention (2 heads / 4 layers) 16 (NEO) vs 40 (Disc-Mono)

부가 스펙: action dim 16, commitment cost β=0.25, Gumbel-Softmax τ 0.3→0.1 어닐링, Arithmetic은 코드북 EMA decay 0.99.

실행은 어떻게 일어나는가 — 단계별

학습(Algorithm 1) 기준 데이터 흐름:

  1. 인코딩: s_1 ← E_θ(x), s_y ← E_θ(y)
  2. k = 1…K 언롤: (a) 프리미티브 샘플 z_ik ~ q_φ(·|s_k, s_y) → (b) 실행 s_{k+1} ← f_θ(s_k, z_ik) → (c) 모든 중간 상태를 디코드 ŷ_k = D_θ(s_k)
  3. MDL 길이 선택: k* = argmin_k λ_MDL^k · ℓ(y, ŷ_k) (Eq. 5) — λ_MDL > 1이 길이를 지수적으로 벌한다
  4. 역전파는 ŷ_{k*}에서만 — 이후 스텝은 잘라낸다(truncated objective)
  5. 총 손실: L_NEO = E[ℓ(y, ŷ_τ)] + λ_vq·L_VQ + λ_state·L_state (Eq. 7)

여기서 State Grounding(Eq. 6)이 아키텍처적으로 결정적이다. 중간 상태는 최종 s_{K+1}만 맞으면 되므로 "유효한 관찰이 아닌" 지름길 상태로 표류할 수 있다. 그래서 decode–encode 왕복 일치를 강제한다: L_state = Σ_k ‖s_k − sg[E_θ(D_θ(s_k))]‖² (sg=stop-gradient, 전이 모델만 갱신). 제거하면 학습이 붕괴한다 — primitiveness 1.000 → 0.002, 전 지표 0.000.

**테스트 시(Algorithm 2)**는 2단계다. 지원쌍 (x⁽¹⁾,y⁽¹⁾)에서 greedy로 τ̂를 뽑고(재구성 오차 ℓ(y,ŷ_k) ≤ ε이면 조기 종료), 그 프로그램을 질의 입력 x⁽²⁾에 그대로 재실행해 ŷ⁽²⁾ = D_θ(f_τ̂(E_θ(x⁽²⁾)))를 얻는다. 이것이 OTIB의 self-explainability(d(ŷ⁽¹⁾,y⁽¹⁾))와 transferability(d(ŷ⁽²⁾,y⁽²⁾))를 분리 측정하는 프로토콜이다.

3분할이 만드는 차이 (GridWorld, α=0.33, transfer 기준)

방법 ID Comp. OOD Length OOD
Disc-Mono (단일 VQ 벡터, LAPO/Genie류) 0.983 0.000 0.000
Cont-Mono (단일 연속 벡터, AdaWorld류) 0.001 0.000 0.000
Cont-Mono-Opt (테스트시 경사 탐색) 0.000 0.000 0.000
NEO 0.911 0.933 0.845
NEO-S (B=64 샘플링 + 다수결) 0.970 0.976 0.907

모놀리식 베이스라인은 ID에서 잘하고 OOD에서 0으로 붕괴한다. 비용은 합리적이다 — NEO 학습 75.4 ms/batch(vs Disc-Mono 49.8, 약 2배), 추론 41.1 ms(vs 28.3); 테스트시 최적화를 쓰는 Cont-Mono-Opt는 오히려 91.2 ms(Arithmetic에선 178.9 ms)다. 코드북을 6→36으로 키우면 GridWorld가 더 오르고(comp OOD transfer 0.976), λ_MDL을 1.2로 과하게 주면 primitiveness가 0.213으로 무너진다 — 표현력과 단순성 압력 사이의 트레이드오프가 세 모듈의 협주를 조율하는 노브다.

학습된 사고언어(LoT) — VQ-VAE 코드북으로 프리미티브 유도

NEO는 손으로 설계한 DSL 없이, VQ-VAE 이산 코드북 ℰ={e_1,…,e_M'}으로 "의미가 미리 정해지지 않은" 프리미티브 기호 집합을 원시 관측 쌍만으로 유도하고, 이를 공유 전이 모델 p_θ(s_k+1|s_k,z_ik)에 통과시켜 조성 가능한 프로그램 τ=(z_i1,…,z_iK)로 실행한다. 이산성 + MDL 길이 페널티 + state grounding 손실의 조합이 프리미티브를 인스턴스 전용 지름길이 아닌 재사용 가능한 어휘로 만들며, 실제로 NEO의 코드북은 도메인당 6~16개로 단일스텝 베이스라인(36~64개)보다 훨씬 작다.

핵심 요점

  • 프리미티브 z_i는 '사전 정의된 의미가 없는 추상 기호'이며, 의미는 모든 스텝이 공유하는 전이 모델 p_θ(s_{k+1}|s_k,z_ik)이 잠재 상태를 어떻게 바꾸는가로만 정의된다(조작적 의미).
  • 이산 선택은 VQ-VAE 코드북 ℰ={e_1,…,e_M'}으로 구현된다. 이론 프로그래머 q_ϕ(z_ik|s_k,y)는 목표 조건부 정책으로 다음 프리미티브를 고르고, 그 출력이 최근접 코드로 양자화된다(commitment cost β=0.25, Arithmetic은 EMA 0.99).
  • 프로그램 τ=(z_i1,…,z_iK)는 함수 합성 f_τ = f_z_iK ∘ ⋯ ∘ f_z_i1 으로 실행되며, 전이 모델이 공유되기 때문에 학습 중 못 본 조합과 학습보다 긴 길이로도 확장 가능하다(조성 OOD·길이 OOD).
  • 재사용성을 강제하는 두 장치: MDL 정지 규칙 k*=arg min_k λ_MDL^k ℓ(y,ŷ_k) (λ_MDL>1, 길이에 지수 페널티 — 과분해 방지)와 상태 접지 손실 ℒ_state=Σ‖s_k−sg[E_θ(D_θ(s_k))]‖² (중간 상태를 유효 관측 매니폴드에 고정).
  • 코드북 크기가 주장의 증거다: NEO는 GridWorld 6 / Arithmetic 16 / Image Editing 16개 프리미티브로 설명하는 반면, 단일스텝 Disc-Mono는 합성 변환 전체를 코드 하나에 담아야 해 36 / 40 / 64개가 필요하다.
  • DSL 부재의 의미: DreamCoder·NPI는 기호 입력·명시적 DSL·태스크 단위 감독을 전제하고 ARC는 고정된 표현 편향 위에서 동작하는 반면, NEO는 원시 관측 쌍만으로 프로그램의 문법(합성 방식)과 의미(상태 전이)를 동시에 학습한다. 대가는 기호의 비해석성과 약 2배의 학습 비용(75.4 vs 49.8 ms/batch 등).

학습된 사고언어(LoT) — VQ-VAE 코드북으로 프리미티브 유도

NEO(Neural Theorizer)의 핵심 주장은 "세계를 설명하는 어휘 자체를 관측에서 배운다"는 것이다. 논문의 표현을 그대로 옮기면, 유도된 프리미티브 집합은 **"학습된 사고언어(Language of Thought)의 어휘를 구성하며, 사전에 정의된 의미가 없는 추상 기호(abstract symbols without predefined semantics)"**다. 이 절은 그 기호가 VQ-VAE 코드북으로 어떻게 만들어지고, 어떻게 재조합 가능한 프로그램이 되며, "DSL을 안 짠다"는 말이 실제로 무엇을 뜻하는지를 다룬다.

1. 프리미티브의 정의 — 기호는 비어 있고, 의미는 실행기가 준다

NEO는 프리미티브 연산 집합 𝒵 = {z_1, z_2, …, z_M}을 두고, 각 z_i에 실행 함수 f_{z_i}: 𝒳 → 𝒳를 대응시킨다. 여기서 결정적인 설계는 기호와 의미의 분리다. 논문은 이렇게 못박는다 — "Their meaning is not specified a priori, but is induced through the shared execution model, which assigns operational semantics by defining how each symbol transforms latent states."

즉 z_3이 "오른쪽으로 이동"인지 "×5"인지는 코드북 어디에도 적혀 있지 않다. 공유 전이 모델 p_θ(s_{k+1} | s_k, z_{ik})이 그 기호를 잠재 상태에 적용했을 때 무슨 일이 일어나는가가 곧 그 기호의 조작적 의미(operational semantics)다. 로보틱스로 옮기면, 스킬 이름을 사람이 정의하는 대신 "이 토큰을 주면 플랜트 상태가 이렇게 변한다"는 관계만으로 스킬 어휘가 정의되는 구조다.

2. VQ-VAE: 이산 코드북이 담당하는 역할

이 이산 선택은 실제로 VQ-VAE로 구현된다. 논문: "this discrete selection is realized via a vector-quantized variational autoencoder (VQ-VAE), which provides a discrete codebook ℰ = {e_1, …, e_{M'}} of primitive symbols."

동작 흐름은 이렇다.

  1. 이론 프로그래머(theory programmer) q_ϕ(z_ik | s_k, y)가 현재 잠재 상태 s_k와 목표 관측 y를 보고 다음에 쓸 프리미티브를 고른다. 논문은 이를 목표 조건부 정책(goal-conditioned policy) 이라 부른다 — "y를 설명하는 잠재 상태 쪽으로 실행 궤적을 몰아가도록 다음 프리미티브를 선택한다".
  2. 정책이 뱉은 연속 벡터가 코드북 ℰ의 최근접 코드로 양자화된다. 이때 표준 VQ 손실의 commitment cost β는 GridWorld·Image Editing에서 0.25, Arithmetic에서는 EMA decay 0.99 방식이 쓰인다.
  3. 선택된 코드가 공유 전이 모델을 통과해 s_{k+1}을 만든다.

왜 연속이 아니라 이산인가? 논문이 배경으로 삼는 Fodor식 LoT 관점에서 표현은 "구조적으로는 이산·조성적(discrete and compositional in structure)이되 실행은 연속(continuous in execution)" 이어야 한다. 공학적으로 보면 이산 코드북은 유한한 어휘라는 병목을 강제한다. 연속 잠재는 관측 쌍 하나하나에 맞춘 벡터를 자유롭게 만들어 낼 수 있어 "재사용"이 아니라 "인스턴스 전용 매핑"으로 붕괴하기 쉽다. 실제로 논문의 비교군 명명이 이 축을 그대로 반영한다.

모델 표현 스텝 수(K) 성격
NEO 이산 코드북(VQ) 4(GridWorld) / 3(Arithmetic, Image Editing) 다단계 조성적 프로그램
Disc-Mono 이산 코드북 1 변환 전체를 코드 하나로
Cont-Mono 연속 잠재(VAE) 1 연속 벡터 하나로
Cont-Mono-Opt 연속 잠재 + 테스트타임 경사 최적화 1 추론 시 latent를 직접 최적화

3. 프리미티브 → 재조합 가능한 프로그램

이론(theory) τ는 프리미티브의 순서 있는 시퀀스다.

τ = (z_i1, z_i2, …, z_iK),   z_ik ∈ 𝒵
f_τ = f_{z_iK} ∘ f_{z_i(K-1)} ∘ ⋯ ∘ f_{z_i1},   y = f_τ(x)

생성 과정과 변분 사후분포는 각각 이렇게 인수분해된다.

p_θ(τ, s | x) = p_θ(s_1 | x) ∏_{k=1..K} p_θ(z_ik | s_k) · p_θ(s_{k+1} | s_k, z_ik)
q_ϕ(τ, s | x, y) = p_θ(s_1 | x) ∏_{k=1..K} q_ϕ(z_ik | s_k, y) · p_θ(s_{k+1} | s_k, z_ik)   … (Eq. 3)

여기서 p_θ가 모든 스텝에서 공유된다는 점이 조성성의 기계적 근거다. 같은 전이 모델이 모든 프리미티브를 실행하므로, 학습 중 본 적 없는 조합 (z_2, z_5, z_1)도 학습된 각 기호의 의미를 그대로 이어붙여 실행할 수 있다. 프로그램 길이 역시 원리상 학습 길이를 넘어 늘릴 수 있다(길이 OOD / productivity).

두 개의 보조 장치가 이 구조를 지탱한다.

  • MDL 기반 가변 길이 정지 (Eq. 4): k* = arg min_{k ∈ {1,…,K+1}} λ_MDL^k · ℓ(y, ŷ_k). λ_MDL > 1이 프로그램 길이에 지수적 페널티를 걸어, "낮은 복원 오차 + 짧은 프로그램"을 동시에 만족하는 설명을 고른다. 이게 없으면 모델이 변환을 잘게 쪼개 과분해(over-decomposition)하며 재사용성을 잃는다. 실제 값은 GridWorld(α=1.0)에서 1.00, Arithmetic 1.01→0.99, Image Editing 1.01→1.0 또는 1.05→1.0으로 스케줄링된다.
  • 상태 접지 손실 (Eq. 5): ℒ_state = Σ_{k=1..K} ‖ s_k − sg[E_θ(D_θ(s_k))] ‖². 중간 상태 s_k를 디코딩–재인코딩한 값에 붙여, 모든 중간 상태가 유효한 관측의 매니폴드 위에 놓이도록 강제한다(gradient는 전이 모델만 갱신). 중간 단계가 "디코딩 불가능한 임시 벡터"로 새는 퇴화 지름길을 막는 장치다.

4. 결과: 코드북이 실제로 작아진다

프리미티브가 진짜 재사용 단위로 수렴했는지를 보여주는 가장 직접적인 수치는 도메인별 코드북 크기다.

도메인 NEO 코드북 Disc-Mono 코드북 잠재 상태 차원 최대 길이 K
GridWorld 6 36 32 4 (baseline 1)
Arithmetic Reasoning 16 40 8 3 (baseline 1)
Image Editing 16 64 256 3 (baseline 1)

단일 스텝 베이스라인은 합성 변환 전체를 코드 하나에 담아야 하므로 조합 수만큼 코드가 필요하다(36·40·64). NEO는 같은 현상 집합을 6~16개 기호의 순차 합성으로 설명한다. 아키텍처는 인코더/디코더 = CNN(GridWorld, Image Editing) 또는 임베딩 레이어(Arithmetic), 정책망 = FiLM-MLP 또는 Transformer, 전이망 = FiLM-MLP 또는 Cross-Attention이며, 프리미티브 임베딩 차원은 세 도메인 모두 16이다. 비용은 순차 실행 때문에 단일 패스 대비 학습 약 2배다(GridWorld 75.4 vs 49.8 ms/batch, Arithmetic 78.9 vs 25.0, Image Editing 106.7 vs 58.7 — RTX 4090 기준).

평가 지표도 이 구조를 겨냥한다. 논문은 프로그램 전이성(program transferability) 을 주 지표로 쓴다 — 현상 (x_1, y_1)에서 프로그램을 추론한 뒤 다른 입력 x_2에 그대로 적용해 y_2를 예측한다. 성공하면 그 프로그램이 인스턴스 전용 매핑이 아니라 재사용 가능한 설명 메커니즘임이 입증된다.

5. "손으로 짠 DSL이 없다"는 것의 의미

논문이 선행 연구와 선을 긋는 지점은 명확하다. "Unlike prior approaches that rely on symbolic supervision, task grouping, or explicit program annotations, NEO learns solely from raw observation pairs." 그리고 "NEO jointly learns both the syntax of programs (how primitives are composed) and their semantics (how these compositions realize state transitions) directly from observation."

배경 지식과의 구분 — DreamCoder나 Neural Programmer-Interpreter 계열의 라이브러리 학습은 "프리미티브 라이브러리를 성장시킨다"는 점에서 유사해 보이지만, 논문의 정리에 따르면 이들은 기호적 입력, 명시적 DSL, 태스크 단위 감독 중 하나 이상을 전제한다. 즉 어휘의 바닥(base primitives) 은 사람이 깔아 준다. ARC-AGI 계열은 저데이터 추론을 강조하지만 고정된 표현 편향(fixed representational biases) 위에서 동작하며 프리미티브 자체를 학습하지 않는다. NEO는 태스크 그룹화 없이 독립적인 관측 쌍만 받는다는 점에서 요구 감독량이 한 단계 낮다.

엔지니어 관점에서 이 차이는 구체적이다. DSL을 손으로 짠다는 것은 (a) 도메인마다 사람이 연산 목록을 열거해야 하고, (b) 그 목록이 곧 성능 상한이며, (c) 새 도메인마다 처음부터 다시 짜야 한다는 뜻이다. NEO의 주장은 이 세 가지 비용을 코드북 크기 M'이라는 하이퍼파라미터 하나 + MDL 페널티 하나로 대체할 수 있다는 것이다. 다만 대가도 분명하다 — 유도된 기호에는 사람이 읽을 이름이 없고(사후 해석이 별도 작업), 조성성은 공유 전이 모델의 품질에 전적으로 의존하며, 순차 실행 탓에 학습 비용이 약 2배다.

확률적 추론과 MDL — 프로그램 길이를 스스로 고른다

NEO는 관측쌍 (x,y)를 이산 프로그램 τ와 실행궤적 s라는 두 잠재변수로 설명하는 조건부 생성모델로 정식화되고, VQ-VAE 코드북 위의 목표조건부 정책(theory programmer) q_φ가 변분 사후분포 역할을 하며 ELBO를 최적화한다. 핵심 장치는 MDL 기준 k* = argmin_k λ_MDL^k·ℓ(y, ŷ_k)로 인스턴스마다 프로그램 길이를 스스로 고르게 하는 것이며, state grounding·결정적 실행·two-timescale LR·λ_MDL 어닐링이 학습 안정화를 담당한다.

핵심 요점

  • NEO는 pθ(y|x)를 프로그램 τ와 실행궤적 s 두 잠재변수로 분해한 조건부 생성모델(Eq.1-2)이고, 변분 사후 q_φ(τ,s|x,y)는 인코더·실행모델을 생성모델과 공유한 채 프리미티브 선택항만 대체한 목표조건부 정책(theory programmer)으로 ELBO(Eq.3-4)를 최적화한다.
  • 프리미티브는 VQ-VAE 코드북 위의 사전 의미 없는 심볼(Language of Thought)이며, 의미는 모든 스텝이 공유하는 전이연산자가 부여한다 — 구문과 의미를 관측만으로 동시 학습.
  • MDL 기준 k* = argmin_k λ_MDL^k·ℓ(y, ŷ_k) (Eq.5)로 인스턴스마다 프로그램 길이를 적응적으로 고르고 ŷ_k*에서만 역전파(truncated objective)한다. 테스트 시엔 ℓ(y,ŷ_k) ≤ ε 조기종료라 학습보다 긴 프로그램(length OOD)도 생성된다.
  • λ_MDL은 1 근처의 좁은 대역에서만 작동한다(실사용 0.95~1.05, Arithmetic 1.01→0.99 / Image Editing 1.05→1.0 선형 어닐링). Table 3에서 λ_MDL=1.2면 primitiveness 1.000→0.213, comp-OOD transfer 0.160으로 붕괴하고(짧고 뭉친 설명 암기), 0.8이면 길이가 늘며 primitiveness가 회복된다.
  • 최종 목적함수는 L_NEO = E[ℓ(y,ŷ_τ)] + λ_vq·L_VQ + λ_state·L_state (Eq.7). State grounding(Eq.6)은 stop-gradient로 전이모델만 갱신해 중간상태를 유효 관측 매니폴드에 고정하며, 제거 시 primitiveness 0.002·전 split 성능 0.000으로 학습이 완전히 붕괴한다.
  • 안정화 스택: 결정적 실행 s_k+1=f_θ(s_k,z_ik), 인코더/디코더 사전학습(CNN VAE 또는 임베딩), two-timescale LR(정책 0.25~0.5 vs 전이 1.0), Gumbel-Softmax 온도 어닐링·EMA 0.99·직교 정규화, λ_MDL 어닐링. 학습 비용은 단일패스 베이스라인의 약 2배(75.4 vs 49.8 ms/batch 등)이지만 추론은 gradient 탐색(Cont-Mono-Opt)보다 저렴하다.

확률적 추론과 MDL — 프로그램 길이를 스스로 고른다

NEO의 뼈대는 화려한 신경망이 아니라 **"프로그램을 잠재변수로 둔 조건부 생성모델 + 변분추론"**이라는 고전적 구조다. 여기에 MDL 한 줄을 얹어 "설명의 길이"까지 학습 대상으로 만든 것이 이 논문의 실질적 기여다.

1. 생성모델: 잠재변수는 프로그램 τ와 실행궤적 s

NEO는 조건부 우도 pθ(y|x)를 최대화한다. 이때 두 종류의 잠재변수를 도입한다.

  • 프로그램 τ = (z_i1, …, z_iK), z_ik ∈ 𝒵 — 이산 프리미티브의 나열
  • 실행궤적 s = (s_1, …, s_K+1) — 프로그램을 잠재공간에서 한 스텝씩 굴린 흔적

마르코프 가정 하에 논문은 다음을 쓴다.

  • Eq.(1) pθ(y|x) = ∫ pθ(y|s_K+1) pθ(τ,s|x) dτ ds
  • Eq.(2) pθ(τ,s|x) = pθ(s_1|x) ∏_{k=1..K} pθ(z_ik|s_k) pθ(s_k+1|s_k, z_ik)

세 부품의 역할이 명확히 분리된다: 인코더 pθ(s_1|x), 프리미티브를 고르는 theory programmer pθ(z_ik|s_k), 그리고 모든 스텝이 공유하는 마르코프 전이연산자 pθ(s_k+1|s_k, z_ik). 전이모델을 스텝마다 따로 두지 않고 하나로 공유하는 것이 "프리미티브 재사용성"을 구조적으로 강제하는 지점이다. 이 단계에서는 프로그램 길이 K를 고정으로 두고, 3.3절에서 이를 푼다.

2. 추론모델: 목표조건부 정책으로서의 theory programmer

Eq.(1)의 주변화가 불가능하므로 변분 사후분포 q_φ(τ,s|x,y)를 두고 ELBO를 최적화한다.

  • Eq.(3) log pθ(y|x) ≥ E_{q_φ}[log pθ(y|s_K+1)] − KL(q_φ(τ,s|x,y) || pθ(τ,s|x))
  • Eq.(4) q_φ(τ,s|x,y) = pθ(s_1|x) ∏_k q_φ(z_ik|s_k, y) pθ(s_k+1|s_k, z_ik)

여기서 인코더와 실행모델은 생성모델과 공유되고 오직 프리미티브 선택 항만 q_φ로 교체된다. 즉 추론이 곧 "정책 롤아웃"이다. q_φ는 현재 잠재상태 s_k와 인코딩된 목표 s_y = E_θ(y)를 받아 M′개 프리미티브에 대한 categorical 분포를 내는 목표조건부 정책이고, 이산화는 VQ-VAE 코드북 ℰ = {e_1,…,e_M′}로 구현되어 end-to-end 학습이 가능하다. 참 프리미티브 개수 M은 모르므로 M′는 하이퍼파라미터다.

논문의 표현대로 이 심볼들은 사전 의미가 없는(Language of Thought의) 어휘다. 의미는 공유 실행모델이 "이 심볼이 상태를 어떻게 바꾸는가"로 사후적으로 부여한다 — 구문(합성 규칙)과 의미(상태 전이)를 관측만으로 동시에 학습하는 구조다. 최종 상태는 ŷ_τ = D_θ(s_K+1)로 디코딩된다.

3. MDL: 길이를 스스로 고르는 메커니즘

K를 고정하면 단순한 현상까지 억지로 잘게 쪼개져 재사용성 낮은 미세 프리미티브가 양산되고 과적합 위험이 커진다. 논문은 MDL 원리를 도입해 **"가장 짧은 프로그램을 내는 이론이 가장 합성적이고 재사용 가능한 프리미티브 집합을 준다"**고 가정한다.

구현은 놀랍도록 간단하다. 각 중간 스텝 k마다 ŷ_k = D_θ(s_k)를 디코딩해두고

Eq.(5) k* = argmin_{k ∈ {1,…,K+1}} λ_MDL^k · ℓ(y, ŷ_k)

를 고른다. λ_MDL > 1이면 길이에 지수적 페널티(로그 도메인에서는 k에 비례하는 가산 페널티 = 프로그램 기술길이)가 붙는다. 그리고 선택된 k의 예측 ŷ_k에서만 역전파한다(이후 스텝은 무시하는 truncated objective). 결과적으로 인스턴스마다 설명 길이가 달라지고 그 길이가 실제 변환 단계 수와 정렬된다(Figure 5).

테스트 시에는 임계값 기반 조기종료를 쓴다: ℓ(y, ŷ_k) ≤ ε이면 그 시점의 프로그램을 이론으로 반환. 같은 합성 절차를 계속 이어붙이기만 하면 되므로 학습 때보다 긴 프로그램(length OOD)도 자연스럽게 생성된다.

λ_MDL은 민감한 손잡이다. 부록 F의 실제 사용값은 1 근처의 매우 좁은 대역이다.

도메인 K 코드북 크기 λ_MDL
GridWorld (α=0.33 / 0.66) 4 6 0.95
GridWorld (α=1.00) 4 6 1.00
Arithmetic 3 16 1.01 → 0.99 (스케줄 비율 0.1)
Image Editing 3 16 1.05 → 1.0 (α=0.66), 1.01 → 1.0 (α=0.33)

Table 3(GridWorld α=0.33)의 절제실험이 그 이유를 보여준다. 코드북을 36으로 과잉공급해도 NEO는 프리미티브 수준 코드를 유도하고(primitiveness 1.000, length-OOD transfer 0.930), 압력이 과하면 무너진다: λ_MDL=1.2에서 primitiveness 0.213, comp-OOD transfer 0.160으로 급락 — 짧고 뭉친(entangled) 설명을 외우는 쪽으로 학습이 기운다. 반대로 λ_MDL=0.8은 길이를 늘려 primitiveness 1.000을 회복한다. Figure 8은 λ_MDL이 클수록 평균 설명 길이가 짧아지고 λ_MDL ∈ {0.8, 1.0}이 GT 프로그램 길이를 잘 추종함을 보이며, Figure 9–12의 코드–프리미티브 정렬 히트맵도 같은 결론이다(λ=1.2에서 일대일 정렬 붕괴).

4. 학습 목적함수와 안정화 기법

실제 구현은 결정적 실행 s_k+1 = f_θ(s_k, z_ik)을 택하므로 우도항이 재구성손실 ℓ(y, ŷ_τ)로 축약되고, VQ-VAE를 쓰므로 KL 항은 명시적으로 계산하지 않고 코드북·commitment 손실로 대체된다.

Eq.(7) L_NEO(θ,φ) = E_{q_φ,θ(τ|x,y)}[ℓ(y, ŷ_τ)] + λ_vq · L_VQ + λ_state · L_state

여기에 Eq.(5)의 k*로 truncate한 버전을 최적화한다. 안정화 장치는 다음과 같다.

  • State grounding (Eq.6) L_state = Σ_{k=1..K} ||s_k − sg[E_θ(D_θ(s_k))]||². 디코드–인코드 왕복 일관성으로 중간 상태를 유효 관측 매니폴드에 붙잡아 둔다. stop-gradient 때문에 전이모델만 업데이트된다. 이게 없으면 학습이 완전히 붕괴한다 — primitiveness 0.002, 모든 split의 self-explainability/transferability 0.000.
  • 결정적 실행: 확률적 전이의 degenerate 특수케이스로, 단순성과 학습 안정성이 목적.
  • 인코더/디코더 사전학습: GridWorld·Image Editing은 CNN VAE, Arithmetic은 임베딩 레이어를 미리 학습해 잠재공간을 고정.
  • Two-timescale 학습률: 정책과 전이망의 LR 스케일을 분리(GridWorld 0.25 / 1.0, Arithmetic 0.5 / 1.0, Image Editing 0.25 / 0.5) — 정책을 천천히 움직여 의미가 굳기 전에 심볼 배치가 요동치는 것을 막는다.
  • λ_MDL 선형 어닐링(Arithmetic·Image Editing): 초반엔 프리미티브 발견을 유도하고 후반에 길이 적응을 맡긴다.
  • VQ 부수 기법: Gumbel-Softmax 온도 어닐링(0.3→0.1, Arithmetic 0.3→0.05, 스케줄 비율 0.25), EMA decay 0.99, 직교 정규화 가중치 10(Arithmetic), grounding loss 가중치 0.1~0.5.

학습 루프(Algorithm 1)는 ① s_1, s_y 인코딩 → ② K스텝 롤아웃 → ③ k* 선택 → ④ L_rec + λ_vq L_vq + λ_state L_state 역전파의 4단계로 끝난다. 비용은 순차 전이 때문에 단일패스 베이스라인 대비 약 2배(GridWorld 75.4 vs 49.8 ms/batch, Arithmetic 78.9 vs 25.0, Image Editing 106.7 vs 58.7)지만, 추론은 gradient 기반 탐색인 Cont-Mono-Opt(GridWorld 91.2 ms, Arithmetic 178.9 ms)보다 훨씬 싸다(NEO 41.1 / 27.5 ms).

엔지니어링 요약: NEO의 MDL은 별도 탐색 알고리즘이 아니라 손실 선택 규칙 한 줄이다. 다만 λ_MDL은 1.0 ± 0.05 수준의 좁은 대역에서만 작동하고, state grounding 없이는 학습 자체가 성립하지 않는다.

(배경 구분: VQ-VAE는 van den Oord et al. 2017의 이산 코드북 학습 기법, MDL은 Grünwald 계열 모델선택 원리, DreamCoder는 심볼 프로그램 공간을 전제한 라이브러리 학습 계열로 모두 논문이 인용하는 선행 배경이다. NEO의 기여는 이들을 "프로그램 공간을 사전정의하지 않고 관측만으로" 결합한 데 있다.)

OTIB 벤치마크 — 이론 유도를 측정하는 3개 도메인

OTIB(Observation-to-Theory Induction Benchmark)는 심볼릭 감독·태스크 그룹핑·사전 정의 프리미티브를 모두 제거하고 오직 원시 관찰쌍 (x, y)만으로 "재사용 가능한 이론"을 유도할 수 있는지 측정하는 벤치마크로, GridWorld(10×10 이동), Arithmetic Factorization({×2,×3,×5,×7}), Image Editing(CIFAR-10 8종 편집) 3개 도메인에서 ID / 조합 OOD / 길이 OOD 세 축으로 평가한다. 핵심 채점 기준은 support 쌍에서 유도한 이론 τ̂를 별도의 query 쌍에 재실행해 측정하는 transferability이며, α ∈ {0.33, 0.66, 1.00}로 훈련 커버리지를, K′ > K로 길이 외삽 난이도를 통제한다.

핵심 요점

  • OTIB는 심볼릭 감독·태스크 그룹핑(ARC-AGI식 few-shot 묶음)·사전 정의 프리미티브를 모두 제거하고, i.i.d. 관찰쌍 (x, y)만으로 재사용 가능한 이론을 유도할 수 있는지 측정한다 — 논문은 이 덕분에 '궤적에서 시간적으로 떨어진 프레임' 같은 최소 큐레이션 데이터에 바로 적용 가능하다고 주장한다
  • 채점의 중심은 transferability: 같은 τ가 만든 support 쌍 (x⁽¹⁾,y⁽¹⁾)에서 τ̂를 유도해 query 쌍 x⁽²⁾에 재실행한 오차. self-explainability와 분리함으로써, 잠재 벡터에 y 정보를 실어 나르는 단일 벡터 baseline(Cont-Mono: Self-Ex. 0.975 vs Transf. 0.001)을 즉시 드러낸다
  • 훈련/평가 분리는 SVIB(Kim et al., 2023) 스타일 α-분할 + 길이 외삽(𝒯_test ⊂ 𝒵^{K′}_*, K′ > K, 교집합 공집합). α ∈ {0.33, 0.66, 1.00}이고, 일부 프리미티브는 단독으로 절대 관찰되지 않고 얽힌 긴 프로그램 안에만 등장하도록 샘플링해 '분해에 의한 발견'을 강제한다
  • 3개 도메인: GridWorld(10×10, 이동 4종, 훈련 1–3 → 길이 OOD 4–8), Arithmetic Factorization(정수쌍, {×2,×3,×5,×7}, 1–3 → 4–6), Image Editing(CIFAR-10, 편집 8종, 1–2 → 3–4). 각각 이산 격자 / 정확 심볼 산술 / 고차원 연속 픽셀을 담당한다
  • '이론'은 도메인별로 이동 시퀀스·인수분해 경로·편집 연산 시퀀스이며, 어휘는 VQ-VAE 코드북(NEO는 GridWorld |E|=6, 나머지 |E|=16)에서 창발한다. 평가 시 최대 전이 길이 K도 함께 늘린다(GridWorld 4→10, 나머지 3→6)
  • α=0.33 transferability에서 GridWorld는 NEO 0.933(조합 OOD)/0.845(길이 OOD)인 반면 Disc-Mono·Cont-Mono·Cont-Mono-Opt는 전부 0.000. Image Editing은 ℓ1 기준 NEO 0.12/0.13으로, identity 기준선(0.212/0.271)에 붙어버리는 baseline(0.16–0.19)과 갈린다

OTIB 벤치마크 — 이론 유도를 측정하는 3개 도메인

설계 철학: 세 가지 "공짜 정보"를 걷어낸다

NEO 논문은 기여 목록에서 OTIB를 "models can infer reusable theories from observation without program supervision or task grouping"을 평가하는 벤치마크로 정의한다. 즉 OTIB의 설계는 기존 프로그램 유도 벤치마크가 모델에 미리 쥐여주던 것들을 의도적으로 제거하는 데서 출발한다.

  • 심볼릭 감독 없음 — 학습 신호는 오직 원시 관찰쌍 (x, y)뿐이다. 논문은 선행 연구들이 심볼릭 감독(Nye et al., 2020), 태스크 그룹핑(Chollet, 2019), 명시적 프로그램 주석(Mao et al., 2019)에 의존한다고 대조한다.
  • 태스크 그룹핑 없음 — ARC-AGI처럼 "같은 프로그램을 공유하는 few-shot 예제 묶음"을 가정하지 않는다. 논문 표현 그대로 "our formulation imposes no such structure: 𝒟_train consists of i.i.d. phenomena. Thus, the approach is directly applicable to large-scale datasets." 로보틱스 관점에서 이 조건이 중요한 이유는, 논문이 명시하듯 이런 데이터가 "궤적에서 시간적으로 떨어진 두 프레임"처럼 최소한으로 큐레이션된 관찰 데이터로 그대로 충족되기 때문이다(언어 설명·태스크 라벨·정답 프로그램 불필요).
  • 사전 정의 프리미티브 없음 — 어휘는 VQ-VAE 코드북 E = {e₁,…,e_M′}으로 end-to-end 학습 중에 창발한다. 코드의 의미는 사전에 지정되지 않고 공유 실행 모델(transition model)을 통해 유도된다.

채점 기준: self-explainability와 transferability의 분리

OTIB의 중심 기준은 transferable explanation이다. 평가 인스턴스 하나는 같은 잠재 프로그램 τ가 만든 두 쌍으로 구성된다 — support 쌍 (x⁽¹⁾, y⁽¹⁾)와 query 쌍 (x⁽²⁾, y⁽²⁾). 모델은 support에서만 이론 τ̂를 유도한 뒤 이를 두 입력 모두에 실행한다.

지표 정의 무엇을 잡아내나
Self-Ex. (self-explainability) d(ŷ⁽¹⁾, y⁽¹⁾) 관찰한 현상을 재현하는가
Transf. (transferability) d(ŷ⁽²⁾, y⁽²⁾) 이론이 새 입력에 재사용되는가

이 분리가 벤치마크의 핵심 장치다. Cont-Mono 같은 단일 벡터 baseline은 GridWorld ID에서 Self-Ex. 0.975를 찍고도 Transf.는 0.001이다 — 잠재 벡터가 프로그램이 아니라 y 자체의 정보를 실어 나른 것을 즉시 드러낸다.

훈련/평가 분리: α 커버리지 + 길이 외삽

논문은 SVIB(Kim et al., 2023 — 동일 Ahn 그룹의 시각 세계모델 체계적 일반화 벤치마크) 스타일 프로토콜을 따른다.

  1. 관측 가능한 복잡도 범위 안의 모든 조합을 열거하고, 그중 α 비율만 훈련(ID) 에 넣는다. 나머지가 조합 OOD다. α ∈ {0.33, 0.66, 1.00}.
  2. 앵커 프로그램은 항상 훈련에 포함해 공간의 거친 커버리지를 보장한다.
  3. 결정적으로, 샘플링은 "some primitives are never observed in isolation and instead appear only as parts of longer, entangled programs" 를 보장한다. 즉 어떤 프리미티브는 단독으로는 절대 관찰되지 않고 긴 얽힌 프로그램의 일부로만 등장하므로, 모델은 다단계 전이를 분해해서 그것을 발견해야 한다. α가 작을수록 어려워진다. 단, 훈련 조합만으로도 원리적으로 전체 프리미티브 집합을 복원할 증거는 충분하도록 설계됐다.
  4. 길이 OOD: 형식적으로 𝒯_test ⊂ 𝒵^{K′}_*, 𝒯_test ∩ 𝒯_train = ∅, K′ > K. 논문은 이를 "length generalization, i.e., productivity" 라 부른다. 평가 시에는 최대 전이 길이 K 하이퍼파라미터도 함께 늘려 더 긴 설명을 구성할 여지를 준다(GridWorld K=4→10, Arithmetic K=3→6, Image Editing K=3→6).

3개 도메인의 구조

GridWorld Arithmetic Factorization Image Editing
관찰 (x, y) 10×10 격자, 객체 1개의 (초기, 최종) 상태 정수쌍 CIFAR-10 이미지쌍 (공식 train–test 분할)
이론 τ move up/right/down/left 4개 모션 프리미티브의 순서열 {×2, ×3, ×5, ×7} 곱셈 프리미티브 순서열 = 인수분해 경로 8개 편집 연산의 순서열 (br p ×1.5 / br m ×0.5, hue ±0.3, h flip, v flip, rot 90°, mask 좌상단 25%)
훈련 길이 1–3 1–3 1–2
조합 OOD 같은 1–3 범위의 미관측 조합 같은 1–3 범위, 길이별 층화 같은 1–2 범위
길이 OOD 4–8 4–6 3–4
앵커 UUU, DDD, LLL, RRR ×2×2×2, ×3×3×3, ×5×5×5, ×7×7×7 (정규 순서 조합, 픽셀차 임계 초과만 유지)
데이터(α=0.33) 100,000 / ID 10,000 / comp 10,000 / len 20,000 147,968 / 14,796 / 146,306 / 15,317 720,000 / 144,000 / 840,000 / 393,886
채점 d 전 픽셀 완전 일치 심볼 완전 일치 ℓ1 거리(↓)
NEO 코드북 ` E ` 6

구체적으로 GridWorld α=0.33에서 훈련은 앵커 + {U, LU, DL, DR, DD, DDL, DRR}뿐이고, L·R·D는 단독 프로그램으로 한 번도 등장하지 않은 채 조합 OOD에 놓인다. Arithmetic α=0.33에서는 ×3, ×5가 같은 역할을 한다. Image Editing α=0.33에서는 br m/br p/hue m/hue p/rot 5종이 Level-1 OOD다. (개념도 Figure 1의 Rotate/Left/Down/Paint는 프레임워크 설명용 예시이고, 실제 GridWorld 태스크 프리미티브는 Table 4의 이동 4종이다.)

Arithmetic의 길이 OOD가 왜 유독 어려운지도 논문이 예시로 못 박는다: x=73 → y=273,750은 6단계 인수분해 ×5 ×5 ×5 ×5 ×3 ×2를 추론하고 정확한 다자릿수 산술까지 실행해야 한다.

실제 격차 (α=0.33, Transferability)

  • GridWorld: NEO 0.933(조합 OOD) / 0.845(길이 OOD). Disc-Mono·Cont-Mono·Cont-Mono-Opt는 모두 0.000. NEO-S(테스트타임 샘플링 B=64)는 0.976 / 0.907.
  • Arithmetic: NEO 0.345 / 0.038, NEO-S(B=1024) 0.759 / 0.524. 논문은 낮은 길이-OOD 수치가 "프리미티브 부재가 아니라 긴 지평에서의 선택·조합 난이도"에서 온다고 해석하며, 탐색으로 α=0.66에서 0.02→0.696까지 오르는 것을 근거로 든다.
  • Image Editing(ℓ1, 낮을수록 좋음): NEO 0.12 / 0.13, baseline 0.16–0.19. 기준선으로 identity(x를 그대로 출력) 가 조합 OOD 0.212·길이 OOD 0.271이므로, baseline들이 사실상 "거의 손대지 않는 쪽"으로 붕괴하는 것과 NEO의 0.09–0.12가 구분된다.

세 도메인은 각각 이산 상태공간(격자) · 정확 심볼 연산(산술) · 고차원 연속 픽셀(이미지) 를 담당하도록 배치되어 있고, 같은 α·길이 외삽 프로토콜이 세 곳에 동일하게 적용된다는 점이 OTIB의 설계 요지다.

실험 결과 — 설명 기반 일반화의 증거

NEO는 OTIB의 3개 도메인(GridWorld·산술 인수분해·이미지 편집)에서 monolithic 베이스라인(Disc-Mono/Cont-Mono/Cont-Mono-Opt)이 구성 OOD·길이 OOD에서 전이 성능 0으로 붕괴하는 것과 대조적으로 추론한 프로그램을 새 입력에 재사용하는 transferability를 유지하며(GridWorld α=0.33에서 구성 OOD 0.933, 길이 OOD 0.845), state grounding 제거 시 완전 붕괴·λ_MDL 과대 시 primitiveness 0.213으로 하락하는 ablation이 이 성능이 '설명 구조' 덕분임을 보인다. (집필 노트: arXiv HTML v2는 §4~7이 렌더 누락되어 있어 모든 수치는 PDF 원문에서 추출했습니다 — 다른 섹션 집필자도 PDF를 쓰는 편이 안전합니다.)

핵심 요점

  • 평가 축이 둘이다 — self-explainability(관측 재현)와 transferability(같은 τ̂를 새 입력 x⁽²⁾에 재사용). 두 값의 격차가 '이론을 배웠는가 vs y를 외웠는가'를 가르는 진단기다.
  • monolithic 베이스라인은 ID에서만 산다: GridWorld α=0.33에서 Disc-Mono는 ID 전이 0.983 → OOD 0.000, Cont-Mono/Cont-Mono-Opt는 self-ex 0.43~0.73에도 전이 0.000. NEO는 구성 OOD 0.933, 길이 OOD 0.845를 유지.
  • 테스트 타임 탐색(NEO-S: B개 샘플 + 다수결)이 구성 구조의 존재를 역으로 증명한다 — 산술 길이 OOD 전이 약 0.02 → 0.696(α=0.66)/0.707(α=1.00), 반면 monolithic 베이스라인은 B를 키워도 평평하다.
  • 이미지 편집(ℓ1, 낮을수록 좋음)에서 NEO는 구성 OOD 0.09, 길이 OOD 0.11로 항등 기준선 0.212/0.271과 베이스라인 0.12~0.21을 모두 앞선다.
  • Ablation: state grounding 제거 시 primitiveness 0.002로 완전 붕괴, λ_MDL=1.2면 0.213으로 얽힌 설명 선호, |E|=36 과대 코드북에서도 프리미티브 수준 코드를 유도(성능은 오히려 향상) — GT 개수에 코드북을 맞춰서 이긴 것이 아니다.
  • 정성 결과: code–primitive alignment 거의 1:1, 단독 관측된 적 없는 프리미티브 복원, 구성 OOD를 `brightness+ → mask`로 분해, MDL이 인스턴스별 k*(1 또는 2)를 자동 선택.
  • 비용: 학습 약 2×, 추론은 Cont-Mono-Opt 대비 훨씬 쌈(38ms vs 571ms)이나 NEO-S는 O(K×B)로 예산↔일반화 trade-off.

실험 결과 — 설명 기반 일반화의 증거

무엇을 측정하는가: OTIB와 두 개의 축

논문은 OTIB(Observation-to-Theory Induction Benchmark) 를 새로 정의한다. 판정 기준은 예측 정확도가 아니라 전이 가능한 설명(transferable explanation) 이다. 평가 인스턴스는 같은 잠재 프로그램 τ로 생성된 support 쌍 (x⁽¹⁾, y⁽¹⁾) 과 query 쌍 (x⁽²⁾, y⁽²⁾) 로 구성된다. 모델은 support에서 이론 τ̂를 유도한 뒤 두 입력 모두에 실행한다.

  • Self-explainability = d(ŷ⁽¹⁾, y⁽¹⁾) — 관측한 그 현상을 스스로 설명하는가
  • Transferability = d(ŷ⁽²⁾, y⁽²⁾) — 같은 이론이 새 입력에서도 성립하는가(= 이론의 재사용성)

두 값의 격차가 진단 도구다. self-ex는 높은데 transf가 0이면 잠재 벡터가 τ가 아니라 y 자체의 정보를 흘려 담은 것이다.

분할은 SVIB(Kim et al., 2023) 스타일로, 관측 가능 복잡도 범위의 전체 조합 중 α ∈ {0.33, 0.66, 1.00} 만 학습에 넣고 나머지를 구성(compositional) OOD 로 둔다. 설계상 일부 원시 연산은 단독으로 절대 관측되지 않고 긴 프로그램 안에만 얽혀 등장한다(OTIB-Arithmetic α=0.33의 held-out에 ×3, ×5가 단독으로 포함). 도메인은 GridWorld(10×10, 상하좌우 4 primitive, 학습 길이 1–3 → 길이 OOD 4–8), Arithmetic Factorization({×2,×3,×5,×7}, 1–3 → 4–6), Image Editing(CIFAR-10, 8종 편집 primitive, 1–2 → 3–4)이다.

베이스라인: 프로그램을 "한 덩어리 벡터"로 보는 셋

베이스라인 표현 추론 대응 선행연구
Disc-Mono conditional VQ-VAE, 단일 양자화 코드 z ∈ E amortized 1-pass LAPO, Genie
Cont-Mono conditional β-VAE, 연속 벡터 z ∈ ℝᵈ amortized 1-pass AdaWorld
Cont-Mono-Opt Cont-Mono와 동일 테스트 타임 gradient ascent z⁽ᵗ⁺¹⁾ = z⁽ᵗ⁾ + η∇_z log p_θ(y|x,z) LPN

셋 다 프로그램을 원시 연산의 열이 아닌 단일 벡터로 표현한다. Cont-Mono-Opt는 "실패 원인이 amortization gap인가, 구성 구조 부재인가"를 가르기 위한 강한 대조군이다.

GridWorld: 베이스라인의 OOD 붕괴

Table 1(3-seed 평균, NEO-S는 B=64), α=0.33:

Method ID (Self/Transf) Comp. OOD Length OOD
Disc-Mono 0.988 / 0.983 0.000 / 0.000 0.000 / 0.000
Cont-Mono 0.975 / 0.001 0.431 / 0.000 0.053 / 0.000
Cont-Mono-Opt 0.994 / 0.000 0.726 / 0.000 0.209 / 0.000
NEO 0.914 / 0.911 0.934 / 0.933 0.853 / 0.845
NEO-S 0.993 / 0.970 0.995 / 0.976 0.978 / 0.907

Disc-Mono는 ID 전이 0.983이지만 OOD에서 정확히 0 — 단일 이산 코드는 본 조합만 기억한다. Cont-Mono/Opt는 self-ex가 0.43~0.73까지 올라가도 전이는 0 — 테스트 타임 최적화가 y를 맞추는 벡터는 찾지만 재사용 가능한 이론은 못 찾는다. NEO만 두 값이 붙어 있다(0.934 vs 0.933). α=0.66/1.00에서도 NEO의 길이 OOD 전이는 0.927 / 0.898을 유지한다.

산술 인수분해: 프리미티브는 있는데 조합이 어려운 경우

Table 2에서 NEO의 구성 OOD 전이는 0.345(α=0.33), 0.573(α=0.66) 으로 베이스라인(0.000~0.004)을 크게 앞선다. 반면 길이 OOD 전이는 0.019~0.038로 낮다. 논문은 이를 프리미티브 부재가 아니라 긴 호라이즌에서의 선택·조합 난이도로 해석한다(예: x=73 → y=273,750은 ×5×5×5×5×3×2의 6단계 정확 곱셈).

NEO-S 가 이 해석을 검증한다. 확률적 theory programmer q_φ에서 B개 후보 이론을 뽑아 다수결로 하나만 고른다(추가 감독 없음). 길이 OOD 전이가 약 0.02 → 0.696(α=0.66), 0.707(α=1.00) 으로 뛴다. GridWorld에서도 B를 키우면 단조 개선되지만 monolithic 베이스라인은 평평하다 — 탐색 이득 자체가 구성 구조의 존재 증거다. 샘플링 온도를 올려 argmax 밖 프리미티브를 탐색하면 개선폭이 더 커진다(Figure 20).

이미지 편집: 고차원 픽셀 공간에서의 ℓ1

Table 11(ℓ1, 낮을수록 좋음). 참고선: 항등 변환(x↔y ℓ1)이 구성 OOD 0.212 / 길이 OOD 0.271.

α=0.66 ID Comp. OOD Length OOD
Disc-Mono 0.07 / 0.07 0.14 / 0.15 0.16 / 0.17
Cont-Mono 0.06 / 0.13 0.13 / 0.18 0.15 / 0.21
Cont-Mono-Opt 0.06 / 0.13 0.12 / 0.18 0.14 / 0.21
NEO 0.07 / 0.07 0.09 / 0.09 0.11 / 0.11

여기서도 Cont-Mono 계열은 self-ex(0.06)와 전이(0.13)가 두 배 벌어지는 반면 NEO는 붙어 있고, 전 α·전 OOD 구간에서 0.09~0.13을 유지한다.

Ablation (Table 3, GridWorld α=0.33)

기준 설정은 |E|=6, λ_MDL=0.95. primitiveness = 학습된 액션 하나로 각 GT 프리미티브를 정확히 재현할 수 있는 비율.

변형 Prim. Comp. OOD (Self/Transf) Length OOD
NEO (Base) 1.000 0.934 / 0.933 0.853 / 0.845
− No Grounding 0.002 0.000 / 0.000 0.000 / 0.000
+ |E|=36 (과대 코드북) 1.000 0.980 / 0.976 0.935 / 0.930
w/ λ_MDL=1.2 0.213 0.228 / 0.160 0.221 / 0.169
w/ λ_MDL=0.8 1.000 0.859 / 0.956 0.750 / 0.748
  • State grounding(Eq. 6)은 필수: 제거하면 중간 상태가 latent manifold를 벗어나 학습이 통째로 붕괴(모든 지표 0).
  • 코드북을 GT 개수에 맞춰 이긴 게 아니다: |E|=36으로 과대 배정해도 NEO는 관측 조합을 코드에 통째 할당하지 않고 프리미티브 수준 코드를 유도하며 성능이 오히려 좋아진다. 산술·이미지(|E|=16, 과완비)에서도 실제 프리미티브만 사용한다.
  • λ_MDL이 결정적: 1.2면 짧고 얽힌 설명을 선호해 primitiveness가 0.213으로 무너진다. λ_MDL ∈ {0.8, 1.0}일 때 평균 설명 길이가 GT 프로그램 길이를 따라간다(Figure 8).

정성적 증거: 발견된 프로그램

  • Code–primitive alignment 행렬(Figure 9–18): GridWorld α=0.33에서 학습 코드와 4개 GT 이동 프리미티브가 거의 1:1. 이미지 편집 α=0.33에서는 5개 프리미티브가 단독으로 한 번도 등장하지 않았음에도 3개를 발견하고, α=0.66에서는 누락된 3개를 전부 복원한다.
  • 구성 OOD 설명(Figure 4, α=0.66): 베이스라인은 단일 벡터로 한 번에 y를 만들려다 실패하지만, NEO는 같은 현상을 brightness+ → mask 2단계 실행 프로그램으로 분해한다.
  • MDL 기반 길이 자동 선택(Figure 5): 같은 모델이 인스턴스별로 k*=1(hue p) 또는 k*=2(br p → v flip, h flip → hue m)를 골라 실제 변환 복잡도에 맞춘다.
  • 길이 OOD 실행 트레이스(Figure 22, B=1024·τ=1.0): 3,326 → ×3 ×3 ×3 ×2 ×3 → 538,812처럼, argmax 경로와 샘플링 경로가 만드는 탐색 격자에서 정답 실행 경로를 찾아낸다.

비용 (엔지니어링 관점)

NEO는 K단계 순차 forward 때문에 학습 비용이 단일 pass 대비 약 2배(이미지 편집 48,779s vs 22,925s). 추론은 GridWorld 41.1ms(Disc-Mono 28.3ms, Cont-Mono-Opt 91.2ms), 이미지 편집은 NEO 38.06ms vs Cont-Mono-Opt 571.35ms 로 gradient 탐색보다 훨씬 싸다. 다만 NEO-S는 O(K×B)라 산술 B=1024에서 4,867ms까지 오르므로 탐색 예산 ↔ OOD 일반화는 명시적 trade-off로 다뤄야 한다.

로보틱스·에이전트 시사점

NEO는 로봇 실험이 전혀 없는 합성 벤치마크 논문이지만, 비교 베이스라인이 LAPO/Genie(Disc-Mono)·AdaWorld(Cont-Mono)·LPN(Cont-Mono-Opt)이라 사실상 "관측만으로 latent action을 뽑는 VLA/세계모델 사전학습 계열이 조합적 일반화에서 어디서 무너지는지"를 통제 실험으로 보여준다. 재사용 가능 스킬의 조작적 지표(transferability), 얽힌 시연에서의 원자 스킬 복원, 열람 가능한 중간 상태, 폰급 모델 크기와 anytime 탐색 예산 B는 로보틱스에 직접 시사점을 주지만, 목표 관측 y 의존·결정론적 실행·합성 환경 한정이라는 갭이 크다.

핵심 요점

  • NEO의 베이스라인 Disc-Mono/Cont-Mono/Cont-Mono-Opt는 각각 LAPO·Genie / AdaWorld / LPN에 대응한다고 논문이 명시 — 즉 로보틱스가 쓰는 latent action model 계열의 조합적 일반화 한계를 통제 실험으로 드러낸 결과다. 다만 저자들은 '제어를 위한 행동 학습이 목적이 아니다'라고 선을 긋고, 로봇 실험은 전혀 없다.
  • 재사용 가능한 스킬 여부의 조작적 지표가 transferability(support 쌍에서 뽑은 τ̂를 다른 입력 x⁽²⁾에 실행). GridWorld α=0.33에서 Cont-Mono는 자기설명 0.975인데 전이 0.001(목표 y 누설), Disc-Mono는 OOD 전이 0.000(조합 통짜 암기), NEO는 0.911/0.933/0.845, NEO-S(B=64)는 0.970/0.976/0.907.
  • OTIB는 일부 원시연산이 단독으로는 절대 관측되지 않고 긴 얽힌 프로그램 안에만 등장하도록 설계 — 라벨 없는 복합 텔레오퍼레이션 시연과 동형. NEO는 primitiveness에서 '직접 관측 가능' GT 상한을 넘어섰고, 과대 코드북(|E|=36 vs GT 6)에서도 primitiveness 1.000을 유지했다.
  • 설명 가능성이 부산물이 아니라 학습 장치: 중간 상태가 ŷ_k = D_θ(s_k)로 전부 디코딩되고, MDL(k* = argmin λ_MDL^k ℓ)이 인스턴스별 가변 길이 스킬 분절을 만들며, 추론 시 primitive 선택을 덮어써 반사실 트레이스를 낼 수 있다. 단 state grounding 제거 시 primitiveness 0.002로 전면 붕괴, λ_MDL=1.2에서도 0.213으로 무너져 하이퍼파라미터에 매우 예민하다.
  • 온디바이스 궁합은 좋다 — GridWorld d_model 32/state 32/|E|=6/K=4, 이미지 편집 state 256/|E|=16/K=3의 FiLM-MLP 수준. 추론은 단일패스 대비 1.4~2.1배(41.1 vs 28.3 / 27.5 vs 13.0 / 38.06 vs 24.53 ms)로 경사탐색(91.2~571.35ms)보다 싸다. 샘플링 예산 B가 anytime 노브: 산술 길이 OOD 전이 0.019→0.696(B=1024)이지만 B=1024는 4867ms로 제어 루프 불가, B=8은 42.1ms.
  • 현실 갭: q_φ(z|s_k, y)는 '원시연산에 대한 goal-conditioned policy'라 목표 관측 y 없이는 못 돌아가는 역모델이며, 결정론적 실행 + 재구성 기반 종료는 저자 스스로 노이즈·모호성·부분관측에 취약하다고 인정. 원시연산 의미는 재구성으로만 유도돼 인과성/해석가능성 보장 없음, K≤4의 짧은 이산 프로그램 가정, 실험은 전부 합성 벤치마크.

로보틱스·에이전트 시사점

선을 먼저 긋자. 이 논문에는 로봇 실험이 없다. 저자들은 명시적으로 "일부 베이스라인이 제어용 latent action model 아키텍처에 대응하지만, 우리의 초점은 정책 실행을 위한 행동 학습이 아니라 설명과 이론 구성을 위한 합성적 원시연산 발견"이라고 못박는다(Appendix C.1). 실험 도메인은 GridWorld 10×10, 정수 인수분해, CIFAR-10 이미지 편집 세 가지 합성 벤치마크뿐이다. 그럼에도 NEO가 로봇 엔지니어에게 중요한 이유는, 비교 대상이 정확히 로보틱스가 쓰는 그 모델들이기 때문이다.

베이스라인이 곧 우리가 쓰는 스택이다

논문 베이스라인 실제 대응 구조
Disc-Mono LAPO, Genie conditional VQ-VAE, 프로그램 = 단일 이산 코드
Cont-Mono AdaWorld conditional β-VAE, 프로그램 = 단일 연속 벡터
Cont-Mono-Opt LPN 위 + 테스트타임 경사 탐색(5~30스텝)

즉 이 논문은 관측만으로 latent action을 뽑는 VLA 사전학습 계열(LAPO/LAPA/Genie/AdaWorld)이 조합적 일반화에서 어디서 무너지는지를 통제 실험으로 보여준 것에 가깝다. Dreamer/RSSM 계열 세계모델도 "예측 중심"으로 같은 범주에 묶인다.

핵심 지표는 정확도가 아니라 transferability

OTIB는 같은 잠재 프로그램 τ가 만든 support 쌍 (x⁽¹⁾,y⁽¹⁾)과 query 쌍 (x⁽²⁾,y⁽²⁾)을 준다. support에서 이론 τ̂를 뽑아 다른 입력 x⁽²⁾에 실행한 결과를 재는 것이 transferability다. 이게 "재사용 가능한 스킬을 얻었는가"의 조작적 정의다. GridWorld α=0.33 (자기설명/전이):

방법 ID 조합 OOD 길이 OOD
Disc-Mono 0.988 / 0.983 0.000 / 0.000 0.000 / 0.000
Cont-Mono 0.975 / 0.001 0.431 / 0.000 0.053 / 0.000
Cont-Mono-Opt 0.994 / 0.000 0.726 / 0.000 0.209 / 0.000
NEO 0.914 / 0.911 0.934 / 0.933 0.853 / 0.845
NEO-S (B=64) 0.993 / 0.970 0.995 / 0.976 0.978 / 0.907

두 가지 실패 모드가 로보틱스에 그대로 대응한다. (1) Cont-Mono의 자기설명 0.975 vs 전이 0.001 — 연속 잠재 벡터가 τ가 아니라 y 자체를 담아버리는 목표 누설(paper: "encoding y-specific information in the latent"). 시연 재현은 되는데 새 초기조건에서 안 되는, 모방학습에서 흔한 증상이다. (2) Disc-Mono의 OOD 0.000 — 단일 코드는 Left-Down을 통짜로 외운다. 처음 보는 조합 앞에서 완전 붕괴한다.

얽힌 시연에서 원자 스킬을 복원한다

OTIB 설계에서 일부 원시연산은 단독으로 한 번도 관측되지 않고 오직 더 긴 얽힌 프로그램 안에서만 등장한다. 텔레오퍼레이션 시연이 늘 복합 동작이고 원자 스킬이 라벨링돼 있지 않은 현실과 정확히 같은 구조다. Figure 7의 primitiveness에서 NEO는 "직접 관측 가능한 원시연산 비율"인 GT 상한을 넘어선다 — 즉 분해를 통해 본 적 없는 원자를 복원한다. 코드북을 과대하게 잡아도(|E|=36, GT는 6) primitiveness 1.000, 길이 OOD 전이 0.930으로 조합을 통째로 외우는 쪽으로 퇴화하지 않았다.

데이터 가정도 로봇 로그와 맞물린다. 논문은 "x_n = x_{t_n}, y_n = x_{t_n+t′_n}로 두면 되고, 시각 t_n과 시간차 t′_n 모두 미관측이어도 된다"고 쓴다. 행동 라벨·보상·태스크 그룹핑·언어 주석 없이 i.i.d. 프레임 쌍만 있으면 된다(ARC-AGI식 few-shot 태스크 묶음 가정도 불필요).

설명 가능성은 부산물이 아니라 학습 장치다

모든 중간 상태가 ŷ_k = D_θ(s_k)로 디코딩되므로 내부 계획이 이미지로 열람 가능하다. MDL 기준 k* = argmin_k λ_MDL^k · ℓ(y, ŷ_k)이 인스턴스마다 설명 길이를 고르므로, 고정 호라이즌이 아니라 가변 길이 스킬 분절이 나온다. 추론 시 theory programmer의 선택을 덮어써서 반사실 실행 트레이스를 만들 수도 있다 — HITL 게이팅이나 사고 후 재구성에 바로 쓰일 형태다.

단, 이 구조는 하이퍼파라미터에 예민하다. state grounding L_state(디코드–인코드 사이클로 중간 상태를 관측 매니폴드에 고정)를 빼면 primitiveness 0.002, 모든 지표 0.000으로 학습이 붕괴한다. 잠재 롤아웃이 매니폴드 밖으로 표류하는, 다단계 잠재 세계모델의 고질적 문제 그 자체다. λ_MDL도 1.2로 올리면 짧고 얽힌 설명을 택해 primitiveness 0.213 / 조합 OOD 전이 0.160으로 무너진다.

온디바이스 소형 모델과의 궁합

모델이 아주 작다. GridWorld는 d_model 32 / d_ff 128 / state 32 / action 16 / |E|=6 / K=4의 FiLM-MLP, 이미지 편집도 state 256 / |E|=16 / K=3이다. 무거운 건 지각 백본(사전학습 VAE)이고 이론화 계층 자체는 폰급이다. 추론 비용(ms/batch):

도메인 Disc-Mono NEO Cont-Mono-Opt NEO-S
GridWorld 28.3 41.1 91.2 —
산술 13.0 27.5 178.9 42.1 (B=8) / 4867.3 (B=1024)
이미지 편집 24.53 38.06 571.35 —

학습은 단일패스 대비 약 2배, 추론은 1.4~2.1배인데 경사 탐색(Cont-Mono-Opt)보다는 훨씬 싸다. 더 흥미로운 건 B가 anytime 노브라는 점이다. 산술 길이 OOD 전이가 NEO 0.019 → NEO-S(B=1024) 0.696(α=0.66), 0.023 → 0.707(α=1.00)로 뛴다. "원시연산은 이미 배웠고 재조합만 어렵다"는 진단이며, 온디바이스에서는 B를 낮게(예산 42.1ms) 두고 어려운 케이스만 서버로 올리는 계층 배치가 자연스럽다 — 단 B=1024는 4.9초로 제어 루프에 못 들어간다.

모방학습/RL 접목 가능성과 현실 갭

접목 지점은 분명하다. q_φ(z_i|s_k, y)는 논문 표현 그대로 **"원시연산에 대한 goal-conditioned policy"**다. 목표 이미지 y를 주면 원시연산 시퀀스가 나오는, 사실상 잠재공간 스킬 플래너다. 발견된 코드북을 RL의 옵션/행동 어휘로 쓰거나, 시연에서 뽑은 τ̂를 라벨로 삼는 파이프라인은 구조적으로 열려 있다.

다만 논문 자체가 "초기 개념 증명"이라 못박은 갭이 크다.

  • 정책이 아니라 역모델이다. 추론에 목표 관측 y가 필요하다. y 없는 자율 실행은 논문 범위 밖.
  • 결정론적 실행 + 재구성 기반 종료(ℓ ≤ ε) 는 저자 스스로 "노이즈·모호성·부분관측에서 취약할 수 있다"고 적었다. 로봇은 셋 다 상시다.
  • 원시연산 의미는 재구성으로만 유도되므로 "인간이 해석 가능하거나 진짜 인과적이라는 보장이 없다".
  • 짧고 이산적인 원시연산 집합 가정(K≤4, |E| 6~36)은 장기 호라이즌·연속 동역학으로의 확장성을 제한한다.
  • 접촉 물리·동역학 오차·안전 제약을 다룬 실험이 전무하고, 전부 통제된 합성 환경이다.

한계와 전망

NEO 논문(ICML 2026, KAIST MLML)의 §6 Limitations & Discussion을 1차 근거로 네 가지 자인 한계(작은 이산 프리미티브·짧은 프로그램 가정, 재구성으로만 유도되는 프리미티브 의미론의 해석성 부재, 결정론적 실행·재구성 기반 정지 기준의 잡음 취약성, 합성 벤치마크 한정)를 정리하고, 길이 OOD 실패(0.019~0.038)·약 2배 학습 비용과 NEO-S의 O(K×B) 폭증·state grounding/λ_MDL 민감성 같은 수치 기반 한계를 더했다. 후속 방향(확률적 실행 복원, 탐색의 학습화, 개입·반사실)과 SVIB→OTIB로 이어지는 Sungjin Ahn 그룹 계보상의 다음 단계 전망까지 포함한 위키 섹션이다.

핵심 요점

  • 논문 §6은 이 작업을 'L2T의 초기 개념증명'으로 규정하고 네 가지 한계를 자인한다: 작은 이산 프리미티브·짧은 프로그램 가정(long-horizon/연속/고구조 동역학 확장성 제약), 재구성으로만 유도되는 프리미티브 의미론(인간 해석 가능 개념·인과 인자 정렬 무보장), 결정론적 실행 + 재구성 기반 정지 기준의 잡음·모호성·부분관측 취약성, 통제된 합성 벤치마크(OTIB) 한정.
  • 실험 스케일이 작다: GridWorld 10×10·프리미티브 4종(학습 1~3, 길이 OOD 4~8), 산술 {×2,×3,×5,×7}(1~3 → 4~6), 이미지 편집 CIFAR-10 8종(1~2 → 3~4). 프리미티브 수 M과 길이 K가 모두 한 자릿수.
  • 긴 지평이 약점: 산술 길이 OOD에서 NEO transferability는 0.019~0.038에 그치고, 테스트타임 탐색(NEO-S, B=1024 다수결)이 0.696(α=0.66)/0.707(α=1.00)로 끌어올린다 — 성능의 상당 부분을 탐색 예산으로 매수하는 구조.
  • 계산 비용: 순차 전이로 학습 약 2배(이미지 106.7 vs 50.1 ms/batch, 총 48,779s vs 22,925s), 추론은 1.5배 수준(41.1 vs 26.6 ms)이나 NEO-S는 O(K×B)로 폭증(산술 B=1024에서 4,867.3 ms/batch). 단 Cont-Mono-Opt(이미지 571.35 ms)보다는 빠름.
  • 정규화 민감성: state grounding 제거 시 primitiveness 1.000 → 0.002로 전 지표 붕괴, λ_MDL=1.2에서 primitiveness 0.213·조합 OOD transfer 0.160으로 저하(0.8~1.0은 정상). 반면 코드북 |E|=36 과대용량에는 강건.
  • 계보: OTIB의 α-분할은 같은 그룹의 SVIB(Kim·Singh·Park·Gulcehre·Ahn, NeurIPS 2023)를 계승하고, 기준선 Disc-Mono≈LAPO/Genie·Cont-Mono≈AdaWorld는 잠재 행동 모델을 '프로그램을 벡터 하나로 뭉갠 특수 케이스'로 재해석한 것이다. 다음 단계 전망(논문 주장 아님)은 슬롯 기반 인자화 프리미티브, theory-guided planning, 실데이터 이전.

한계와 전망

1. 논문이 스스로 인정한 한계 (§6 Limitations & Discussion)

저자들은 이 연구를 "Learning-to-Theorize(L2T)의 초기 개념증명(initial proof of concept)" 으로 명시적으로 규정한다. §6에서 밝힌 한계는 네 가지다.

  • 도메인 규모: 현재 정식화는 "상대적으로 작은 이산 프리미티브 집합과 짧은 프로그램 길이"를 가정한다. 실제 실험도 GridWorld(10×10 격자, 정답 프리미티브 4종 = up/down/left/right, 학습 길이 1~3, 길이 OOD 4~8), 산술 인수분해(프리미티브 {×2, ×3, ×5, ×7}, 학습 1~3, 길이 OOD 4~6), 이미지 편집(CIFAR-10 위 8종 편집, 학습 1~2, 길이 OOD 3~4)에 그친다. 즉 프리미티브 수 M과 프로그램 길이 K가 모두 한 자릿수다. 저자들은 이것이 long-horizon·연속·고도로 구조화된 동역학으로의 확장성을 제한한다고 적는다.
  • 프리미티브 해석성: 프리미티브의 의미(semantics)는 오직 재구성 손실을 통해서만 유도되므로 "인간이 해석 가능한 개념이나 진짜 인과 인자와 정렬된다는 보장이 없다". NEO의 프리미티브는 사전 정의된 의미가 없는 추상 기호이고, 의미는 공유 전이 모델이 부여하는 조작적 의미론(operational semantics)일 뿐이다. 논문은 이를 primitiveness(정답 프리미티브 커버리지)와 purity(1:1 대응)로 정량 평가할 뿐, 라벨링·언어 접지는 하지 않는다.
  • 잡음·부분관측 취약성: 추론이 결정론적 실행(일반형 p_θ(s_{k+1}|s_k, z_{i_k})의 퇴화 특수형 s_{k+1}=f_θ(s_k, z_{i_k}))과 재구성 기반 정지 기준(ℓ(y, ŷ_k) ≤ ε, 그리고 MDL의 k* = argmin λ_MDL^k · ℓ(y, ŷ_k))에 의존한다. 저자들은 이 설계가 "잡음, 모호성, 부분관측 하에서 취약할(brittle) 수 있다"고 인정한다. 실세계 관찰에 필연적인 센서 잡음은 재구성 오차 임계값을 그대로 무너뜨린다.
  • 합성 벤치마크 한정: 실험은 통제된 합성 벤치마크(OTIB)뿐이다. "복잡한 지각 입력, 확률적 동역학, open-ended한 이론 공간을 가진 실세계 환경으로의 확장"이 중요한 후속 과제로 남는다.

2. 독자가 추가로 짚어야 할 한계

(a) 긴 지평 재조합은 정책만으로는 아직 실패한다. 산술 과제 길이 OOD에서 NEO의 transferability는 α와 무관하게 0.019~0.038에 머문다(모놀리식 기준선은 0에 가깝다). 논문의 해명은 "프리미티브가 없어서가 아니라 긴 지평에서 올바르게 선택·조합하는 것이 어렵기 때문"이며, 실제로 테스트타임 탐색을 붙인 NEO-S(B=1024, 다수결)는 같은 지표를 0.696(α=0.66)/0.707(α=1.00) 로 끌어올린다. 바꿔 말하면 현재 theory programmer q_ϕ 자체의 조합 탐색 능력은 아직 약하고, 성능의 상당 부분이 탐색 예산으로 매수된다.

(b) 계산 비용. 저자들도 "NEO는 순차 전이 때문에 단일 패스 기준선 대비 약 2배의 학습 비용"이라고 밝힌다.

도메인 방법 학습(ms/batch) 총 학습(s) 추론(ms/batch)
GridWorld (3090, bs128) Cont-Mono / NEO 50.2 / 75.4 5,882 / 5,890 26.6 / 41.1
산술 (4090, bs512) Cont-Mono / NEO 23.1 / 78.9 9,900 / 14,300 12.1 / 27.5
산술 NEO-S (B=8 / B=1024) – – 42.1 / 4,867.3
이미지 편집 (4090, bs64) Cont-Mono / NEO 50.1 / 106.7 22,925 / 48,779 23.41 / 38.06

NEO-S는 O(K×B)로 선형 증가한다. 다만 그래디언트 기반 테스트타임 최적화인 Cont-Mono-Opt(이미지 571.35 ms/batch)보다는 여전히 빠르다. 로보틱스 관점에서는 단일 롤아웃(약 1.5배 지연)은 감내 가능하지만, 정확도를 좌우하는 대규모 샘플링 탐색은 실시간 제어 루프에 그대로 얹기 어렵다.

(c) 두 개의 정규화에 성패가 걸려 있다. 어블레이션에서 state grounding(L_state, decode–encode 일관성)을 제거하면 primitiveness가 1.000 → 0.002로, 세 평가 세트의 self-explainability/transferability가 전부 0으로 붕괴한다. λ_MDL도 민감해서 1.2로 키우면 짧고 엉킨 설명을 선호하게 되어 primitiveness 0.213, 조합 OOD transfer 0.160으로 떨어진다(0.8~1.0은 정상). 반면 코드북 |E|=36의 과대용량에는 강건해 primitiveness 1.000을 유지한다. 즉 하이퍼파라미터 견고성은 축마다 비대칭이며, 잡음 있는 실세계에서 이 두 손실을 어떻게 튜닝할지는 미해결이다.

(d) 데이터 가정. (x, y)가 동일 잠재 프로그램에서 생성되고 관찰이 깨끗하며 인코더·디코더는 사전학습 후 공유·고정된다는 전제 위에 있다. 논문이 강조하는 "시간적으로 떨어진 두 프레임만 있으면 된다"는 일반성은 개념적 주장이고, 실제 로그 데이터(가변 시차, 다중 에이전트, 미관측 외란)에서의 검증은 없다.

3. 후속 연구 방향

논문이 명시한 방향은 실세계·확률적 동역학·open-ended 이론 공간이다. 여기에 논문 내부 단서에서 자연스럽게 파생되는 축이 더해진다.

  • 확률적 실행의 복원: 일반 정식화는 이미 확률 전이 p_θ(s_{k+1}|s_k, z_{i_k})를 담고 있으므로, 결정론 특수화를 풀고 잡음·부분관측을 흡수하는 것이 1순위다.
  • 정지 기준의 재설계: 재구성 임계값 ε 대신 불확실성 기반·학습된 검증기 기반 종료.
  • 탐색의 학습화: 현재는 온도 샘플링 + 다수결이라는 무학습 탐색이다. 빔서치·학습된 검증기·MCTS류로 O(K×B)를 줄이는 것이 명확한 다음 수다.
  • 개입과 반사실: §3.4는 theory programmer의 선택을 오버라이드해 반사실 실행 트레이스를 탐색할 수 있다고 적는다. 이는 계획·인과 실험으로 가는 직접적인 훅이다.
  • 해석성 접지: 유도된 프리미티브를 언어·인과 변수와 사후 정렬하는 작업(논문 범위 밖).

4. 이 계보에서 다음에 올 것

OTIB의 α-분할 프로토콜은 같은 그룹의 SVIB(Kim, Singh, Park, Gulcehre, Ahn, "Imagine the Unseen World", NeurIPS 2023, arXiv:2311.09064)를 따른다고 논문이 직접 밝힌다. SVIB가 단일 스텝 시각 상상의 체계적 일반화를 물었다면, OTIB/NEO는 이를 다단계 프로그램 유도로 끌어올린 후속작이다. 논문의 기준선 배치도 계보를 드러낸다 — Disc-Mono ≈ LAPO/Genie, Cont-Mono ≈ AdaWorld, 즉 잠재 행동 모델(LAM)을 "프로그램을 벡터 하나로 뭉갠 특수 케이스"로 재해석한 것이다.

여기서부터는 논문 주장이 아닌 배경 기반 전망이다. Sungjin Ahn 그룹(KAIST MLML)의 공개 연구 테마는 world model 학습·계획, 조합적 일반화와 뉴로심볼릭 세계학습, 추론/추상화, 인과 발견, 임바디드 물리 AI다. 슬롯 기반 object-centric 계열(SLATE/STEVE/DreamWeaver)과 계획 계열(Monte Carlo Tree Diffusion 등)을 함께 놓고 보면, 다음 단계로 유력한 것은 (i) 상태 s_k를 슬롯으로 분해해 객체를 인자로 받는 프리미티브(현재는 인자 없는 기호)로 확장, (ii) 유도된 이론을 목표 달성용 계획기와 결합한 theory-guided planning, (iii) 비디오·로봇 궤적처럼 시차가 불규칙한 실데이터로의 이전이다. ARC-AGI는 논문이 "프리미티브를 고정된 것으로 취급"한다고 선을 그은 대상이므로, 정면 이식보다는 프리미티브 학습을 앞단에 붙이는 형태가 자연스럽다.

이 글은 AI 리서치 파이프라인으로 작성되고 사람이 검수했습니다. 섹션마다 1차 출처를 표기합니다.