로봇도 ‘긴 기억’을 가질 수 있다 — 컨텍스트 8,000 타임스텝의 의미

Jim Fan · NVIDIA 수석 연구원, 임바디드 AI 리드 — 파운데이션 모델을 물리 세계로 확장 · 2026.07.05 ~ 07.26 큐레이션

로봇은 그동안 0.1초 미만의 짧은 기억으로 움직였어요. 몇 프레임을 보고 행동하면 바로 잊어버리는 방식이었죠. Jim Fan이 소개한 RoboTTT는 이 한계를 세 자릿수 단위로 뛰어넘으며, 로봇에게 ‘5분치 근육 기억’을 심는 실험을 공개했어요.

테스트 타임 트레이닝(TTT)으로 8,000 타임스텝 달성

We scaled a robot model natively to 8,000 timesteps of context, 5 minutes worth of muscle memory, with constant inference cost. Robot policies used to live their lives a few frames at a time (< 0.1 sec), instantly forgetting what just happened. We pushed to 3 orders of magnitude beyond SOTA. One more thing. What excites me the most is a new Context Scaling Curve: from 128 to 8K timesteps, closed-loop performance hill-climbs steadily with no sign of saturation. 8K-context pretraining beats 1K by 62%. What LLM enjoys, robotics should too. Soon, even 1M context is not a fantasy.

[1]

RoboTTT는 모델 안에 작은 신경망 코어를 내장하고, 센서 입력이 들어올 때마다 그 코어에 한 스텝씩 그래디언트 업데이트를 가해요. 덕분에 히든 스테이트(hidden state) 크기는 고정된 채로 임의로 긴 경험을 압축할 수 있어요. 컨텍스트 길이를 128에서 8,000 타임스텝으로 늘릴수록 성능이 꾸준히 올라가고, 포화 징후가 없다는 점이 특히 주목할 만해요.

인간이 물건을 떨어뜨리면 반사적으로 집어 드는 것처럼, RoboTTT는 에피소드 도중 스스로 실수를 발견하고 수정하는 능력을 보여줬어요. 회로 기판 조립 작업에서 한 번도 본 적 없는 배치를 인간이 한 번 시연하면, 로봇이 동영상 맥락만으로 그 동작을 모방하는 원샷(one-shot) 학습도 가능해졌어요.

리 페이페이 교수도 주목한 스탠퍼드-NVIDIA 협업

↻ 공유한 글

RT @drfeifei: I’m very excited by this test time training work for robotic learning! It’s an awesome collaboration between @StanfordSVL and…

[2]

AI 분야 거장인 리 페이페이(Fei-Fei Li) 교수가 이 연구에 직접 흥분을 드러낸 글을 Jim Fan이 공유했어요. 스탠퍼드 SVL(Stanford Vision Lab)과 NVIDIA의 협업 결과물이라는 점에서 학계와 산업계가 함께 만들어낸 성과라는 걸 알 수 있어요.

또한 Jim Fan은 매일 아침 로봇이 부품을 조립하는 영상을 커피 한 잔과 함께 본다고 밝혔어요.[3] 빠르지는 않지만 모든 동작을 정밀하게 측정하며 수행하는 로봇의 모습을 “치료적이고 명상적”이라고 표현했는데, 이는 단순한 기술 과시가 아니라 정밀 실행 자체에서 의미를 찾는 시각을 보여줘요.

LLM(거대 언어 모델)이 긴 컨텍스트로 성능을 높여온 것처럼, 로봇 정책도 같은 스케일링 법칙을 따를 수 있다는 것이 이번 연구의 핵심 메시지예요. 향후 100만 타임스텝 컨텍스트도 “판타지가 아니다”라는 말은, 로봇 AI가 언어 AI와 같은 궤적으로 발전할 수 있다는 가능성을 시사해요.

📚 출처 (Sources)

  1. [1]@drjimfan on 𝕏 · 2026-07-15“We scaled a robot model natively to 8,000 timesteps of context, 5 minutes worth of muscle …”
  2. [2]↻ RT@drjimfan on 𝕏 · 2026-07-15“I’m very excited by this test time training work for robotic learning! It’s an awesome col…”
  3. [3]@drjimfan on 𝕏 · 2026-07-17“My morning ritual: coffee, then watch our robot assemble stuff. The model isn’t fast, but …”

본 글은 Jim Fan(@drjimfan)이(가) 지난 14일간 X(트위터)에 올린 게시물 중 3건을 인용해
Claude(Anthropic)가 한국어로 큐레이션·해설한 것입니다. 원문 저작권은 작성자에게 있으며,
출처 목록의 [n] 번호 또는 본문 내 [n] 표시를 누르면 원문 트윗으로 이동합니다.

📬

AI·로봇 뉴스레터

매주 월·목, 한국어 AI·로봇 핵심 소식을 이메일로 받아보세요.

Leave a Comment

Your email address will not be published. Required fields are marked *

Scroll to Top