크래쉬랩 M1
1 / 14

슬라이드 단축키

→ ↓ Space PageDown
다음 슬라이드
← ↑ PageUp
이전 슬라이드
Home / End
처음 / 마지막
F
전체화면 전환
?
도움말 열기 / 닫기

LECTURE 04

VLA 이론

자연어 명령을 행동으로 변환하는 모델

10/16CRASH LAB M1
  1. 01
    행동 모델Vision · Language · Action
  2. 02
    학습 단위에피소드
  3. 03
    모델 실행학습 · 추론
  4. 04
    현실 전이Sim-to-Real

QUESTION

‘빨간 컵을 집어’를 로봇이 어떻게 해석할까?

데이터학습추론

CONCEPT

VLA 세 글자

Vision Language Action 실물 흐름Vision빨간 큐브를 인식한다Language“빨간 큐브를집어 줘”명령의 의미를 해석한다Action파지 동작을 실행한다

인식과 해석 결과가 행동 출력으로 이어진다.

CONCEPT

기존 방식과의 차이

규칙 코딩과 학습 규칙 코딩조건문 → 동작상황마다 사람이 직접 정의학습데이터에서 규칙 발견
  • 규칙 기반은 사람이 조건을 명시한다.
  • 학습 기반은 데이터에서 규칙을 추출한다.
  • 배우지 않은 상황을 다루는 방식이 다르다.

COMPARE

모방학습 vs 강화학습

모방학습

  • 전문가 시연을 그대로 모사한다.
  • 양질의 시연 데이터가 많을수록 유리하다.

강화학습

  • 시행착오로 누적 보상을 최대화한다.
  • 보상 설계가 잘못되면 의도와 다른 정책이 학습된다.

QUESTION

무엇을 얼마나 학습시켜야 할까?

데이터학습추론

CONCEPT

에피소드 = 단일 시행

실물 파지 에피소드 시계열시행 시작 · 접근카메라t0t1t2t3관절 값언어빨간 큐브를 집어트레이에 놓아시작

하나의 에피소드에 관측과 행동이 시계열로 기록된다.

BUILD

에피소드 데이터

BUILD 1 / 3
실물 파지 에피소드 시계열t0 · 접근카메라t0t1t2t3시작
  • 영상은 매 시점의 장면을 기록한다.

BUILD

에피소드 데이터

BUILD 2 / 3
실물 파지 에피소드 시계열t1 · 접촉카메라t0t1t2t3관절 값시작

관절 값과 영상은 같은 시각에 맞춰야 한다.

BUILD

에피소드 데이터

BUILD 3 / 3
실물 파지 에피소드 시계열t2 · 들어올림카메라t0t1t2t3관절 값언어빨간 큐브를 집어트레이에 놓아+0.4초 어긋남시작
  • 언어 명령도 동일 시간축에 정렬한다.
  • 세 트랙이 정렬돼야 행동을 학습할 수 있다.
  • 0.4초만 어긋나도 엉뚱한 행동을 배운다.

CONCEPT

나쁜 데이터의 조건

나쁜 데이터 동기화 어긋남시간 불일치성공만 수집실패 맥락 없음같은 배치 반복환경 편향

학습 데이터는 실패 사례와 환경 다양성을 포함해야 한다.

CONCEPT

학습 파이프라인

학습 파이프라인 수집에피소드전처리정렬·정제파인튜닝가중치 학습체크포인트모델 저장
  • 데이터를 수집해 시간축을 먼저 정렬한다.
  • 모델을 학습해 체크포인트로 저장한다.
  • 검증 성능이 낮으면 재수집이 필요하다.

CONCEPT

추론 파이프라인

추론 파이프라인 명령+영상입력 VLA 모델추론 관절 목표행동 제어실행

모델이 출력한 관절 목표를 제어기가 구동 신호로 변환한다.

CONCEPT

시뮬과 실물의 간극

시뮬과 실물의 간극 시뮬레이션노이즈 없는 센서 · 변하지 않는 조건실물노이즈 · 마찰 · 조명 변화 간극
  • 실물 센서에는 항상 잡음이 존재한다.
  • 마찰과 지연도 시뮬과 일치하지 않는다.
  • 조명 변화까지 더해지면 정책 성능이 저하된다.