전체 글

대학원/VLA Paper

[Paper Review] GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

1. Motivation 인간 세계에서 일상적인 작업을 수행할 수 있는 "General-Purpose Robot"을 개발하는 것은 로봇공학의 오랜 과제이다. 최근 Foundation Model은 web-scale의 vision·language 데이터를 활용하여 강력한 일반화 성능과 downstream task에 대한 빠른 adaptation 가능성을 보여주었으며, 이는 General-Purpose Robot을 위한 지능의 backbone을 구축하는 하나의 로드맵을 제시하였다. 하지만 vision·language 데이터는 web-scale 규모로 축적되어 있는 반면, 이에 상응하는 Internet-scale robot dataset은 존재하지 않는다. 최근에는 서로 다른 로봇의 학습 데이터를 통합한 ..

대학원/Continual Learning Paper

[Paper Review] Lifelong Test-Time Adaptation via Online Learning in Tracked Low-Dimensional Subspace

이 논문은 분석이 많이 등장한다. 따라서 기존에 리뷰를 하던 형식에서 중간에 분석 내용도 추가적으로 작성하였다. 개인적으로는 분석과 설명이 잘 되어있는 논문인 것 같아 도움이 많이 된 논문이다 1. Motivation Test-Time Adaptation(TTA)은 학습이 완료된 source model을 배포한 이후, 순차적으로 들어오는 unlabeled test data를 이용해 모델을 업데이트함으로써 target domain에 적응시키는 것을 목표로 한다. 이는 학습 데이터와 실제 테스트 환경의 데이터 분포가 달라지는 domain shift 상황에서 모델의 성능을 개선하기 위한 방법이다. TTA는 test label에 접근할 수 없기 때문에 entropy minimization과 같은 unsuper..

대학원/Continual Learning Paper

[Paper Review] Gradient Episodic Memory for Continual Learning

Continual Learning에서 파말적 망각 원인을 판단하는 방법으로 기울기 방식을 사용한 내용을 찾아보기 위해 본 논문을 읽게 되었다 1. Motivation 우리가 흔히 아는 Supervised Learning은 훈련 데이터셋 (x,y)를 수집으로부터 시작하는데, 이 데이터셋은 고정된 확률 분포 P에서 추출된 iid 샘플이라고 가정한다(동일 분포 & 독립적). Supervised Learning의 목표는 (x,y)~P일 때 보지 못한 특징 벡터 x와 관련된 타겟 벡타 y를 예측하는 것이고 이를 달성하기 위해 Empirical Risk Minimization(ERM)을 사용한다. ERM은 인간의 학습이라고 간주하는 것에서 크게 단순화된 형태이다. 인간은 데이터를 순서가 있는 시퀀스로 관찰..

대학원/VLA Paper

[Paper Review] Towards Human-like Physical Intelligence: Lifelong Vision-Languag

이 논문은 2026년 7월 arXiv preprint에 공개되었습니다 1. Motivation 사람이 새로운 task를 순차적으로 학습하는 자연스러운 능력처럼, 로봇도 새로운 기술을 지속적으로 습득할 수 있어야 한다. 따라서 continual learning은 VLA 정책이 이전에 학습한 내용을 보존하면서 새로운 능력을 습득할 수 있도록 하는데 필수적이다. 이러한 능력을 습득하기 위해 새로운 기술을 순차적으로 학습하게 되면 이전에 습득한 지식과 행동의 Catastrophic forgetting을 초래할 수 있으며, 이를 해결하기 위해 이전의 모든 데이터를 유지하거나 재학습한다면 감당하기 힘든 memory & computational cost를 초래한다. replay buffer, parameter i..

대학원/VLA Paper

[Paper Review] Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning

논문 정리는 제 기준에서 논문을 읽고 작성한 내용이기에 제가 이미 알고 있는 내용이나 중요하지 않다고 생각하는 부분들은 다 제외했습니다. 이 부분들이 궁금하시다면 직접 논문을 참고하시는 걸 권장드립니다. 본 논문은 2026 ICML에 게재된 논문입니다 1. Motivation Continual Learning은 기존의 지식을 잘 보존하는지에 대한 Stability와 새로운 task에 대한 지식을 잘 습득했는지에 대한 Plasticity 사이의 balance를 잘 유지해야한다. 하지만 Continual Learning은 정책이 실패하여 새로운 기술을 학습하는 과정에서 이전에 학습한 행동이 크게 저하되는 현상인 "Catastrophic Forgetting"을 초래하는 경향이 있고 이로 인해 sequenti..

대학원/Continual Learning Paper

[Paper Review] Overcoming catastrophic forgetting in neural network

연구주제를 continual learning 쪽으로 연결해보다보니 흥미가 생겨서 논문을 보고 공부를 하기 위해 리뷰 중입니다 1. Motivation AGI의 발전으로 agent가 다양한 task를 배우고 수행해야하는 필요성이 생겼다. 이를 위해 이전에 학습한 지식을 잃지 않으면서 연속적인 지식을 학습할 수 있는 능력인 "Continual Learning"이 등장한다. 하지만 Continual Learning에는 여러 task를 sequental하게 학습 시, 앞선 task의 지식을 이후 task의 지식으로 덮어써 앞선 task의 성능이 급하락하는 "Catastrophic Forgetting"이라는 challenge가 존재한다. 이런 문제가 해결하는 가장 단순한 방법은 학습마다 모든 task에 ..

대학원/VLA Paper

[Paper Review] ROBOCASA365: A LARGE-SCALE SIMULATIONFRAMEWORK FOR TRAINING AND BENCHMARKINGGENERALIST ROBOTS

VLA를 시뮬레이션 상에서 사용하기 위한 benchmark를 찾던 중, 최근 LIBERO보다 RoboCasa가 선호된다는 것을 알게되어 해당 데이터셋에 대한 논문 리뷰를 작성해보았다 1. Motivation ● 로봇 학습 분야의 최근 발전은 해당 분야를 다향한 환경에서 광범위한 작업을 수행할 수 있는 일반화 로봇에 더 가깝게 만들었고, 이를 위해 대규모 실제 로봇 데이터셋을 수집하고 High-capacity robot foundation model을 훈련하는데 초점을 맞춘 연구가 증가하고 있다 ● 이러한 모델들은 새로운 객체, 환경 및 작업에 대한 의미있는 일반화 성능, 광범위한 기능을 갖춘 정책 개발에 대한 큰 가능성을 보여준다 하지만 두가지 주요 문제점이 있다 ● 일반화 로봇 훈련을 위해서 ..

대학원/Paper

[Paper Review] Denoising Diffusion Probabilistic Models

생성 쪽에서 가장 많이 사용되는 것 중 하나인 Diffusion 논문입니다. 논문 리뷰는 제가 이해한 바를 논문의 내용을 함께 작성하기 때문에 의견이 다르거나 잘못된 부분이 있을 수 있습니다. 해당 부분에 대해서는 피드백주시면 언제나 감사히 받겠습니다!! 추가적으로 수식에 대한 유도과정은 후순위로 두고 보시길 권합니다. 저도 논문을 여러 번 읽으면서 흐름이 보이기 시작했습니다... 0. PreliminaryDiffusion은 생성형 모델의 대표적인 형태이다. 생성형 모델이 뭔지, 그리고 논문의 내용을 이해하기 위해 필요한 내용들을 먼저 알고가자0.1 Generative Model ● 주어진 데이터로부터 데이터의 확률 분포를 학습하고, 그 분포를 기반으로 새로운 데이터를 생성하는 모델이다. 여기서 말하..

대학원/VLA Paper

[Paper Review] Octo: An Open-Source Generalist Robot Policy

RT-2에 이어서 Octo에 대해서 리뷰해보려고 한다 1. Motivation openVLA를 읽고 이 논문을 보는데 motivation이 유사한 점이 많다고 느껴진다. Octo는 motivation을 해결하기 위해 어떤 방법을 썼는지를 한번 잘 알아보는 것이 좋아보인다 로봇 학습에 대한 일반적인 접근 방법은 특정 로봇과 작업에 대해 직접 수집한 데이터셋으로 policy를 훈련하는 것이다. 하지만 이 방법은 로봇 데이터를 수집하기 위한 상당한 노력이 필요하며 수집된 데이터에 대해서만 일반화 성능을 보여주므로 좁은 일반화 성능을 가진다 여러 로봇과 작업에서 수집된 경험은 모델을 다양한 로봇 제어 문제에 노출시켜 downstream 작업에서 일반화 성능을 향상시킬 수 있다는 해결책을 제공한다 자연어, 컴퓨..

대학원/VLA Paper

[Paper Review] RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

연구 주제로 VLA를 생각하고 있어서 VLA에 관한 지식도 쌓을겸, 어떤 모델이 있었는지 보기 위해서 논문을 보고 있다. 가장 처음 VLA라는 것이 등장한 RT-2부터 하나씩 보려한다VLA는 VLM을 사용하기 때문에 Transformer에 대한 이해가 있다면 논문을 볼 때 구조 이해하는데 도움이 많이 된다. 아래 Transformer 논문을 리뷰한 글도 참고하면 좋을 거 같다 https://luckychaser.tistory.com/74 [Paper Review] Attention Is All You Need0. Preliminary0-1. Sequence to Sequence 먼저 Sequence-to-Sequence(Seq2Seq) 와 Encoder-Decoder 구조가 무엇인지 알아보았다Seq2Se..

Cho대뿟다
Dev를Even하게