1. Motivation NLP의 많은 분야는 pretrained LLM을 여러 downstream 응용 프로그램에 adaptation하는 방식에 의존한다. 일반적으로 adaptation은 pretrained model의 모든 파라미터를 업데이트하는 fine-tuning을 통해 이루어진다. 이때 대규모 모델의 모든 파라미터를 업데이트를 한다는 점은 주요한 문제점이 된다. 이를 해결하기 위해 일부 파라미터만 adaptation하거나 모델 깊이를 확장하여 추론 지연 시간을 도입하거나, 모델의 사용 가능한 시퀀스 길이를 줄이는 방법들이 시도되었다. 하지만 기존 기법들은 종종 fine-tuning baseline 성능을 따라가지 못하여, efficiency-model quality 사이의 trade-off..
1. Motivation 초기의 VLA 모델들은 주로 RGB 이미지, 즉 시각적 입력에 의존했으나 이는 실제 환경에서 한계를 드러낸다. 최근에는 depth 정보, tactile signal(촉각 신호), 오디오 신호 등 multimodal을 모델에 통합하는 방향으로 확장되었다. 하지만 이러한 방식은 여전히 static fusion에 국한되어 있어 한계점을 보인다. ① 관련 없는 데이터가 고차원 feature space에 투영되는 경우, 이는 효과적인 representation 학습을 방해하고 학습 효율성과 수렴 속도를 저하시킨다. ② 또한 관련 없는 데이터는 노이즈로 작용하여 모델의 신뢰성과 일반화 성능을 떨어뜨릴 수 있다. 반면 인간은 작업 맥락과 목표에 따라 감각 정보의 가중치를 능동적으로 조절..
1. Motivation 인간 세계에서 일상적인 작업을 수행할 수 있는 "General-Purpose Robot"을 개발하는 것은 로봇공학의 오랜 과제이다. 최근 Foundation Model은 web-scale의 vision·language 데이터를 활용하여 강력한 일반화 성능과 downstream task에 대한 빠른 adaptation 가능성을 보여주었으며, 이는 General-Purpose Robot을 위한 지능의 backbone을 구축하는 하나의 로드맵을 제시하였다. 하지만 vision·language 데이터는 web-scale 규모로 축적되어 있는 반면, 이에 상응하는 Internet-scale robot dataset은 존재하지 않는다. 최근에는 서로 다른 로봇의 학습 데이터를 통합한 ..
이 논문은 분석이 많이 등장한다. 따라서 기존에 리뷰를 하던 형식에서 중간에 분석 내용도 추가적으로 작성하였다. 개인적으로는 분석과 설명이 잘 되어있는 논문인 것 같아 도움이 많이 된 논문이다 1. Motivation Test-Time Adaptation(TTA)은 학습이 완료된 source model을 배포한 이후, 순차적으로 들어오는 unlabeled test data를 이용해 모델을 업데이트함으로써 target domain에 적응시키는 것을 목표로 한다. 이는 학습 데이터와 실제 테스트 환경의 데이터 분포가 달라지는 domain shift 상황에서 모델의 성능을 개선하기 위한 방법이다. TTA는 test label에 접근할 수 없기 때문에 entropy minimization과 같은 unsuper..
Continual Learning에서 파말적 망각 원인을 판단하는 방법으로 기울기 방식을 사용한 내용을 찾아보기 위해 본 논문을 읽게 되었다 1. Motivation 우리가 흔히 아는 Supervised Learning은 훈련 데이터셋 (x,y)를 수집으로부터 시작하는데, 이 데이터셋은 고정된 확률 분포 P에서 추출된 iid 샘플이라고 가정한다(동일 분포 & 독립적). Supervised Learning의 목표는 (x,y)~P일 때 보지 못한 특징 벡터 x와 관련된 타겟 벡타 y를 예측하는 것이고 이를 달성하기 위해 Empirical Risk Minimization(ERM)을 사용한다. ERM은 인간의 학습이라고 간주하는 것에서 크게 단순화된 형태이다. 인간은 데이터를 순서가 있는 시퀀스로 관찰..
이 논문은 2026년 7월 arXiv preprint에 공개되었습니다 1. Motivation 사람이 새로운 task를 순차적으로 학습하는 자연스러운 능력처럼, 로봇도 새로운 기술을 지속적으로 습득할 수 있어야 한다. 따라서 continual learning은 VLA 정책이 이전에 학습한 내용을 보존하면서 새로운 능력을 습득할 수 있도록 하는데 필수적이다. 이러한 능력을 습득하기 위해 새로운 기술을 순차적으로 학습하게 되면 이전에 습득한 지식과 행동의 Catastrophic forgetting을 초래할 수 있으며, 이를 해결하기 위해 이전의 모든 데이터를 유지하거나 재학습한다면 감당하기 힘든 memory & computational cost를 초래한다. replay buffer, parameter i..
논문 정리는 제 기준에서 논문을 읽고 작성한 내용이기에 제가 이미 알고 있는 내용이나 중요하지 않다고 생각하는 부분들은 다 제외했습니다. 이 부분들이 궁금하시다면 직접 논문을 참고하시는 걸 권장드립니다. 본 논문은 2026 ICML에 게재된 논문입니다 1. Motivation Continual Learning은 기존의 지식을 잘 보존하는지에 대한 Stability와 새로운 task에 대한 지식을 잘 습득했는지에 대한 Plasticity 사이의 balance를 잘 유지해야한다. 하지만 Continual Learning은 정책이 실패하여 새로운 기술을 학습하는 과정에서 이전에 학습한 행동이 크게 저하되는 현상인 "Catastrophic Forgetting"을 초래하는 경향이 있고 이로 인해 sequenti..
연구주제를 continual learning 쪽으로 연결해보다보니 흥미가 생겨서 논문을 보고 공부를 하기 위해 리뷰 중입니다 1. Motivation AGI의 발전으로 agent가 다양한 task를 배우고 수행해야하는 필요성이 생겼다. 이를 위해 이전에 학습한 지식을 잃지 않으면서 연속적인 지식을 학습할 수 있는 능력인 "Continual Learning"이 등장한다. 하지만 Continual Learning에는 여러 task를 sequental하게 학습 시, 앞선 task의 지식을 이후 task의 지식으로 덮어써 앞선 task의 성능이 급하락하는 "Catastrophic Forgetting"이라는 challenge가 존재한다. 이런 문제가 해결하는 가장 단순한 방법은 학습마다 모든 task에 ..
VLA를 시뮬레이션 상에서 사용하기 위한 benchmark를 찾던 중, 최근 LIBERO보다 RoboCasa가 선호된다는 것을 알게되어 해당 데이터셋에 대한 논문 리뷰를 작성해보았다 1. Motivation ● 로봇 학습 분야의 최근 발전은 해당 분야를 다향한 환경에서 광범위한 작업을 수행할 수 있는 일반화 로봇에 더 가깝게 만들었고, 이를 위해 대규모 실제 로봇 데이터셋을 수집하고 High-capacity robot foundation model을 훈련하는데 초점을 맞춘 연구가 증가하고 있다 ● 이러한 모델들은 새로운 객체, 환경 및 작업에 대한 의미있는 일반화 성능, 광범위한 기능을 갖춘 정책 개발에 대한 큰 가능성을 보여준다 하지만 두가지 주요 문제점이 있다 ● 일반화 로봇 훈련을 위해서 ..
생성 쪽에서 가장 많이 사용되는 것 중 하나인 Diffusion 논문입니다. 논문 리뷰는 제가 이해한 바를 논문의 내용을 함께 작성하기 때문에 의견이 다르거나 잘못된 부분이 있을 수 있습니다. 해당 부분에 대해서는 피드백주시면 언제나 감사히 받겠습니다!! 추가적으로 수식에 대한 유도과정은 후순위로 두고 보시길 권합니다. 저도 논문을 여러 번 읽으면서 흐름이 보이기 시작했습니다... 0. PreliminaryDiffusion은 생성형 모델의 대표적인 형태이다. 생성형 모델이 뭔지, 그리고 논문의 내용을 이해하기 위해 필요한 내용들을 먼저 알고가자0.1 Generative Model ● 주어진 데이터로부터 데이터의 확률 분포를 학습하고, 그 분포를 기반으로 새로운 데이터를 생성하는 모델이다. 여기서 말하..