Google DeepMind, Gemini Robotics 2 공개: 로봇에 전신 지능을 불어넣다
Google DeepMind가 Gemini Robotics 2 모델군을 공개하며 로봇에 시각-언어 입력을 동작으로 변환하는 전신 지능을 부여했다. 이는 휴머노이드 로봇이 정교한 조작과 협업을 수행할 수 있게 하는 중요한 진전으로, 로봇의 활용 가능성을 크게 확장할 것으로 기대된다.
diff --summary
- Google DeepMind가 Gemini Robotics 2 모델군을 공개하며 로봇에 '전신 지능'을 부여했다.
- Gemini Robotics 2는 시각-언어 입력을 받아 휴머노이드 로봇의 발부터 손끝까지 정교하게 제어한다.
- 모델군은 전신 제어용 VLA(Visual-Language-Action) 모델과 장기 작업 계획 및 감독용 LLM으로 구성된다.
- 이를 통해 로봇은 섬세한 물체 조작, 복잡한 환경 탐색, 다른 로봇과의 협업 등 다양한 작업을 수행할 수 있다.
- 로봇이 실제 세계의 복잡한 작업을 보다 자율적으로 처리할 수 있게 되어, 로봇 활용의 잠재력을 크게 높일 것으로 기대된다.
Google DeepMind가 로봇 공학 분야의 큰 도약을 알리는 Gemini Robotics 2 모델군을 공개했다. 이 새로운 모델은 로봇에게 시각과 언어 입력을 바탕으로 전신 지능을 부여하여, 휴머노이드 로봇이 발부터 손끝까지 정교하게 제어하고 복잡한 작업을 수행할 수 있게 한다. 말 그대로 로봇의 ‘몸 전체’를 AI가 이해하고 움직이는 시대가 오는 셈이다.
로봇의 ‘전신 지능’이란?
Gemini Robotics 2는 두 가지 핵심 모델로 구성된다. 첫째는 Gemini Robotics 2라는 이름의 전신 제어용 VLA(Visual-Language-Action) 모델이다. 이 모델은 로봇이 보는 것(시각)과 듣는 것(언어)을 종합적으로 이해하여, 복잡한 환경에서도 유연하고 정교한 동작을 만들어낸다. 예를 들어, 섬세한 물건을 집거나, 좁은 공간을 통과하는 등의 작업이 훨씬 자연스러워진다.
둘째는 장기 작업을 계획하고 감독하는 Gemini Robotics LLM이다. 이 모델은 로봇이 여러 단계를 거쳐야 하는 복잡한 목표를 스스로 수립하고, 각 단계의 실행을 모니터링하며 필요에 따라 전략을 수정할 수 있도록 돕는다. 마치 로봇에게 ‘뇌’와 ‘신경계’를 동시에 심어준 것과 같다. 이를 통해 로봇은 단순히 반복적인 작업을 넘어, 예측 불가능한 상황에 대응하고 다른 로봇과 협력하는 등 훨씬 고차원적인 임무를 수행할 수 있게 된다.
로봇 활용의 새로운 지평을 열다
이번 Gemini Robotics 2의 출시는 로봇이 실제 세계의 복잡한 작업을 보다 자율적으로 처리할 수 있는 가능성을 보여준다. 공장 자동화, 물류, 심지어는 가정 내 서비스 로봇에 이르기까지 로봇의 활용 범위가 크게 확장될 수 있다는 의미다. 기존 로봇들이 특정 작업에 최적화된 프로그래밍에 의존했다면, Gemini Robotics 2는 로봇이 스스로 배우고 적응하며 다양한 환경에 유연하게 대응할 수 있는 길을 열어준다.
물론 아직은 연구 단계의 성과지만, Google DeepMind는 이 기술이 로봇 공학의 미래를 바꿀 잠재력을 가지고 있다고 본다. AI가 로봇의 ‘몸’을 완벽하게 제어하게 됨으로써, 우리는 SF 영화에서나 보던 휴머노이드 로봇이 현실로 다가오는 모습을 더 빠르게 보게 될지도 모른다.
$ sources
- [1] Gemini Robotics 2 brings whole body intelligence to robots deepmind.google
- [2] Gemini Robotics 2, 로봇에 전신 지능을 제공 news.hada.io