
낯선 사무실 건물, 대형 매장, 창고에서 길을 잃었나요? 가장 가까운 로봇에게 길을 물어보세요.
Google 연구원 팀은 수요일에 발표된 새로운 연구 의 일환으로 자연어 처리와 컴퓨터 비전의 힘을 결합하여 로봇 탐색의 새로운 수단을 개발했습니다.
인스타그램에서 이 게시물 보기


낯선 사무실 건물, 대형 매장, 창고에서 길을 잃었나요? 가장 가까운 로봇에게 길을 물어보세요.
Google 연구원 팀은 수요일에 발표된 새로운 연구 의 일환으로 자연어 처리와 컴퓨터 비전의 힘을 결합하여 로봇 탐색의 새로운 수단을 개발했습니다.
인스타그램에서 이 게시물 보기
기본적으로 팀은 자연어 프롬프트와 시각적 입력을 사용하여 실내 공간을 탐색하는 방법을 로봇(이 경우 Everyday Robot )에게 가르치기 시작했습니다. 예전에는 로봇 탐색을 통해 연구원들이 환경을 미리 계획할 뿐만 아니라 기계를 안내하기 위해 공간 내에서 특정 물리적 좌표를 제공해야 했습니다. 비전 언어 내비게이션(Vision Language Navigation)으로 알려진 기술이 최근 발전함에 따라 사용자는 "작업대로 이동"과 같은 자연어 명령을 로봇에게 간단하게 내릴 수 있게 되었습니다. Google 연구원들은 로봇이 자연어와 이미지 명령을 동시에 받아들일 수 있도록 다중 모드 기능을 통합하여 이 개념을 한 단계 더 발전시키고 있습니다.
예를 들어, 창고에 있는 사용자는 로봇에게 품목을 보여주고 "이것은 어느 선반에 있나요?"라고 물을 수 있습니다. Gemini 1.5 Pro의 성능을 활용하여 AI는 음성 질문과 시각적 정보를 모두 해석하여 응답뿐만 아니라 사용자를 창고 바닥의 올바른 지점으로 안내하는 탐색 경로도 공식화합니다. 로봇은 또한 “이중문이 있는 회의실로 데려다 주세요”, “손 소독제를 어디에서 빌릴 수 있나요?”, “사람들의 눈에 띄지 않는 곳에 보관하고 싶어요.”와 같은 명령으로 테스트를 거쳤습니다. 난 어디로 가야 해?"
또는 위의 인스타그램 릴에서 연구원은 "그림을 그릴 수 있는" 곳으로 안내해 달라고 요청하기 전에 "OK 로봇"으로 시스템을 활성화합니다. 로봇은 “잠시만 기다려주세요.”라고 응답합니다. Thinking with Gemini…'라는 문구를 들은 후 대형 벽걸이 화이트보드를 찾기 위해 9,000평방피트 규모의 DeepMind 사무실을 빠르게 통과했습니다.
공평하게 말하자면, 이 선구적인 로봇은 이미 사무실 공간의 레이아웃에 익숙했습니다. 팀은 "MINT(시연 투어를 통한 다중 모드 지시 내비게이션)"라는 기술을 활용했습니다. 여기에는 먼저 사무실 주변에서 로봇을 수동으로 안내하고 자연어를 사용하여 특정 영역과 기능을 지적하는 작업이 포함되었지만, 스마트폰을 사용하여 공간의 비디오를 녹화하는 것만으로도 동일한 효과를 얻을 수 있습니다. 거기에서 AI는 카메라가 보는 것과 데모 비디오의 "목표 프레임"을 일치시키는 토폴로지 그래프를 생성합니다.
그런 다음 팀은 "환경 이해와 상식 추론을 결합한" 계층적 VLA(Vision-Language-Action) 탐색 정책을 사용하여 사용자 요청을 탐색 작업으로 변환하는 방법을 AI에 지시합니다.
연구진은 로봇이 "대규모 실제 환경에서 복잡한 추론 및 다중 모드 사용자 지침과 관련된 이전에는 실행 불가능했던 탐색 작업에서 86% 및 90%의 엔드투엔드 성공률"을 달성하여 매우 성공적이라고 썼습니다.
그러나 로봇이 (아직) 자체 시연을 자율적으로 수행할 수 없다는 점과 AI의 추론 시간(응답을 공식화하는 데 걸리는 시간)이 10~30초에 불과하다는 점을 지적하는 등 개선의 여지가 여전히 있음을 인식하고 있습니다. 인내심을 가지고 시스템과의 상호작용을 연구합니다.
작성자
태그: