RobotAIGeek

RoboGesture, 휴머노이드 로봇에게 말하면서 제스처를 취하는 법을 가르친다

베이징대학교와 칭화대학교의 연구진은 휴머노이드 로봇을 위해 음성과 동기화된 제스처를 실시간으로 생성하는 프레임워크인 ‘RoboGesture’를 개발했으며, ECCV 2026을 앞두고 Unitree G1을 통해 테스트를 진행했다.

martti
4분 소요Posted: 2026년 9월 2일
RoboGesture, 휴머노이드 로봇에게 말하면서 제스처를 취하는 법을 가르친다

휴머노이드 구매 시 아무도 고려하지 않았던 ‘제스처 문제’

걷고, 균형을 잡고, 토트백을 건네줄 수 있는 휴머노이드 로봇이라고 해서 누구나 그 로봇과 대화를 나누고 싶어 하는 것은 아니다. 베이징대학교의 ‘신체화된 지각 및 상호작용 연구실(Embodied Perception and InteraCtion Lab)’ 연구진은 칭화대학교 및 10명의 저자로 구성된 다기관 연구팀과 협력하여, 이번 주 ‘RoboGesture’라는 프레임워크를 발표했다. 이 프레임워크는 더 좁은 범위이면서도 상업적으로 과소평가되어 온 문제, 즉 휴머노이드가 마치 인간 진행자, 안내원, 매장 직원이 무의식적으로 하는 것처럼 자신의 말소리에 맞춰 팔과 몸을 움직이게 하는 것이다. 2026년 유럽 컴퓨터 비전 학회(ECCV)에 채택되어 9월 1일 arXiv 프리프린트 서버에 게재된 이 논문은, 바로 이러한 학술 시연을 위한 표준 하드웨어로 자리 잡은 항저우산 휴머노이드 플랫폼인 ‘유니트리 G1(Unitree G1)’을 통해 테스트되었다.

연구진이 해소하고 있는 이 격차는 로봇이 고객 앞에서 이를 제대로 수행하지 못할 때까지는 쉽게 간과되기 마련이다. 몸통은 고정된 채 팔만 어설프게 움직이는 음성 어시스턴트는 음성 인식과 언어 모델이 완벽하게 작동하더라도 고장 난 것처럼 보인다. 말하는 동안 몸이 움직이지 않는 것은 인간 청취자가 상호작용에 기대하는 모든 사회적 기대를 저버리기 때문이다. 접수 데스크, 전시회 부스, 또는 소매 매장에서 사용할 휴머노이드나 서비스 로봇을 평가하는 구매자에게 있어 제스처는 단순한 장식이 아닙니다. 이는 고객이 기계를 충분히 신뢰하여 대화를 계속할지 여부를 결정하는 가시적인 신호입니다.

로봇이 말할 때 왜 움직임을 멈추거나 허우적거리는가

RoboGesture 팀은 이러한 실패 양상을 세 가지 복합적인 장벽으로 규정합니다. 첫 번째는 데이터 문제입니다. 로봇의 특정 관절 구조가 실제로 수행할 수 있는 자연스러운 말소리와 연계된 제스처 동작에 대한 대규모 공개 데이터베이스가 존재하지 않기 때문에, 대부분의 시스템은 로봇의 제한된 자유도에 정확히 매핑되지 않는 인간의 모션 캡처 데이터를 차용하거나, 반복되는 소수의 미리 정해진 제스처를 수동으로 프로그래밍할 수밖에 없습니다.

몇 분 만에 뚜렷하게 나타납니다. 두 번째는 저자들이 ‘모달리티 이클립스(modality eclipse)’라고 명명한 것으로, 모델이 실제로 오디오를 듣는 대신 최근의 동작 이력을 바탕으로 계속 움직이는 법을 학습하여, 개별적으로는 그럴듯해 보이지만 로봇이 말하는 내용과는 동기화되지 않은 제스처를 만들어내는 훈련 실패 현상입니다. 세 번째는 시뮬레이션과 실제 간의 격차입니다. 시뮬레이션에서 훈련된 제스처 생성기는 실제 하드웨어에서 실행되는 순간 로봇의 프레임을 침범하거나, 근처 물체에 부딪히거나, 균형을 잃지 않을 것이라는 보장이 없습니다.

이 세 가지 문제 중 어느 하나만으로도, 왜 대부분의 휴머노이드 시연이 진정한 반응형 제스처보다는 미리 연습하고 수작업으로 미세 조정한 소수의 동작을 여전히 선호하는지 충분히 설명할 수 있습니다. RoboGesture의 기여점은 이 세 가지를 서로 분리된 세 편의 연구 논문이 아닌, 하나로 연결된 공학적 문제로 다루는 데 있으며, 이는 상업적으로 더 의미 있는 접근 방식입니다. 로봇 제조사는 “대개는 작동하는” 제스처 시스템을 출시할 수 없습니다. 고객 앞에서 뻣뻣하거나 위험한 팔 흔들기는 차라리 제스처가 없는 것보다 더 나쁘기 때문입니다.

로봇이 실제로 수행할 수 있는 데이터셋 구축

연구팀은 사후에 인간의 모션 캡처 영상을 수정하는 대신, 300개 이상의 제스처 범주를 포괄하고 대규모의 충돌이 없으며 로봇 전용 오디오-모션 쌍을 생성하는 자동화된 파이프라인을 사용하여, 이른바 ‘RoboGesture 데이터셋’을 처음부터 구축했습니다. 이러한 차별점은 표면적인 수치보다 훨씬 더 중요합니다. 일반적인 인간 골격에 맞춰 구축된 데이터셋은 수집 후 특정 로봇의 관절 한계치에 맞춰 재조정되어야 하는데, 이 과정에서는 연구진이 애초에 피하고자 했던 자체 충돌과 균형 위반이 일상적으로 발생하게 됩니다. 대상 로봇의 운동학에 맞춰 쌍을 직접 생성하면 해당 제약 조건이 데이터 자체에 선행적으로 반영되므로, 후속 모델은 충돌 없는 동작이 어떤 모습인지 별도의 취약한 보정 단계로 학습할 필요가 없습니다.

게다가

이 데이터셋은 논문에서 ‘계층적 의미-음향 정렬기(Hierarchical Semantic-Acoustic Aligner)’라고 부르는 구성 요소에 기반을 두고 있는데, 이 구성 요소는 억양적 단서(말하는 방식의 리듬과 강조)와 의미적 단서(단어의 실제 의미)를 별도로 전사된 텍스트 스트림이 아닌 원본 오디오에서 직접 추출합니다. 이러한 조합을 통해 제스처는 로봇이 말하는 강도는 물론, 그 순간 어떤 개념을 강조하고 있는지도 동시에 추적할 수 있으며, 이는 인간 화자의 손과 자세가 자신의 목소리에 실제로 반응하는 방식에 더 가깝습니다.

의도적인 페널티를 통한 ‘모달리티 이클립스’ 해결

이 논문의 가장 구체적인 기술적 주장은 모달리티 이클립스(modality eclipse) 실패를 직접적으로 다루고 있습니다. 생성 엔진인 ‘조건부 흐름 매칭(conditional flow matching)’ 기법을 사용하는 확산 트랜스포머(diffusion transformer)는, 저자들이 ‘반관성 CFG 마스킹(Anti-Inertia CFG Masking)’이라 부르는 훈련 메커니즘과 결합되어 있습니다. 이 메커니즘은 모델이 오디오 입력에서 새로운 정보를 능동적으로 추출하는 대신 최근의 동작을 반복하는 데 의존할 때마다 페널티를 부과합니다. 간단히 말해, 이 시스템은 자신의 운동량을 신뢰하지 않고 자신의 목소리 소리에서 단서를 계속 확인하도록 의도적으로 훈련받았는데, 이는 대부분의 동작 생성 모델이 작동하도록 설계된 방식과는 정반대입니다. 애니메이션 시스템에서 최근 동작을 향해 부드럽게 이어지는 것은 일반적으로 버그가 아니라 기능으로 간주되기 때문입니다.

이러한 역전 현상이 타당하게 여겨지는 이유는, 이 응용 분야가 이동이 아닌 ‘말하기와 연동된 제스처’이기 때문이다. 걷는 로봇은 안정성을 위해 최근의 보행 패턴을 부드럽게 이어가야 하지만, 말하는 로봇이 최근의 팔 위치를 부드럽게 이어가면 결국 로봇 시연이 마치 대본에 따라 진행되는 것처럼 보이게 만드는, 정확하고 반복적이며 말과 동떨어진 동작으로 빠져들게 된다. 범용 동작 스무딩 기본 설정을 그대로 도입하는 대신, 이 작업에 고유한 실패 모드를 해결하는 것은 실제 배포 문제를 목표로 하는 논문과 벤치마크 순위표 상위권 진입을 목표로 하는 논문을 구분 짓는 세부 사항입니다.

실제로 중요한 안전 필터

구매자

휴머노이드 로봇 구매를 고려하는 누구에게나 가장 중요한 구성 요소는 파이프라인의 맨 끝에 위치해 있습니다. 바로 모델 예측 제어(MPC) 안전 필터로, 로봇의 관절이 동작을 실행하기 전에 생성된 모든 동작에 대해 충돌 및 균형 안정성을 실시간으로 점검합니다. 이 계층은 연구 결과를 고객 근처에서 감독 없이도 안정적으로 작동할 수 있는 형태로 전환하는 역할을 합니다. 실험실에서만 잘 작동하고, 비상 정지 버튼을 누를 엔지니어가 대기하고 있어야 하는 제스처 모델은 호텔 로비나 공항 터미널에서 8시간 동안 사고 없이 작동하도록 인증받은 제품과는 차원이 다릅니다. 이 논문은 실제 Unitree G1 로봇에서 테스트했을 때, RoboGesture가 기존의 최첨단 기준 모델들보다 더 안전하고, 리듬감이 있으며, 의미적으로 더 적절한 제스처를 생성했다고 보고하고 있지만, 저자들이 제시한 비교 결과는 독립적인 제3자 안전 인증이라기보다는 연구용 벤치마크로 이해해야 한다.

이러한 주의 사항은 해당 연구를 폄하하려는 의도가 아닙니다. 이는 ECCV에서 승인된 논문과 상업적 안전 주장 사이에 존재해야 하는 표준적이고 적절한 거리이며, 조달 팀은 제스처 기능을 갖춘 휴머노이드를 제안하는 공급업체가 “제스처를 생성한다”는 점을 “무인 운영이 안전하다”는 것과 동등하게 취급하기 전에 이 간극을 메울 것을 기대해야 합니다.

이 방법이 테스트 대상 로봇보다 더 큰 의미를 갖는 이유

테스트 플랫폼으로 Unitree G1을 선택한 것 자체도 올바르게 해석할 가치가 있는 신호입니다. G1은 널리 보급되어 있고 비교적 저렴한 연구 및 개발용 휴머노이드로, 특정 기업이 처음부터 끝까지 통제하는 특수 하드웨어가 아닙니다. 즉, RoboGesture 방법은 특정 공급업체의 독점적인 관절 구성을 기반으로 구축된 것이 아닙니다. 일반적인 연구용 하드웨어에서 검증된 프레임워크는 원칙적으로 상체 자유도 수가 대체로 유사한 모든 휴머노이드 플랫폼으로 이식 가능합니다. 이는 현재 서비스 및 접객업 시범 운영에 판매되고 있는 대부분의 휴머노이드 플랫폼에 해당하며, 제조사가 누구든 상관없이

중국, 미국 또는 그 밖의 지역에서든 마찬가지입니다. 이 논문은 유닛트리(Unitree)를 구체적으로 홍보하기 위한 것이 아니라, 아직 존재하지 않는 차세대 액추에이터나 센서가 아닌, 소비자가 이미 구매할 수 있는 하드웨어를 통해 제스처 문제를 해결할 수 있음을 입증하고 있기 때문에, 바로 이러한 호환성이 이 논문의 실질적인 상업적 의미를 갖습니다.

이러한 차이점을 고려할 때, 조달 팀이 특정 공급업체의 현재 제품에 이미 이 기능이 포함되어 있다고 너무 성급하게 가정하는 것을 자제해야 한다. 지금까지 리셉션, 가이드 투어, 또는 소매 매장 내 고객 참여를 위한 휴머노이드 로봇을 판매하는 공급업체들은 주로 키워드로 트리거되는 미리 스크립트화된 제스처 라이브러리에 의존해 왔는데, 이는 음성의 음향적·의미적 내용을 바탕으로 실시간으로 제스처를 생성하는 모델과는 본질적으로 다르며 훨씬 더 취약한 접근 방식이다. 전시회 현장에서 매끄러워 보이는 공급업체의 데모조차도 여전히 구식인 스크립트 기반 방식을 사용하고 있을 수 있습니다. 영업 담당자에게 물어봐야 할 질문은 로봇이 말하면서 제스처를 하는지 여부가 아니라, 그 제스처가 현재 말하고 있는 내용에서 실시간으로 생성되는 것인지, 아니면 소수의 트리거 문구에 연동된 고정된 라이브러리에서 재생되는 것인지 여부입니다.

이것이 휴머노이드 상호작용 스택에 대해 시사하는 바

RoboGesture는 상용 제품이 아닌 연구 성과이며, 저자 중 누구도 이를 달리 주장하지 않습니다. 하지만 이 연구가 발표된 시점은 휴머노이드 도입 논의가 적재 용량이나 배터리 수명보다 더 심도 있는 질문들로 넘어간 때와 맞물립니다. 왜냐하면 토트백을 들어 올릴 수 있는 로봇은 고객 대면 배치에서 결코 병목 현상이 될 수 없었기 때문입니다. 진정한 병목 현상은 항상, 대략적으로 인간처럼 보이는 기계가 주변 사람들을 불안하게 하지 않는 방식으로 행동할 수 있는지 여부였으며, 말과 동기화된 제스처는 사람이 사용하는 가장 명확하고 이해하기 쉬운 신호 중 하나입니다.

상호작용이 시작된 지 처음 3초 만에 그러한 판단을 내리도록 한다.

이 논문의 상업적 가치는 단순히 “휴머노이드가 이제 제스처를 할 수 있다”는 것보다 더 광범위합니다. 즉, 자연스러운 제스처를 가로막는 구체적인 실패 요인들—즉, 데이터 세트의 부족, 오디오를 무시하는 모델, 안전하지 않은 시뮬레이션-실제 환경 간 전이—이 이제 각각 명명되고, 개별적으로 측정되며, 구매자가 오늘날 실제로 구입할 수 있는 하드웨어를 기반으로 하는 특정 연구 그룹들에 의해 개별적으로 해결되고 있다는 점입니다. RoboGesture의 연구용 빌드를 실행하는 Unitree G1은 구매자가 주문할 수 있는 제품이 아니며, 이 논문은 대본 없이 자유롭게 진행되는 대화를 해결했다고 주장하지도 않습니다. 이 논문이 입증하는 바는, 휴머노이드의 음성 출력과 신체 제스처 출력 사이에 존재하던 구체적이고 이전에는 해결되지 않았던 기술적 장애물에 대해, 상용 연구용 하드웨어 상에서 문서화되고 테스트를 거치며 안전성이 검증된 해결 경로가 마련되었다는 점입니다. 이는 현재 판매 중인 소비자용 휴머노이드가 이를 표준 기능으로 탑재하여 출시되기까지 수년이 아닌 불과 몇 달이 남았음을 시사합니다.

이 분석은 2026년 9월 2일 기준으로 발표된 연구 논문과 공개된 학술 기록을 종합한 것입니다.

면책 조항: 이 기사는 일반적인 정보 제공을 목적으로 하며, 투자, 법률 또는 조달에 대한 조언을 구성하지 않습니다. 독자는 비즈니스 결정을 내리기 전에 원본 자료를 통해 세부 사항을 확인해야 합니다.

RoboticsHumanoidRobotsPhysicalAIChinaRobotDeployment

최신 아티클

드론 전쟁에서 가장 부족한 자원은 AI가 아니다. 바로 106년 된 산탄총 공장이다.

드론 전쟁에서 가장 부족한 자원은 AI가 아니다. 바로 106년 된 산탄총 공장이다.

martti
martti
2026년 10월 8일
아마존이 자사의 주력 로봇 팔을 단종시켰다. 하지만 어쨌든 아마존의 물류창고는 더욱 자동화되었다.

아마존이 자사의 주력 로봇 팔을 단종시켰다. 하지만 어쨌든 아마존의 물류창고는 더욱 자동화되었다.

martti
martti
2026년 10월 7일
보스턴 다이내믹스의 신임 CEO는 로봇을 한 번도 출시해 본 적이 없다. 현대자동차는 그게 문제되지 않을 것이라고 내다보고 있다.

보스턴 다이내믹스의 신임 CEO는 로봇을 한 번도 출시해 본 적이 없다. 현대자동차는 그게 문제되지 않을 것이라고 내다보고 있다.

martti
martti
2026년 10월 7일
애질리티 로보틱스는 로봇을 무기화하지 않겠다고 약속했다. 하지만 전쟁 지휘본부에 개입하지 않겠다고는 결코 약속한 적이 없다.

애질리티 로보틱스는 로봇을 무기화하지 않겠다고 약속했다. 하지만 전쟁 지휘본부에 개입하지 않겠다고는 결코 약속한 적이 없다.

martti
martti
2026년 10월 7일
가와사키는 2030년까지 자율주행 실현을 약속했다. 하지만 자사가 제시한 로드맵에는 2040년으로 명시되어 있다.

가와사키는 2030년까지 자율주행 실현을 약속했다. 하지만 자사가 제시한 로드맵에는 2040년으로 명시되어 있다.

martti
martti
2026년 10월 4일
로봇 업계에서 가장 드문 거래는 자금 조달이 아니라 자사주 매입이다.

로봇 업계에서 가장 드문 거래는 자금 조달이 아니라 자사주 매입이다.

martti
martti
2026년 10월 3일
포스코, 마지막 수작업 공정에 로봇 도입을 위한 시험 운영

포스코, 마지막 수작업 공정에 로봇 도입을 위한 시험 운영

jamie
jamie
2026년 10월 2일
테라다인과 엘리트 로봇스, 합의에 도달했으나 코봇 특허 분쟁은 아직 끝나지 않았다

테라다인과 엘리트 로봇스, 합의에 도달했으나 코봇 특허 분쟁은 아직 끝나지 않았다

martti
martti
2026년 10월 2일
휴머노이드 로봇에게 전구 교체를 시켰다. 엔비디아의 주력 AI는 아무것도 하지 않는 로봇과 동등한 성적을 기록했다.

휴머노이드 로봇에게 전구 교체를 시켰다. 엔비디아의 주력 AI는 아무것도 하지 않는 로봇과 동등한 성적을 기록했다.

martti
martti
2026년 10월 2일
일본은 식당 종업원 비자 발급을 제한했다. 그리고 로봇을 들여왔다.

일본은 식당 종업원 비자 발급을 제한했다. 그리고 로봇을 들여왔다.

martti
martti
2026년 10월 1일
중국, 로봇용 완전 국산 전자 신경 시스템 공개

중국, 로봇용 완전 국산 전자 신경 시스템 공개

Helios
Helios
2026년 10월 1일
일본의 로봇 제조사들은 중국 시장을 건너뛰기 위해 ‘중국 할인’을 감수하고 있다

일본의 로봇 제조사들은 중국 시장을 건너뛰기 위해 ‘중국 할인’을 감수하고 있다

martti
martti
2026년 10월 1일