RobotAIGeek

AGIBOT의 ‘WITA-Omni’, 무대에서 즉흥적인 대화를 나누다

AGIBOT은 실시간 상호작용 타이밍을 위해 개발된 신체 기반 AI 모델인 ‘WITA-Omni’를 시연하며, 마카오에서 휴머노이드 로봇이 TV 진행자와 대본 없이 즉석 대화를 나누는 모습을 보여주었다. 이는 대화형 로봇이 실제 서비스 환경에 투입될 준비가 되어 있는지 검증하기 위한 테스트였다.

martti
2분 소요Posted: 2026년 9월 22일
AGIBOT의 ‘WITA-Omni’, 무대에서 즉흥적인 대화를 나누다

9월 21일 월요일 마카오에서 열린 TV 중계 콘서트에서, 상하이에 본사를 둔 AGIBOT이 개발한 휴머노이드 로봇이 중국 연예 진행자 맞은편에 앉아, 미리 프로그램된 고정된 대사를 읊는 대신 리허설 없이 즉흥적으로 진행되는 대화의 흐름을 따라 그녀와 자연스럽게 대화를 나눴다. 이 로봇은 누가 말하고 있는지 파악하고, 자연스럽게 대답할 수 있는 타이밍을 기다린 뒤, 말투와 제스처, 자세를 대화의 흐름에 맞춰 실시간으로 조정했다. ‘광둥-홍콩-마카오 대만구 영화 콘서트’에서 진행된 이번 시연은, AGIBOT이 로봇이 단편적인 명령에 반응하는 대신 대본 없는 인간 상호작용을 따라가고 참여할 수 있도록 특별히 개발된 체화형 AI 모델인 ‘WITA-Omni’를 대규모 관객 앞에서 처음으로 선보인 자리였다.

AGIBOT(정식 명칭: AGIBOT Innovation (Shanghai) Technology Co., Ltd., 중국 내 명칭: Zhiyuan Robotics)는 2023년 2월 화웨이 출신 엔지니어 덩타이화(Deng Taihua)와 펑지후이(Peng Zhihui)가 설립했으며, 이후 중국2026년 6월 15,000번째 로봇이 생산 라인에서 출하되었다고 발표했으며, 같은 해 7월 홍콩 기업공개(IPO) 절차를 개시했다. 이 회사의 제품 라인업은 A 시리즈 및 X 시리즈 휴머노이드, G 시리즈 범용 로봇, D 시리즈 사족 보행 로봇, 상업용 청소 플랫폼에 이르기까지 다양하여, AGIBOT이 WITA-Omni 모델을 단일 단계 시연 이상으로 확대 출시하기로 결정할 경우 활용할 수 있는 광범위한 하드웨어 기반을 갖추고 있다.

다중 모달 지각을 실시간 상호작용으로 전환하기

현재 로봇 공학 및 소비자 기기에서 출시되고 있는 대부분의 다중 모달 AI 시스템은 텍스트, 이미지, 오디오 입력의 조합을 처리하여 답변을 반환하도록 설계되어 있다. 이는 사람들로 가득 찬 방에서 실시간 대화를 나누는 것과는 본질적으로 다른 문제입니다. 후자의 경우 시스템은 누가 말하고 있는지, 몇 초 전에 무슨 말이 오갔는지, 제스처나 발언이 누구를 향한 것인지, 그리고 그 순간에 응답이 필요한지 여부를 파악해야 하기 때문입니다. WITA-Omni는 바로 이러한 점을 중심으로 구축되었습니다.

두 번째 문제. 이 모델은 시각, 청각, 언어 및 시간 신호를 단일 프레임워크로 통합하여 각 입력을 개별 쿼리로 취급하는 대신 상호작용이 전개되는 과정을 실시간으로 추적할 수 있으며, AGIBOT은 이를 뒷받침하는 벤치마크 결과를 발표했습니다. 제3자 기관인 DailyOmni의 시청각 추론 벤치마크에서, WITA-Omni의 프리뷰 버전은 평균 정확도 85.21%를 기록하며 종합 1위를 차지했고, 다른 AI 연구소의 범용 멀티모달 시스템들을 상대로 8개 평가 항목 중 6개 부문에서 1위를 차지했습니다.

이러한 성적을 이끈 아키텍처는 AGIBOT이 ‘Thinker-Talker-Actor’라고 부르는 것으로, 일부 대화형 AI 시스템에서 사용되는 Thinker-Talker 구조를 확장하여 신체 표현을 위해 특별히 구축된 세 번째 구성 요소를 추가한 것입니다. 'Thinker' 모듈은 장면에서 일어나는 일을 해석하고 로봇이 어떻게 반응해야 할지 고수준에서 결정하며, 'Talker'는 실제 음성을 생성하고, 'Actor'는 로봇의 신체 움직임과 얼굴 또는 신체 표정을 제어합니다. 이 세 가지 기능을 별개의 순차적 단계로 실행하는 대신, 파이프라인은 이를 동일한 타임라인에 맞춰 정렬합니다. 따라서 로봇의 제스처, 표정, 목소리는 말이 끝날 때쯤에야 뒤늦게 이어붙여진 세 개의 분리된 출력물로 나타나는 것이 아니라, 말하는 동안 함께 변화합니다. AGIBOT은 실제 인간 상호작용에서 수집한 대규모 다중 모달 데이터를 활용해 모델을 훈련시켰으며, 말, 움직임, 표정 간의 시간적 관계를 보존함으로써 시스템이 단순히 무엇을 말해야 할 뿐만 아니라, 언제 말해야 하고 그 순간을 신체적으로 어떻게 표현해야 하는지도 학습할 수 있도록 했습니다.

대본 없는 시연이 안무가 짜여진 시연과 다른 이유

올해 중국 내 치열한 체화형 AI(embodied AI) 분야에서 열리는 무역 박람회와 신제품 출시 행사에서 휴머노이드 로봇 시연은 이제 일상적인 풍경이 되었으며, 그 압도적 다수는 미리 안무가 짜여진 방식입니다. 즉, 로봇이 정해진 경로를 걷고, 정해진 제스처를 취하며, 신호에 맞춰 미리 작성된 대사를 전달하는 식입니다. 이러한 형식은 로봇이 일련의 동작을 안정적으로 수행할 수 있음을 입증해 주며, 이는

제조 및 물류 업무에는 유용하지만, 방 안의 사람들이 대본을 따르지 않을 때 로봇이 어떻게 행동하는지에 대해서는 거의 알려주지 않는다. 마카오 시연은 정반대의 상황을 테스트하기 위해 기획되었다. 유명인 게스트는 로봇이 반응하도록 미리 작성된 대사를 읊지 않았으며, 로봇은 그녀가 자신에게 말을 걸고 있는지 파악하고, 대화 중의 침묵이 방해인지 아니면 말할 기회를 주는 것인지 판단하며, 사전에 예측할 수 없었던 대화의 어조에 맞춰 자세와 표정을 조정해야 했다. 접수 데스크, 소매 매장, 호텔 로비 또는 엔터테인먼트 시설에 설치할 휴머노이드 로봇을 평가하는 조달 팀에게 있어, 이것이 바로 단순히 업무를 수행할 수 있는 로봇과 실제 대중과의 상호작용이 필요한 역할을 담당할 수 있는 로봇을 구분 짓는 구체적인 역량 격차입니다.

이러한 구분은 기반 기술이 성숙해가는 속도보다 훨씬 빠르게 상업적 중요성을 띠고 있다. AGIBOT이 제시한 WITA-Omni의 적용 분야는 서비스 현장, 엔터테인먼트 시설, 소매 공간, 호텔 및 안내 데스크와 같은 곳으로, 이곳에서는 상호작용을 사전에 대본으로 작성하기 본질적으로 어렵기 때문에, 로봇이 동작을 멈추거나 타이밍을 놓치고 반응하는 것은 단순히 연습된 루틴을 수행하는 로봇보다 더 나쁜 결과로 이어집니다. 경쟁 연구소들은 각기 다른 각도에서 동일한 기능을 추구하고 있습니다. Figure AI는 유사한 실시간 대화 작업을 위해 자사의 휴머노이드 로봇에 OpenAI의 대화 모델을 결합했으며, Unitree와 UBTECH는 올해 소비자용 및 서비스 지향 제품 라인에 음성 상호작용 기능을 도입했습니다. AGIBOT의 접근 방식이 차별화되는 점은, 타이밍과 대화 순서 조절을 사후에 기존 멀티모달 모델에 덧씌워진 기능이 아닌, 최우선 해결 과제로 삼는 명확한 아키텍처적 접근 방식에 있습니다.

벤치마크 점수와 신뢰할 수 있는 실제 적용 간의 격차

제3자 벤치마크에서 85.21%의 정확도를 기록하거나 심지어 1위를 차지했다고 해도, 그것이 호텔 로비에서 감독 없이 근무할 준비가 된 로봇이라는 주장과는 다릅니다.

DailyOmni와 같은 벤치마크 평가는 통제된 환경에서 오디오, 비디오, 텍스트 입력을 종합적으로 추론하는 모델의 능력을 테스트합니다. 관객 앞에서 진행되는 즉흥적인 라이브 무대 상호작용은 구매자가 실제로 중요하게 여기는 실제 배포 환경에 더 가깝지만, 이는 지속적인 운영 기록이라기보다는 여전히 선별된 단일 시연에 불과합니다. AGIBOT은 실제 소음 환경에서의 오류율이나 지연 시간 수치를 공개하지 않았으며, 회사가 목표로 하는 소매 및 접객 업계에서 흔히 발생하는, 여러 사람이 서로 말을 끊으며 대화할 때 WITA-Omni가 어떻게 작동하는지에 대해서도 밝히지 않았다. WITA-Omni가 탑재된 로봇과 대본에 따라 작동하는 대안을 비교 검토 중인 구매자는 월요일의 시연을, 해당 기능이 대규모의 무인 상업적 배포에 즉시 적용될 준비가 되었다는 증거가 아니라, 기본 아키텍처가 적어도 하나의 실시간 환경에서 작동한다는 증거로 받아들여야 한다.

기본 데이터 전략이 시사하는 AGIBOT의 로드맵

WITA-Omni의 훈련 방식은 말, 움직임, 표정 간의 정확한 시간적 관계를 보존한 데이터를 기반으로 모델을 구축하는 것으로, 대부분의 신체 기반 AI 연구소가 조작 작업에 의존하는 영상 및 이미지 데이터셋과는 다른 데이터 수집 파이프라인을 필요로 합니다. 이는 의미 있는 투자 결정입니다. AGIBOT은 휴머노이드 로봇이 공장을 벗어나 생산 라인에서 홀로 작업하는 대신 대중과 함께 일하는 환경으로 진출함에 따라, 단순히 과제 수행 정확도뿐만 아니라 상호작용의 질이 차별화 요소가 될 것이라고 내다보고 있습니다. 이는 또한 회사의 광범위한 제조 입지를 반영합니다. 이미 15,000대의 로봇을 출하했으며 홍콩 상장을 추진 중인 기업은, 단기적으로 제품 출하로 이어질 전망이 없는 기술을 시연하는 것보다, 이미 대량 생산이 가능한 하드웨어의 잠재 시장을 확대할 수 있는 제품 기능을 개발하는 데 초기 단계의 스타트업보다 더 큰 동기를 가지고 있다.

‘상호작용 경쟁’을 읽어보면

중국의 더 넓은 휴머노이드 분야

중국의 휴머노이드 로봇 제조사들은 2026년 대부분을 생산량과 이동성 벤치마크 경쟁에 쏟아부었으며, 자사 하드웨어가 지속적인 산업 현장에서 견딜 수 있음을 입증하기 위해 달리기 속도 기록 경신, 장애물 코스 통과, 공장 현장 내 내구성 시험 등을 진행해 왔다. WITA-Omni는 로봇이 얼마나 빠르거나 얼마나 오랫동안 작동할 수 있는지가 아니라, 대본에 따라 행동하지 않는 사람들과 함께 있는 공간에서 얼마나 자연스럽게 어울릴 수 있는지가 차별화 요소가 되는, 또 다른 경쟁 축을 대표합니다. 이러한 변화는 상업적으로 중요한 의미를 지닌다. AGIBOT이 목표로 하는 도입 분야인 호텔·리조트, 소매, 엔터테인먼트 분야는 창고 현장과는 다른 차원의 신뢰성을 요구하기 때문이다. 가끔 센서 판독값을 잘못 인식하는 사족 보행 검사 로봇은 하룻밤 사이에 재보정할 수 있지만, 잘못된 손님에게 응답하거나 유료 고객 앞에서 대화 도중 멈춰 버리는 안내 로봇은 눈에 띄고 즉각적인 실패를 초래하며, 해당 역할에 로봇을 사용하는 것 자체의 타당성을 훼손합니다. AGIBOT이 기존 휴머노이드 플랫폼에 단순히 음성 어시스턴트를 추가하는 대신, 상호작용 타이밍 아키텍처를 구축하고 공개 시연하기로 한 결정은, 기본적인 이동 및 조작 성능이 더 이상 차별화 요소가 아닌 기본 요건이 되어가는 시장에서, 이 회사가 바로 그 신뢰성 격차를 차기 경쟁의 전장으로 보고 있음을 시사합니다.

올해 기존 제품 라인에 음성 상호작용 기능을 추가한 유니트리(Unitree)나 UBTECH와 같은 중국 경쟁사들과 AGIBOT을 비교하는 구매자 입장에서는, 핵심적인 질문은 어느 회사가 휴머노이드 섀시에 챗봇을 구동하는지가 아니라, 어느 회사가 처음부터 기본 모델 아키텍처에 대화 순서 관리, 중단 처리, 다자간 인식 기능을 내재화했는지가 될 것이다. AGIBOT의 ‘Thinker-Talker-Actor’ 설계는 로봇이 단일 방문객 대상 시연 단계에서 벗어나 여러 방문객이 동시에 존재하는 환경으로 넘어갈 때, 이러한 차이가 실제 배치 신뢰성으로 나타날 것이라는 기대에서 비롯된 전략입니다.

스피커 소리, 배경 소음, 그리고 소매점 매장이나 호텔 로비에서 흔히 볼 수 있는 혼잡한 상황 등—월요일의 정교하게 연출된 콘서트 현장에서는 이러한 요소들을 고려할 필요가 없었습니다.

AGIBOT은 WITA-Omni를 지속적으로 개발하고 자사의 로봇 플랫폼 전반으로 이 모델을 확대해 나갈 것이라고 밝혔으며, 로봇이 단순히 지시를 받는 것을 넘어 실시간으로 진행되는 인간 간의 상호작용에 직접 참여하도록 만드는 것을 목표로 삼고 있다고 전했다. 그러한 야망이 실제 호텔 로비, 휴일 성수기 동안 붐비는 소매 매장, 혹은 동시에 세 가지 질문을 처리해야 하는 리셉션 데스크와 마주했을 때 과연 살아남을 수 있을지는, 어떤 무대 시연만으로는 결론을 내릴 수 없는 시험이다. 마카오에서 열린 월요일 공연이 입증한 점은 범위는 좁지만 여전히 주목할 만하다. 즉, 휴머노이드 로봇이 전문 공연자와 대등하게, 대본 없이 생방송 시청자 앞에서 제 몫을 해냈으며, 이를 위해 대본이 필요하지 않았다는 사실이다.

이 기사는 AGIBOT의 2026년 9월 제품 시연에 관한 회사 공개 자료와 공개 보도를 종합한 것입니다. 본 기사는 일반적인 정보 제공을 목적으로 하며, 투자, 금융 또는 법률 자문을 구성하지 않습니다.

대표 이미지 출처: AGIBOT.