editoy

Google DeepMind의 수어 번역 AI 모델 'SL2T' 발표 및 Pixel 11 탑재

8/13/2026

토킹 포인트

  • Google DeepMind가 수어를 텍스트로 자동 번역하는 AI 모델 SL2T를 공개하고 Pixel 11의 Gboard 및 Live Transcribe에 탑재함.
  • MediaPipe Holistic 기반 온디바이스 컴퓨터 비전 기술로 130개 신체 좌표만 전송하여 가공 전 비디오 유출 없는 프라이버시 보호 구조 구축함.
  • 50개 이상의 수어 언어와 10만 시간 이상의 데이터를 학습하여 기존 글로스 방식을 거치지 않고 직접 영문 텍스트로 번역하는 고성능 모델 구현함.
  • 왼손 사용자 지원, 한 손 수어 인식 및 환각 현상 방지 기능을 갖추었으나 법적·의료적 전문 통역 대체용이 아닌 보조 입력 도구로 정의함.

시황 포커스

  • 실시간 손가락 추적 및 세부 동작 구분 능력이 입증됨에 따라 컴퓨터 비전 모델의 정밀도 향상에 대한 시장의 기대감이 고조됨.
  • 단순한 연구실 실험 단계를 넘어 실생활 스마트폰 제품인 Pixel 11에 직접 적용되는 실용적 인공지능 서비스 구현으로 평가받음.
  • 개인정보 보호 강화를 위해 생 영상을 저장하거나 전송하지 않고 온디바이스에서 랜드마크 좌표만 추출하여 서버로 보낼 수 있는 기술 구조가 긍정적 호평을 받음.
  • 한 손 수어 및 왼손 사용자 지원 등 모바일 사용 환경을 고려한 세심한 모바일 최적화 설계가 실제 사용자 경험 개선에 기여할 것으로 전망됨.
  • 학술적 벤치마크인 FLEURS-ASL 기준 최고 점수를 달성함에 따라 다국어 수어 번역 기술 시장에서 Google의 기술적 주도권이 더욱 강화됨.
  • 고위험 전문 통역을 완전히 대체하기보다는 보조 입력 도구로 한정하여 신중하게 접근하는 개발 전략이 리스크 관리 측면에서 적절함.

트렌드 키워드

  • SL2T (Sign-Language-to-Text):

    수어 동작을 카메라로 인식하여 실시간 텍스트로 직접 번역하는 Google DeepMind의 다국어 AI 모델

    약 7000만 명의 청각장애인을 위해 수어 동작을 스마트폰 카메라로 인식하여 텍스트로 즉각 전환해 주는 혁신적인 인공지능 모델.SL2T
  • MediaPipe Holistic :

    사용자의 얼굴, 손, 팔, 상체 등 130개 위치 좌표를 스마트폰 내부에서 실시간 추적하는 온디바이스 컴퓨터 비전 기술

    원본 비디오 영상을 서버에 올리지 않고 신체 좌표 데이터만 전송하여 사용자의 프라이버시를 철저히 보호하는 기술.MediaPipe Holistic
  • 글로스 (Gloss):

    수어 번역 과정에서 중간 단계로 사용되던 문자화된 주석 표기 방식

    기존 수어 번역의 중간 표기 방식을 건너뛰고 텍스트로 직접 번역함으로써 비언어적 표정과 공간 문법 구조를 완벽하게 반영함.글로스
  • FLEURS-ASL :

    미국 수어(ASL)를 영문 텍스트로 번역하는 정확도를 평가하는 표준 벤치마크

    SL2T 모델이 최고 수준인 70 BLEURT 점수를 기록하며 기존 성능 기록을 대폭 경신한 평가 지표.FLEURS-ASL
  • AI 수어 자문위원회 (AI Sign Language Advisory Committee):

    수어 기술의 책임감 있는 개발과 윤리적 적용을 위해 청각장애인 단체 및 전문가들과 함께 설립한 기구

    기술 개발 우선순위에 실제 당사자의 의견을 반영하고 기술의 한계점과 가능성을 투명하게 공유하기 위한 협의체.AI 수어 자문위원회