물리·지구과학

지식 더하기 우리의 친구 빅스비와 시리의 모든 것

스마트폰에 대고 말을 하면 사람처럼 알아듣고 비서를 자처하는 시리와 빅스비 뒤에 숨겨진 음성 인식 기술과 인공지능(AI)의 데이터 처리 원리를 파헤친다.

편집부 · 2022년 7월 28일 · 읽는 데 4분

기술, 빛나는 이진 코드로 변환되어 거대한 기계 AI 뇌로 직접 솟아오르는 인간의 목소리를 나타내는 미래형 빛나는 디지털 파형
기술, 빛나는 이진 코드로 변환되어 거대한 기계 AI 뇌로 직접 솟아오르는 인간의 목소리를 나타내는 미래형 빛나는 디지털 파형

스마트폰을 손에 들고 "시리야, 오늘 날씨 어때?" 혹은 "하이 빅스비, 음악 좀 틀어줘"라고 중얼거려 본 경험이 있을 것이다. 불과 십여 년 전만 해도 기계와 말을 한다는 것은 SF 영화(아이언맨의 자비스)에서나 보던 미친 상상이었다. 사람의 목소리는 녹음기처럼 저장할 수는 있었지만, 기계가 그 소리의 '의미'를 알아듣는다는 것은 완전히 다른 차원의 마법이기 때문이다. 사람마다 억양이 다르고, 사투리를 쓰고, 심지어 주변의 시끄러운 자동차 소음이 섞여 들어오는데도, 주머니 속의 작은 쇳덩어리(스마트폰)는 어떻게 내 개떡 같은 발음을 찰떡같이 알아듣고 스케줄을 세팅해 주는 것일까? 인간의 음파를 쪼개어 기계의 언어로 번역하고, 방대한 서버를 오가며 비서 역할을 수행하는 인공지능(AI) 음성 인식 기술의 숨가쁜 데이터 파이프라인 속으로 들어가 보자.

음파를 썰어라, 퓨리에 변환(FFT)

우리가 스마트폰 마이크에 대고 말을 하면, 가장 먼저 일어나는 일은 '아날로그 소리를 디지털 숫자로 쪼개는 것'이다. 사람의 목소리는 공기의 떨림(파동)이 엉망진창으로 섞여 있는 복잡한 그래프다. 스마트폰은 '퓨리에 변환(FFT)'이라는 기가 막힌 수학 공식을 써서 이 복잡한 음파를 '고음, 중음, 저음'의 얇은 실가닥으로 쫙쫙 찢어 분류한다. 그리고 이 찢어진 소리 가닥들을 아주 잘게 썰어서 1초에 수천 개의 숫자 데이터(특징 벡터)로 바꾼다. "내일 비 와?"라는 당신의 떨리는 목소리는 이제 기계가 씹고 뜯고 맛볼 수 있는 완벽한 차가운 '수학적 행렬(숫자 덩어리)'로 치환되어 인터넷망(클라우드 서버)으로 쏘아 올려진다.

딥러닝의 마법, 소리와 단어의 짝짓기(음향 모델)

서버로 날아간 숫자 덩어리는 애플(Siri)이나 삼성(Bixby)이 만들어놓은 거대한 뇌(인공 신경망) 속으로 쏟아져 들어간다. 여기서부터가 진짜 인공지능(AI)의 영역이다. 뇌 속의 첫 번째 관문인 '음향 모델'은 수억 명의 사람들이 말한 수만 시간 분량의 목소리 데이터를 미리 학습(딥러닝)해둔 상태다. 기계는 방금 들어온 숫자 덩어리를 요리조리 맞춰보며 "이 숫자의 패턴은 한국어의 'ㄴ' 소리와 확률적으로 90% 일치하고, 뒤이어 오는 소리는 'ㅐ' 발음과 비슷하군!"이라며 소리를 조각조각(음소 단위) 텍스트(글자)로 뱉어낸다. 음성 조각을 처리하는 인공 신경망의 미세한 뷰로, 빛나는 파란색 오디오 조각을 거대한 인간 단어 라이브러리와 일치시키는 모습, AI 음성 인식

문맥을 파악하라, 자연어 처리(NLP)

하지만 소리만 글자로 바꿨다고 끝이 아니다. "배가 고파서 배를 먹으면서 배를 탔다"라는 문장에서 기계는 세 개의 '배'가 사람 신체인지, 과일인지, 선박인지 구분해야 한다. 이때 등장하는 것이 언어 모델(자연어 처리, NLP)이다. 기계는 앞뒤 단어의 문맥을 확률적으로 계산하여 가장 말이 되는 문장을 끼워 맞춘다. "오늘 밥 어때?"라고 들려도, 앞뒤 문맥을 분석해 "아, '오늘 날씨 어때'를 잘못 발음했구나!"라며 스스로 문장을 똑똑하게 교정해 버리는 것이다.

액션의 실행, 똑똑한 손발

마지막으로 문장의 '의도'를 파악했다면 이제 행동(Action)으로 옮길 차례다. "날씨 어때"라는 의도를 파악한 AI는 즉시 기상청 서버(API)에 접속하여 내일의 날씨 데이터를 훔쳐 온다. 그리고 이 데이터를 다시 텍스트로 정리한 뒤, 'TTS(텍스트를 음성으로 변환하는 기술)'를 이용해 기계 합성음으로 "내일은 비가 올 예정입니다"라는 우아한 목소리를 만들어내 스마트폰 스피커로 쏴준다. 당신이 질문을 던지고 시리가 대답하는 그 짧은 1~2초 사이에, 수천 킬로미터 떨어진 서버와 수학적 행렬들이 초당 수백억 번의 연산을 주고받는 미친 릴레이 경주가 일어난 것이다. 왼쪽에는 혼란스럽고 지저분한 음파를 전화기에 대고 소리치는 사람을, 오른쪽에는 정확한 명령을 읽는 깔끔하고 체계적인 빛나는 로봇 텍스트를 보여주는 분할 화면

남은 과제

지금의 음성 비서들은 여전히 묻는 말에만 대답하는 '정해진 명령어(규칙)'의 굴레에 갇혀 있다.

이어서 읽기