나만의 목소리로 어떤 언어든 말하기 — 회의를 위한 네이티브 음성 복제
Speak Mode는 이미 내 언어로 말하면 합성된 목소리가 그 번역을 회의에 전달해 주는 기능이었습니다. 지금까지 말하는 쪽을 맡은 것은 스튜디오 프리셋 음성이었습니다. 오늘 저희는 빠져 있던 조각을 내보냅니다: Gaavala Pro가 사이드 패널에서 녹음한 샘플로 나만의 목소리를 직접 복제하고, 그 복제 목소리가 Gaavala가 번역하는 60개 언어 전체를 말합니다. 제3자 계정도, API 키도, 따로 설정해야 할 별도 도구도 없습니다.
네이티브 음성 복제란 무엇인가
말로 하면 단순하지만 안정적으로 만드는 데는 실제 엔지니어링이 필요했던 아이디어입니다: 약 20초 분량의 내 발화를 한 번 녹음하면 Gaavala가 그 목소리를 본뜬 합성 음성을 만듭니다. 그때부터 Speak Mode가 번역된 문장을 회의에 재생할 때, 일반 프리셋 대신 그 목소리로 재생할 수 있습니다 — 일본어로도, 포르투갈어로도, 아랍어로도, Gaavala가 지원하는 60개 언어 가운데 무엇으로든, 언어를 넘나들며, 똑같은 하나의 샘플에서요.
이것은 Soniox 기반 기능이며, 개인 복제 음성은 Pro 요금제의 일부로 포함되어 있습니다. 새로 만들 계정도, 추적해야 할 문자당 과금도, 설정 필드에 붙여 넣을 API 키도 없습니다. 샘플이, 이미 회의 오디오와 Speak Mode 마이크 입력을 실어 나르고 있는 바로 그 Soniox 직결 파이프라인을 벗어나지 않기 때문입니다. 파이프라인에 새로운 벤더를 들이는 것이 아니라, 이미 전사와 번역을 맡고 있는 쪽이 내 목소리의 합성까지 담당하도록 확장하는 것입니다.
사용 방법
설정에는 1분 정도 걸립니다:
- Gaavala 사이드 패널을 열고 Speak Mode 설정으로 이동하세요.
- 음성 옵션으로 Clone my voice(내 목소리 복제)를 고르세요.
- 짧은 샘플을 녹음하세요 — 평소 말투로 약 20초면 충분합니다. 가장 편한 언어로 한두 문장을 소리 내어 읽으면 됩니다.
- Gaavala가 그 샘플로 개인 음성을 만듭니다. 준비되고 나면 Speak Mode 음성으로 선택하세요.
- 회의에 참여해 평소처럼 Speak 버튼을 쓰세요 — 탭하면 핸즈프리 창이 열리고, 길게 누르면 누르고 있는 동안만 말합니다. 이제 번역된 문장이 회의에 필요한 대상 언어로, 복제된 내 목소리로 재생됩니다.
복제 음성을 새로 고치고 싶다면 언제든 샘플을 다시 녹음할 수 있고, 같은 설정 화면에서 원할 때 통째로 삭제할 수도 있습니다.
프라이버시 모델
음성 샘플은 전사본이나 회의 녹음과 다릅니다. 그것은 생체 정보 — 나를 식별할 수 있는 신체적 특징 — 이며, Gaavala는 이미 직결로 설계된 제품의 나머지 오디오 파이프라인보다 한 걸음 더 나아간 보호 장치로 그에 걸맞게 다룹니다.
정확히 이런 일이 일어납니다: 약 20초 분량의 샘플은 AES-256-GCM으로 암호화되어 Gaavala 서버에 저장됩니다. 오직 한 가지 목적 — 개인 합성 음성을 만들고 유지하는 것 — 에만 쓰이며 그 외의 용도로는 쓰이지 않습니다. 식별에 사용되지 않고, 광고에 사용되지 않으며, 그것이 존재하는 단 하나의 목적을 넘어 공유되지 않습니다. 샘플은 음성 모델을 구성하기 위해 저희 음성 제공자인 Soniox가 처리하며, Soniox는 그 목적을 넘어서는 어떤 용도로도 샘플을 받지 않습니다.
이는 Gaavala가 제품의 다른 모든 곳에서 오디오를 다루는 방식에 대한 의도적인 예외입니다. 회의 오디오와 Speak Mode 마이크 입력은 저희 서버에 저장되지 않습니다 — 브라우저에서 Soniox로 스트리밍되고 그대로 사라집니다. 음성 복제 샘플은 필요에 의해 다릅니다: 복제 음성이 세션마다 계속 작동하려면 나중에 내 목소리를 재현할 수 있도록 무언가가 남아 있어야 합니다. 그래서 저희는 그 하나의 예외를 명시적이고, 좁고, 완전히 되돌릴 수 있게 만들었습니다: 암호화되고, 목적에 묶여 있으며, 지우는 권한은 사용자에게 있습니다.
음성 복제를 삭제하는 것은 사이드 패널에서의 단 한 번의 동작이며, "삭제"가 마땅히 뜻해야 할 바를 정확히 수행합니다 — 녹음본, 그것으로 만든 합성 음성, 그리고 제공자 쪽에 보관된 해당 데이터를 제거합니다. 그 뒤에는 아무것도 남지 않습니다. 조직의 방침이나 스스로의 습관상 어딘가에 저장해 둔 데이터를 주기적으로 점검한다면, 이 기능은 그 점검을 사소한 일로 만들도록 설계되어 있습니다: 토글 하나, 확인 한 번이면 사라집니다.
이 데이터의 보관, 처리, 그리고 그에 관한 사용자의 권리에 대한 전체 내용은 프라이버시 정책의 음성 복제 항목에 있습니다 — Gaavala가 데이터를 다루는 방식에 대해 저희가 하는 다른 모든 주장을 규율하는 바로 그 문서입니다.
누구를 위한 기능인가
네이티브 음성 복제는 Speak Mode가 이미 돕고 있는 사람들을 겨냥하되, 한 가지 이점을 더합니다: 일관성입니다. 같은 고객, 같은 동료, 같은 파트너와 여러 언어에 걸쳐 반복되는 통화를 한다면, 매번 같은 목소리 — 내 목소리 — 를 듣는 것은 돌아가며 바뀌는 스튜디오 프리셋이 끝내 완전히 없애지 못하는 낯섦의 층을 걷어냅니다. 국제 컨설턴트, 오프쇼어 팀과 스탠드업을 진행하는 다국어 팀 리드, 해외 시장을 담당하는 영업 담당자가 가장 분명하게 들어맞습니다 — 이미 Speak Mode를 찾는 이유와 똑같습니다: 그저 들리는 것이 아니라 이해되는 것.
또한 개인 음성을 얻는 가장 마찰 적은 방법이기도 합니다 — 따로 유지해야 할 두 번째 벤더 관계가 없습니다.
네이티브 음성 복제는 지금 Pro에서 사용할 수 있습니다. 사이드 패널에서 Speak Mode를 열어 샘플을 녹음하고 다음 회의에서 시험해 보세요.