用你自己的声音说任何语言——会议中的原生声音克隆

Speak Mode 早就让你能用自己的语言说话,再由一个合成语音把译文送进会议。而在此之前,负责开口的一直是一个录音室预设音色。今天我们把缺失的那块补上了:Gaavala Pro 可以直接克隆你自己的声音——素材就是你在侧边面板里录下的一段样本——而这个克隆能说 Gaavala 翻译的全部 60 种语言。不需要第三方账户,不需要 API 密钥,也没有另一个工具要配置。

原生声音克隆究竟是什么

这个想法说起来很简单,做到可靠却需要真正的工程:录一次大约 20 秒你自己的说话,Gaavala 就会构建一个以你为模型的合成语音。从那以后,当 Speak Mode 把你翻译后的句子播进一场会议时,它可以用那个声音来播,而不是一个通用预设——日语、葡萄牙语、阿拉伯语,或者 Gaavala 支持的 60 种语言中的任意一种,跨语言地,全部来自同一段样本。

这是一项由 Soniox 驱动的功能——你的个人克隆包含在 Pro 套餐之中。没有另一个账户要创建,没有按字符计费要盯着,也没有 API 密钥要粘进某个设置框里,因为这段样本从未离开那条早已承载你会议音频和 Speak Mode 麦克风输入的、直连 Soniox 的管线。我们并没有往管线里引入一个新的供应商;我们只是把那个已经在做转录和翻译工作的供应商,扩展到也负责合成你的声音。

怎么用

设置大约需要一分钟:

  1. 打开 Gaavala 侧边面板,进入 Speak Mode 设置。
  2. 在音色选项中选择 “Clone my voice”(克隆我的声音)。
  3. 录一段简短的样本——大约 20 秒的正常说话就够了。用你最自在的那种语言,朗读一两句话。
  4. Gaavala 会用这段样本构建你的个人声音。构建完成后,把它选为你的 Speak Mode 音色。
  5. 加入会议,像平常一样使用 Speak 按钮——轻点它开启一个免提窗口,或者按住它,只在按住期间说话。你翻译后的句子现在会用你自己的克隆声音播出,用的是这场会议需要的那种目标语言。

如果你想刷新这个克隆,随时可以重新录制样本;你也可以在同一个设置界面里,随时把它整个删掉。

隐私模型

一段声音样本不同于一份转录稿或一段会议录音。它是生物特征数据——一种能够识别你的身体特征——Gaavala 因此以相应的方式对待它,其保护措施比产品其余部分那条本就直连的音频管线走得更远。

具体发生的事情是这样的:你那段 ~20 秒的样本,以 AES-256-GCM 加密形式静态存储在 Gaavala 的服务器上。它只被用于一个用途——构建并维护你的个人合成语音——除此之外别无他用。它从不被用于身份识别,从不被用于广告,也从不在这唯一的用途之外被共享。样本会交由我们的语音供应商 Soniox 处理,用以构建这个声音模型;除此之外,Soniox 不会为任何其他目的接收它。

这是 Gaavala 在产品其他所有地方处理音频的方式之外,一个刻意为之的例外。你的会议音频和 Speak Mode 的麦克风输入从不被存储在我们的服务器上——它们从浏览器流向 Soniox,然后就消失了。你的声音克隆样本则出于必要而不同:为了让克隆在一次又一次的会话中都能用,必须有东西被持久保存下来,你的声音才能在之后被重现。所以我们把这个唯一的例外做得明确、狭窄,并且完全可逆:加密、绑定用途,并且由你来移除。

删除你的声音克隆,在侧边面板里是一个动作,而它做的正是“删除”应该意味着的事——移除那段录音、由它构建出的合成语音,以及供应商侧持有的相应数据。此后不会有任何东西残留。如果你所在的组织或你自己的习惯要求定期审视自己在各处存了哪些数据,这项功能的设计目标就是让这次审视变得毫不费力:一个开关,一次确认,它就没了。

关于这份数据的留存、处理以及你所拥有的权利,完整细节写在我们的隐私政策的声音克隆一节中——同一份文件也管辖着我们关于 Gaavala 如何处理你的数据所作的每一条声明。

这是为谁做的

原生声音克隆瞄准的,是 Speak Mode 本来就在服务的那群人,只是多了一层好处:一致性。如果你跨语言地与同一批客户、同事或合作伙伴进行周期性通话,每一次都听到同一个声音——你的声音——会消除一层生疏感,而这是一个轮换的录音室预设始终无法完全消除的。国际顾问、带着离岸团队开站会的多语言团队负责人,以及在海外市场做业务的销售代表,是最契合的人群,理由也与他们本来就伸手去用 Speak Mode 的理由相同:被理解,而不只是被听见。

它同时也是获得一个个人声音的最低摩擦路径——不必再维护第二段供应商关系。

原生声音克隆现已在 Pro 上可用。在侧边面板中打开 Speak Mode,录下你的样本,在下一场会议里试试它。

更多 Gaavala 指南