语音生成常见问题
是的,完全免费。由于全部在浏览器内运行,没有服务器成本,因此没有使用次数或生成时长的限制,也支持商用。
不会。参考音频、输入文本、生成的音频全部在浏览器内处理,不会发送到 AudioBuff 或 Resemble 的服务器。
最少 10 秒,推荐 15-20 秒。不足 10 秒会导致声音特征提取不稳定,超过 20 秒后质量提升有限。请在噪音较少的环境中以自然的语速录制。
目前仅支持英语(测试版)。Resemble 已于 2025 年 12 月发布支持 23 种语言的 Chatterbox Multilingual 模型,待其 Transformers.js 浏览器移植完成后,AudioBuff 也将陆续引入。
是的,始终会嵌入名为 Resemble Perth 的神经网络水印。该水印不可闻,但即使经过 MP3 压缩或重采样后仍可检测,可用于事后从技术上确认该音频为 AI 生成。AudioBuff 未提供关闭该水印的选项。
目前不支持 iOS Safari / macOS Safari(由于 WebKit JSEP 的已知缺陷,崩溃概率较高)。请使用最新版 Chrome / Edge / Firefox。在不支持 WebGPU 的环境中,也会通过 WebAssembly 回退方案运行。
首次使用需下载约 1.5GB 的模型文件,并持久化缓存在浏览器的 IndexedDB 中。之后可离线使用。可随时通过"清除缓存"按钮删除。
可以。生成完成后,点击"前往音频加工编辑器"按钮,即可直接跳转到支持 EQ、响度归一化、MP3 导出的音频加工页面。从克隆到加工再到最终导出格式,全程无需离开浏览器。
请仅使用本人的声音,或已获得明确授权使用的声音。未经许可克隆他人声音并公开发布,可能违反美国 ELVIS 法案等各国相关法律,责任由使用者本人承担。若在欧盟地区发布,还需披露该音频为 AI 合成。