引入参考资料
使用最多三个音频片段来引导人声或风格。或者添加一张图片并描述场景中的声音。
讲述故事的人声,烘托氛围的音乐,栩栩如生的场景。只需寥寥数语,即可创造一切。
由 ByteDance 提供技术支持 · 每次生成消耗 1,000 个音频字符
窗户上雨点拍打的特写,远处低沉的雷声,随后雨势减弱。无语音或音乐。
音效初体验。您的下一次创作也可以包含人声和音乐。
选择一个起点,修改几个词,然后将您的创意带入工作室。
为模型提供可遵循的情绪、可参考的人声或可激活的场景。不断打磨,直到它完美契合您的项目。
使用最多三个音频片段来引导人声或风格。或者添加一张图片并描述场景中的声音。
调整速度、音量和音调。选择目标长度和 8 到 48 kHz 的采样率。实际时长可能会有所不同。
试听、保存并下载。您的作品将保留在历史记录中,随时可用于下一次剪辑、剧集或创意。
创作旁白、对话、音乐、音效或融合这些元素的场景。描述人声、情绪、环境以及音频的展开方式。Seed Audio 1.0 是 ByteDance 的音频创作模型。
是的。您可以上传最多三个 MP3 或 WAV 音频片段(每个最长 30 秒),或一张 JPG、PNG 或 WebP 图片。每个文件最大为 10 MB。音频参考和图片引导需分开使用。请仅上传您拥有使用权限的媒体。
设置最高 120 秒的目标时长,或选择“自动”。时长仅作为提示引导,实际长度可能有所不同。支持下载 MP3、WAV、OGG Opus 或原始 PCM 格式。PCM 包含一个用于试听的 WAV 预览。
每次成功生成将消耗您套餐额度中的 1,000 个音频字符。您可以在生成前查看余额和成本。试听本页面的演示音频不会消耗额度。
文本转语音侧重于用选定的人声朗读脚本。而此生成器允许您描述整个音频创意,包括人声、音乐、氛围和音效。使用提示词来导演表演和场景。