Traga uma referência
Use até três clipes de áudio para guiar uma voz ou estilo. Ou adicione uma imagem e descreva os sons da cena.
Uma voz que conta sua história. Música que define o clima. Uma cena que parece viva. Crie tudo a partir de poucas palavras.
Desenvolvido por ByteDance · 1.000 caracteres de áudio por geração
Chuva batendo de perto em uma janela, um trovão baixo e distante, depois a chuva diminuindo. Sem fala ou música.
Uma amostra de seus efeitos sonoros. Sua próxima criação também pode incluir vozes e música.
Escolha um ponto de partida, mude algumas palavras e leve sua ideia para o estúdio.
Dê ao modelo um sentimento para seguir, uma voz para referência ou uma cena para dar vida. Continue moldando até que se ajuste ao seu projeto.
Use até três clipes de áudio para guiar uma voz ou estilo. Ou adicione uma imagem e descreva os sons da cena.
Ajuste velocidade, volume e tom. Escolha uma duração desejada e uma taxa de amostragem de 8 a 48 kHz. A duração real pode variar.
Ouça, salve e baixe. Suas criações ficam no seu histórico, prontas para a próxima edição, episódio ou ideia.
Crie narração, diálogo, música, efeitos sonoros ou uma cena que combine tudo isso. Descreva as vozes, o clima, o cenário e como o áudio deve se desenrolar. Seed Audio 1.0 é o modelo de criação de áudio da ByteDance.
Sim. Anexe até três clipes de áudio MP3 ou WAV, cada um com até 30 segundos, ou uma imagem JPG, PNG ou WebP. Cada arquivo pode ter até 10 MB. Use referências de áudio e orientação por imagem separadamente. Envie apenas mídias que você tem permissão para usar.
Defina uma duração de até 120 segundos ou escolha Automático. A duração é uma orientação para o prompt, portanto o tempo real pode variar. Baixe em MP3, WAV, OGG Opus ou PCM bruto. O PCM inclui uma prévia em WAV para audição.
Cada geração bem-sucedida usa 1.000 caracteres da cota de áudio do seu plano. Você pode ver seu saldo e o custo antes de gerar. Ouvir as demonstrações nesta página não consome sua cota.
A conversão de texto em voz foca na leitura de um roteiro em uma voz selecionada. Este gerador permite descrever uma ideia de áudio completa, incluindo vozes, música, ambiente e efeitos. Use um prompt para direcionar a performance e a cena.