ใช้ไฟล์อ้างอิง
ใช้คลิปเสียงสูงสุด 3 คลิปเพื่อกำหนดเสียงหรือสไตล์ หรือเพิ่มรูปภาพและอธิบายเสียงของฉากนั้น
เสียงที่บอกเล่าเรื่องราว ดนตรีที่สร้างอารมณ์ และฉากที่มีชีวิตชีวา สร้างสรรค์ทั้งหมดนี้ได้จากคำเพียงไม่กี่คำ
ขับเคลื่อนโดย ByteDance · ใช้ 1,000 ตัวอักษรเสียงต่อการสร้าง
เสียงฝนตกกระทบหน้าต่างแบบใกล้ชิด เสียงฟ้าร้องเบาๆ ในระยะไกล แล้วฝนค่อยๆ ซาลง ไม่มีเสียงพูดหรือดนตรี
ตัวอย่างเสียงเอฟเฟกต์ ผลงานชิ้นต่อไปของคุณสามารถรวมทั้งเสียงพูดและดนตรีได้เช่นกัน
เลือกจุดเริ่มต้น ปรับเปลี่ยนคำเพียงเล็กน้อย แล้วนำไอเดียของคุณเข้าสู่สตูดิโอ
กำหนดอารมณ์ให้โมเดลทำตาม ใช้เสียงอ้างอิง หรือสร้างฉากให้มีชีวิตชีวา ปรับแต่งจนกว่าจะลงตัวกับโปรเจกต์ของคุณ
ใช้คลิปเสียงสูงสุด 3 คลิปเพื่อกำหนดเสียงหรือสไตล์ หรือเพิ่มรูปภาพและอธิบายเสียงของฉากนั้น
ปรับความเร็ว ระดับเสียง และระดับสูงต่ำ เลือกความยาวที่ต้องการและอัตราสุ่มสัญญาณตั้งแต่ 8 ถึง 48 kHz ความยาวจริงอาจแตกต่างกันไป
ฟัง บันทึก และดาวน์โหลด ผลงานของคุณจะถูกเก็บไว้ในประวัติ พร้อมสำหรับการตัดต่อ ตอนต่อไป หรือไอเดียใหม่ๆ
สร้างเสียงบรรยาย บทสนทนา ดนตรี เสียงเอฟเฟกต์ หรือฉากที่รวมทุกอย่างเข้าด้วยกัน อธิบายลักษณะเสียง อารมณ์ สถานที่ และลำดับเหตุการณ์ Seed Audio 1.0 คือโมเดลสร้างเสียงจาก ByteDance
ได้ คุณสามารถแนบคลิปเสียง MP3 หรือ WAV ได้สูงสุด 3 คลิป (คลิปละไม่เกิน 30 วินาที) หรือรูปภาพ JPG, PNG หรือ WebP 1 รูป แต่ละไฟล์ขนาดไม่เกิน 10 MB โปรดใช้การอ้างอิงเสียงและการอ้างอิงรูปภาพแยกกัน และอัปโหลดเฉพาะสื่อที่คุณได้รับอนุญาตเท่านั้น
ตั้งความยาวที่ต้องการได้สูงสุด 120 วินาที หรือเลือกอัตโนมัติ ความยาวเป็นเพียงการแนะนำตามพรอมต์ ดังนั้นความยาวจริงอาจแตกต่างกัน ดาวน์โหลดได้ในรูปแบบ MP3, WAV, OGG Opus หรือ PCM แบบดิบ (PCM จะมีตัวอย่าง WAV ให้ฟัง)
การสร้างแต่ละครั้งที่สำเร็จจะใช้ 1,000 ตัวอักษรจากโควตาเสียงในแพ็กเกจของคุณ คุณสามารถดูยอดคงเหลือและค่าใช้จ่ายก่อนสร้างได้ การฟังตัวอย่างในหน้านี้จะไม่หักโควตาของคุณ
Text-to-speech เน้นการอ่านบทด้วยเสียงที่เลือก แต่เครื่องมือสร้างนี้ช่วยให้คุณอธิบายไอเดียเสียงทั้งหมดได้ ทั้งเสียงพูด ดนตรี บรรยากาศ และเอฟเฟกต์ ใช้พรอมต์เพื่อกำกับการแสดงและฉาก