Нейронавт | Нейросети в творчестве

ThinkSound

Модель от Tongyi Lab (авторов InspireMusic и много чего еще) создаёт реалистичный звук для видео. Архитектура - цепочка рассуждений (#CoT). Необычно для генерилки звука, да? Скоро достижения языковых моделей будут везде, к этому все идет.

Модель сначала генерирует общий звуковой фон, затем улучшает качество звука конкретных объектов на экране и, наконец, редактирует всё это по текстовым указаниям пользователя

Код
Демо

Спасибо @p0lygon

#Video2sfx #foley #sfx #audioediting #video2audio #text2sfx

🔥14👍1🤔1

1.9K viewsedited 13:38

Для рассуждающего генератора звука ThinkSound опубликован код обучения/файнтюна

Модель облегчили, оптимизировали расход памяти и GPU? упростили установку

Код
Демо

#Video2sfx #foley #sfx #audioediting #video2audio #text2sfx #any2audio

👍5

1.61K views12:16

About

Blog

Apps

Platform