Нейронавт | Нейросети в творчестве

Kitten TTS

#sota маленьких голосовых моделей.
Работает без GPU, всего 15М параметров. Оптимизирована для рилтайма

По языкам нет информации. Должна завестись даже на Raspberry Pi

Младшая весит всего 25 мегабайт.
За две недели сделали - огонь!

Код
Веса

#tts #text2speech #realtime

🔥12😱2🤔1

1.68K viewsedited 07:11

MiDashengLM

Модель понимания аудио от Xiaomi, #sota
Распознает тембр голоса, музыкальные инструменты, прочие звуки, отвечает на вопросы

Код
Демо
Веса ~50Гб

#audio2text #alm #assistant

🔥5👍2🤔1👀1

1.67K views08:12

0:50

Разработчики Genie 3 сходили в картину Эдварда Хоппера Полуночники.

Пусть покажут что в кейсе у Джулса

#text2world #research #text2game #news

5🔥11😁4❤3👍1

2.92K views07:11

Voost : A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off

Виртуальная примерочная-раздевалочная, #sota
Результатом раздевания будет не человек без одежды, как вы в силу своей испорченности подумали, а одежда без человека

Код ждем
Демо ждем

#tryon #tryoff

👍7😁5❤1

1.58K views10:13

0:15

0:13

💡LightSwitch💡: Multi-view Relighting with Material-guided Diffusion

Изменение освещения на изображениях (релайтинг) с учётом свойств материалов объектов.
Пишут что побили #SOTA

Обрабатывает любое количество входных изображений, собирая информацию о материалах.
Пока дело доходит до релайтинка данные уже превращаются в сцену на гауссианах. И на выходе тоже гауссианы.
А там видимо рендерите чем хотите.

Авторы тестировали на A100

Код

#relighting

👍6❤1

1.8K views07:11

0:17

1:22

0:19

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

🥁🥁🥁 барабанная дробь

И у нас еще один оживлятор картинок по звуку от Microsoft Research Asia, Hunyuan, Tencent

Много примеров с пением, видимо фокус на эту нишу. Но есть и просто речь.
Обещают неограниченный по длительности оживляж с сохранением идентичности персонажа.
Мне кажется или липсинк не такой уж и синк, не попадает в речь?

Ну и конечно есть видео превосходства над #SOTA моделями-конкурентами

Построен на базе Wan2.1-1.3B
Разрешение: 512x512, 480x832, 832x480

5-секундное видео (480x832, fps=25) генерируется 3 минуты на 4090 и требует 18GB VRAM

Код

#lipsync #portraitanimation #characteranimation #speech2video #avatar

👍6🔥4❤1

11.1K views11:14

Miromind

Полностью опенсорсный фреймворк для deepresearch, по приборам побивающий Opean AI

MiroThinker - набор моделей deepresearch

MiroTrain / MiroRL - микроструктура для обучения MiroThinker

MiroFlow - #sota агент умеющий пользоваться инструментами.

Я дал ему задание найти средний рост мужчин за последние 1000 лет. Выдал подробный результат за 1 минуту, см картинку

Попробовать

#deepresearch #assistant

👍9

1.5K views08:21

0:09

NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

Новая модель от Степана (Stepfun). Генератор-редактор картинок на авторегрессии (картинка создается последовательно, пиксель за пикселем, а не итеративно как в диффузии)

#sota авторегресии на генерации изображений. 14B параметров, 60Гб весов. Результаты трудно разглядеть. Предположительно, качество на уровне SD1.5. Астрологи объявили эру неподъемных моделей с незаметным качеством, но послушных (но это неточно)

Офсайт не прогружается
Гитхаб
HF

#text2image #imageediting

❤5👀3👎2🤔1😱1

1.66K views14:17

0:18

Distilled-3DGS: Distilled 3D Gaussian Splatting

Сокращает примерно в десять раз количество гауссиан необходимых для высококачественного рендеринга сцен, без потери качества изображения.

Обеспечивает качество рендеринга, сравнимое с лучшими существующими методами (#SOTA) или даже превосходящее их

Код ждем

#gaussian #rendering #novelview

1👍12🔥4

1.65K views11:14

1:32

Media is too big

Tripо 3.0

Обновка 3D генератора.
Под капотом TripoSF - не знаю та ли версия что была выложена в марте.

Картинки генерятся силами Flux Kontext и GPT-4o

#SOTA PBR текстуры

Обещают сделать 3D видеогенератор

Попробовать

#3d #textto3d #imageto3d #pbr

❤3👍2🔥2

1.86K views16:11

0:15

0:18

Nano-banana только что релизнули в Gemini 2.5 Flash

Доступно для граждан правильной страны в gemini app и Google AI Studio

Бежим творить у кого есть доступ. Притворитесь что вы в США и ломитесь в студию

Спасибо @iNevestenko

#imageediting #sota

🔥12❤1👍1

1.77K views14:47