This media is not supported in your browser
VIEW IN TELEGRAM
Streaming Sortformer
Модель от NVIDIA для диаризации в реальном времени, которая позволяет определять, кто говорит в многоголосных аудиозаписях.
Возможности модели:
- диаризация на уровне кадров с тегами (например, spk_0, spk_1);
- точные временные метки для каждого помеченного высказывания;
- отслеживание 2–4+ говорящих с минимальной задержкой;
- оптимизация для английского языка, но успешное тестирование на мандаринском и других языках.
Пример на видео конечно дурацкий, все друг друга ждут чтобы сказать свою реплику, в жизни оно не так работает
HF
#ASR #speech2text #stt
Модель от NVIDIA для диаризации в реальном времени, которая позволяет определять, кто говорит в многоголосных аудиозаписях.
Возможности модели:
- диаризация на уровне кадров с тегами (например, spk_0, spk_1);
- точные временные метки для каждого помеченного высказывания;
- отслеживание 2–4+ говорящих с минимальной задержкой;
- оптимизация для английского языка, но успешное тестирование на мандаринском и других языках.
Пример на видео конечно дурацкий, все друг друга ждут чтобы сказать свою реплику, в жизни оно не так работает
HF
#ASR #speech2text #stt
👍10❤1🍌1