Поиск по сайту Поиск

Топ-5 голосовых приложений, созданных с помощью GPU

Речевой ИИ активно развивается и набирает популярность. Появляется всё больше приложений, распознающих речь и обрабатывающих естественный язык. Мы решили выделить пять наиболее популярных проектов с речевым ИИ, разработанных с помощью графических процессоров NVIDIA.

5. Amazon Alexa: распознавание человеческих эмоций

Разработчики из Amazon Research опубликовали статью, описывающую, как они используют состязательное обучение для улучшения распознавания речевых эмоций.

«Тон человека может многое рассказать о том, как он себя чувствует. Неудивительно, что распознавание эмоций становится все более популярной темой для разговорного ИИ», — сказал Виктор Розгич, старший специалист по прикладным исследованиям в группе Alexa Speech.

Работа проделана в сотрудничестве со Сринивасом Партхасарати, аспирантом факультета электротехники в Техасском университете.

4. Text2Scene: генерация изображений по их описанию

Чтобы улучшить распознавание запросов пользователей, исследователи из IBM и Университета Вирджинии разработали модель глубокого обучения Text2Scene. Она может генерировать изображения из их голосового описания на естественном языке. В отличие от других недавних решений, этот подход не использует GAN. 


Сравнение Text2Scene с другими решениями

«Мы показываем, что с помощью незначительных модификаций модель может генерировать сцены в различных стилях, в том числе карикатуры, синтетические и реалистичные изображения», — заявили исследователи. 

3. DeepZen: создание аудиокниг

Ежегодно в Соединенных Штатах издаётся и публикуется почти миллион книг, но лишь около 40 тысяч из них переводятся в аудиокниги. Это связано в основном с большими затратами и долгим временем их создания.

Чтобы упростить этот процесс, компания DeepZen разработала систему глубокого обучения, которая может генерировать аудиокниги. При этом создаваемые голоса похожи на человеческие и произносят фразы с эмоциональной окраской.

«Традиционная запись аудиокниг занимает слишком много времени и дорого стоит», — говорит Тайлан Камис, соучредитель и генеральный директор DeepZen. «Нужно найти рассказчика, арендовать звукозаписывающую студию и записать множество фраз. Это довольно длительный процесс, который может продолжаться от трех недель до нескольких месяцев. Цена создания одной аудиокниги достигает 5000 долларов. Мы решили упростить задачу: пользователи DeepZen могут выбирать голоса из готовой библиотеки, изменять и настраивать их, а затем генерировать рассказ.»

Вот отрывок повести «Превращение» Франца Кафки, сгенерированный нейросетью:

2. Multi-Task DNN: новые результаты GLUE

Microsoft AI Research недавно объявила о прорыве диалогового ИИ, который достиг новых результатов в задачах обработки естественного языка (Natural Language Processing, NLP) и, в частности, общего понимания языка (General Language Understanding Evaluation, GLUE). 

NLP-алгоритм называется Multi-Task DNN. Впервые его выпустили в январе этого года и обновили в апреле. Модель включает нейросеть BERT NLP от Google.


Оценки GLUE для трёх моделей: BERT, MT-DNN и Distilled MT-DNN.

«Для каждой задачи мы обучаем ансамбль разных методов MT-DNN (учителя), который превосходит любую отдельно взятую модель, а затем с их помощью обучаем одну сеть MT-DNN (учащегося) через многозадачное обучение.» — говорят исследователи. Исходный код MT-DNN доступен на GitHub.

1. VOCA: анимация речи

Исследователи из Института интеллектуальных систем Макса Планка разработали алгоритм глубокого обучения VOCA, который из аудиозаписи голоса и статичной 3D-модели создаёт реалистичную анимацию говорящего. 

«Существует множество книг и работ по оценке формы головы, выражений и движений лицевых мышц по изображениям и видео. Воссозданию анимации лиц по звуку уделяется гораздо меньше внимания», — заявляют исследователи. «Понимание связи между произносимой речью и движениями лица даёт ценную информацию для этой задачи, особенно если визуальные данные зашумлённые, неоднозначные или вовсе отсутствуют».

Интересный факт: для создания всех пяти приложений использовались самые мощные на сегодняшний день GPU NVIDIA Tesla. Если вы тоже планируете масштабный проект с обучением речевого ИИ и вам нужна максимальная производительность — воспользуйтесь нашими облачными серверами с GPU NVIDIA Telsa V100 (от 90 рублей в час).


⌘⌘⌘

Надеемся, что на этом развитие речевого искусственного интеллекта не закончится, и скоро он сможет достигнуть уровня человека в некоторых задачах (а может, и превзойдёт его). Какими приложениями с голосовым ИИ пользуетесь вы? Алиса, Сири или Google Ассистент? Делитесь в комментариях!

С оригинальной статьёй можно ознакомиться в блоге NVIDIA.

Улучшаем графику в старых играх и видео с помощью нейросетей

Улучшаем графику в старых играх и видео с помощью нейросетей

Бывало ли с вами такое: вы решили скачать любимую компьютерную игру детства и ненадолго погрузиться в счастливые воспоминания. Установили её,...
Read More
Как создать сайт-портфолио для творческого проекта

Как создать сайт-портфолио для творческого проекта

Резьба по книгам, money art, тканевые скульптуры — искусство может принимать самые разные формы. А благодаря Интернету современные художники могут...
Read More
Нейросеть описывает мир незрячим людям

Нейросеть описывает мир незрячим людям

Голосовые ассистенты могут не только играть в «города» и рассказывать о погоде — они способны на гораздо большее! Например, помогать...
Read More
Экскурсии в дата-центр: как мы провели 300 человек на закрытый объект и почему нас уже не остановить

Экскурсии в дата-центр: как мы провели 300 человек на закрытый объект и почему нас уже не остановить

Отвлекитесь немного от экрана и посмотрите на вещи, которые вас окружают. Стол, кружка, лампа, смартфон, клавиатура — всё это материальные...
Read More
Стэнфордский курс: лекция 3. Функция потерь и оптимизация

Стэнфордский курс: лекция 3. Функция потерь и оптимизация

На прошлой лекции мы разобрались, как работает классификация изображений. Что же может «потеряться» в процессе и можно ли этого избежать?...
Read More
Как ИИ отслеживает небезопасное поведение водителей

Как ИИ отслеживает небезопасное поведение водителей

Искусственный интеллект может помочь каршеринговым сервисам и таксопаркам сделать поведение водителей на дороге безопаснее. Например, предупреждать их, если они отвлеклись...
Read More
Многозначная классификация с помощью Keras

Многозначная классификация с помощью Keras

Можно ли обучить нейросеть делать не один, а сразу несколько прогнозов? Этот вопрос возникает, когда нам необходимо классифицировать изображения по...
Read More
Большая игра, или Загадочная история домена SEX.COM

Большая игра, или Загадочная история домена SEX.COM

“The Internet is for porn” — так пелось в бродвейском мюзикле Avenue Q (пародия на «Улицу Сезам»). И, несмотря на то,...
Read More
Топ-5 голосовых приложений, созданных с помощью GPU

Топ-5 голосовых приложений, созданных с помощью GPU

Речевой ИИ активно развивается и набирает популярность. Появляется всё больше приложений, распознающих речь и обрабатывающих естественный язык. Мы решили выделить...
Read More
Какие тайны скрывает главный домен для e‑commerce

Какие тайны скрывает главный домен для e‑commerce

Домен .SHOP появился в 2016 году и стал прямым ответом индустрии на важный запрос рынка — необходимость в короткой и...
Read More