Очки, оснащенные искусственным интеллектом, считывают беззвучную речь

  • Пользователь Алексей Коровин опубликовал
  • 7 апреля 2023 г., 13:55:16 MSK
  • 0 комментариев
  • 119 просмотров
Исследователи разработали интерфейс распознавания беззвучной речи, который использует акустическое зондирование и искусственный интеллект для непрерывного распознавания до 31 невокализованной команды на основе движений губ и рта.

Исследователи из Корнеллского университета разработали интерфейс распознавания беззвучной речи, который использует акустические датчики и искусственный интеллект для непрерывного распознавания до 31 невокализованной команды на основе движений губ и рта.

Маломощному носимому интерфейсу под названием EchoSpeech требуется всего несколько минут для обучения пользователя, прежде чем он распознает команды и может быть запущен на смартфоне.

Руйдонг Чжан, докторант кафедры информатики, является ведущим автором книги "EchoSpeech: непрерывное бесшумное распознавание речи в минимально навязчивых очках на основе акустического зондирования", которая будет представлена на конференции Ассоциации вычислительной техники по человеческому фактору в вычислительных системах (CHI) в этом месяце в Гамбурге, Германия.

"Для людей, которые не могут озвучивать звук, эта технология бесшумной речи могла бы стать отличным входом для синтезатора голоса. Это могло бы вернуть пациентам их голоса", - сказал Чжан о потенциальном использовании технологии при дальнейшем развитии.

В своем нынешнем виде EchoSpeech можно было бы использовать для общения с другими людьми через смартфон в местах, где речь неудобна или неуместна, например, в шумном ресторане или тихой библиотеке. Бесшумный речевой интерфейс также может быть сопряжен со стилусом и использоваться с программным обеспечением для проектирования, таким как CAD, что практически устраняет необходимость в клавиатуре и мыши.

Оснащенные парой микрофонов и динамиков размером меньше ластика для карандашей, очки EchoSpeech превращаются в носимую гидролокаторную систему на базе искусственного интеллекта, посылающую и принимающую звуковые волны по лицу и улавливающую движения рта. Затем алгоритм глубокого обучения анализирует эти эхо-профили в режиме реального времени с точностью около 95%.

"Мы устанавливаем гидролокатор на корпус", - сказал Ченг Чжан, доцент кафедры информатики и директор лаборатории интеллектуальных компьютерных интерфейсов для будущих взаимодействий (SciFi) Корнеллского университета.

"Мы очень взволнованы этой системой, - сказал он, - потому что она действительно продвигает отрасль вперед в плане производительности и конфиденциальности. Он небольшой, маломощный и чувствительный к конфиденциальности, что является важными функциями для внедрения новых носимых технологий в реальном мире ".

По словам Чэн Чжана, большинство технологий распознавания бесшумной речи ограничены выбранным набором предопределенных команд и требуют, чтобы пользователь стоял лицом к камере или носил ее на себе, что непрактично и неосуществимо. По его словам, с носимыми камерами также связаны серьезные проблемы конфиденциальности - как для пользователя, так и для тех, с кем пользователь взаимодействует.

Технология акустического зондирования, такая как EchoSpeech, устраняет необходимость в носимых видеокамерах. А поскольку аудиоданные намного меньше, чем изображения или видеоданные, для их обработки требуется меньшая пропускная способность, и они могут передаваться на смартфон через Bluetooth в режиме реального времени, сказал Франсуа Гимбретьер, профессор информатики.

"А поскольку данные обрабатываются локально на вашем смартфоне, а не загружаются в облако, - сказал он, - конфиденциальная информация никогда не выходит из-под вашего контроля".

Комментарии

0 комментариев