Алекса и Сири, слушайте внимательно! Обучая машины по-настоящему слышать нас

  • Пользователь Алексей Коровин опубликовал
  • 23 декабря 2022 г., 13:59:56 MSK
  • 0 комментариев
  • 101 просмотр
Последствия новых исследований в области искусственного интеллекта выходят за рамки пользовательского опыта и направлены на повышение эффективности искусственного интеллекта, что может изменить отрасль и значительно сократить выбросы углекислого газа.

Ученый-когнитивист из Университета Вирджинии Пер Седерберг провел забавный эксперимент, который вы можете попробовать дома. Достаньте свой смартфон и, используя голосовой помощник, например, для поисковой системы Google, произнесите слово "осьминог" как можно медленнее.

Вашему устройству будет трудно повторить то, что вы только что сказали. Это может дать бессмысленный ответ, или это может дать вам что-то близкое, но все же не совсем подходящее - например, "гной на пальце ноги". Отвратительно!

Дело в том, сказал Седерберг, что когда дело доходит до приема слуховых сигналов, как это делают люди и другие животные, - несмотря на все вычислительные мощности, выделенные для этой задачи такими тяжеловесами, как Google, Deep Mind, IBM и Microsoft, - современный искусственный интеллект остается немного слабослышащим.

Результаты могут варьироваться от комичных и слегка разочаровывающих до откровенно отчуждающих для тех, у кого есть проблемы с речью.

Но используя недавние достижения в области нейробиологии в качестве модели, совместные исследования UVA позволили преобразовать существующие нейронные сети искусственного интеллекта в технологию, которая действительно может слышать нас, независимо от того, в каком темпе мы говорим.

Инструмент глубокого обучения называется SITHCon, и, обобщая входные данные, он может понимать слова, произносимые с разной скоростью, чем при обучении сети.

Эта новая способность не просто изменит опыт конечного пользователя; у нее есть потенциал изменить то, как искусственные нейронные сети "думают", позволяя им обрабатывать информацию более эффективно. И это может изменить все в отрасли, постоянно стремящейся увеличить возможности обработки, свести к минимуму хранение данных и уменьшить огромный углеродный след искусственного интеллекта.

Седерберг, адъюнкт-профессор психологии, который является директором программы когнитивных наук в UVA, совместно с аспирантом Брэндоном Жаком разработал рабочую демонстрацию технологии совместно с исследователями из Бостонского университета и Университета Индианы.

"Мы продемонстрировали, что можем декодировать речь, в частности масштабированную речь, лучше, чем любая известная нам модель", - сказал Жак, который является первым автором статьи.

Седерберг добавил: "Мы в некотором роде рассматриваем себя как разношерстную группу неудачников. Мы решили эту проблему, которую не смогли решить большие команды в Google, Deep Mind и Apple ".

Прорывное исследование было представлено во вторник на громкой международной конференции по машинному обучению, или ICML, в Балтиморе.

Текущее обучение ИИ: Слуховая перегрузка

На протяжении десятилетий, но особенно за последние 20 лет, компании встраивали сложные искусственные нейронные сети в машины, чтобы попытаться имитировать то, как человеческий мозг распознает меняющийся мир. Эти программы не только облегчают поиск базовой информации и потребительский подход; они также специализируются на прогнозировании фондового рынка, диагностике заболеваний и мониторинге угроз национальной безопасности, среди многих других приложений.

"По сути, мы пытаемся обнаружить значимые закономерности в окружающем нас мире", - сказал Седерберг. "Эти шаблоны помогут нам принимать решения о том, как вести себя и как приспособиться к нашему окружению, чтобы мы могли получить как можно больше вознаграждений".

Программисты использовали мозг в качестве первоначального источника вдохновения для технологии, отсюда и название "нейронные сети".

"Ранние исследователи искусственного интеллекта взяли основные свойства нейронов и то, как они связаны друг с другом, и воссоздали их с помощью компьютерного кода", - сказал Седерберг.

Однако для решения сложных задач, таких как обучение машин "слышать" язык, программисты невольно пошли по другому пути, чем то, как на самом деле работает мозг, сказал он. Они не смогли развернуться на основе достижений в понимании нейробиологии.

"Способ, которым эти крупные компании решают проблему, заключается в том, чтобы направить на нее вычислительные ресурсы", - объяснил профессор. "Таким образом, они делают нейронные сети больше. Область, которая изначально была вдохновлена мозгом, превратилась в инженерную проблему ".

По сути, программисты вводят множество разных голосов, используя разные слова с разной скоростью, и обучают большие сети с помощью процесса, называемого обратным распространением. Программисты знают, каких ответов они хотят добиться, поэтому они продолжают передавать непрерывно уточняемую информацию обратно в цикле. Затем искусственный интеллект начинает придавать соответствующий вес аспектам входных данных, которые приведут к точным ответам. Звуки становятся пригодными для использования символами текста.

"Вы делаете это много миллионов раз", - сказал Седерберг.

Хотя наборы обучающих данных, которые служат входными данными, улучшились, как и скорость вычислений, процесс все еще далек от идеала, поскольку программисты добавляют больше слоев для выявления больших нюансов и сложности - так называемого "глубокого" или "сверточного" обучения.

Сегодня в мире говорят на более чем 7000 языках. Вариации возникают из-за акцентов и диалектов, более глубоких или высоких голосов и, конечно, более быстрой или медленной речи. Поскольку конкуренты создают более качественные продукты, на каждом этапе компьютер должен обрабатывать информацию.

Это имеет реальные последствия для окружающей среды. В 2019 году исследование показало, что выбросы углекислого газа от энергии, необходимой для обучения одной большой модели глубокого обучения, приравниваются к продолжительности жизни пяти автомобилей.

Три года спустя наборы данных и нейронные сети продолжали только расти.

Как мозг на самом деле слышит речь

Покойный Говард Эйхенбаум из Бостонского университета ввел термин "временные ячейки" - феномен, на котором построено это новое исследование искусственного интеллекта. Нейробиологи, изучавшие временные ячейки у мышей, а затем и у людей, продемонстрировали, что наблюдаются всплески нервной активности, когда мозг интерпретирует сигналы, основанные на времени, такие как звук. Находясь в гиппокампе и других частях мозга, эти отдельные нейроны фиксируют определенные интервалы - точки данных, которые мозг рассматривает и интерпретирует во взаимосвязи. Клетки находятся рядом с так называемыми "ячейками места", которые помогают нам формировать ментальные карты.

Временные ячейки помогают мозгу создавать единое понимание звука, независимо от того, насколько быстро или медленно поступает информация.

"Если я скажу "ооооооок-тууууу-пуссссссс", вы, вероятно, никогда раньше не слышали, чтобы кто-то произносил "осьминог" с такой скоростью, и все же вы можете это понять, потому что способ, которым ваш мозг обрабатывает эту информацию, называется "масштабно-инвариантным", - сказал Седерберг. "По сути, это означает, что если вы слышали это и научились декодировать эту информацию в одном масштабе, если эта информация теперь поступает немного быстрее или немного медленнее, или даже намного медленнее, вы все равно ее получите".

Главным исключением из правила, по его словам, является информация, которая поступает сверхбыстро. Эти данные не всегда будут переводиться. "Вы теряете крупицы информации", - сказал он.

Лаборатория когнитивного исследователя Марка Ховарда из Бостонского университета продолжает развивать открытие временной ячейки. Сотрудничая с Седербергом более 20 лет, Говард изучает, как люди понимают события своей жизни. Затем он преобразует это понимание в математику.

Уравнение Говарда, описывающее слуховую память, включает временную шкалу. Временная шкала строится с использованием ячеек времени, запускаемых последовательно. Критически важно, что уравнение предсказывает, что временная шкала размывается - и определенным образом - по мере того, как звук перемещается в прошлое. Это потому, что память мозга о событии со временем становится менее точной.

"Таким образом, существует определенная схема срабатывания, которая кодирует то, что произошло в течение определенного времени в прошлом, и информация становится все более размытой, чем дальше в прошлое она уходит", - сказал Седерберг. "Самое классное, что Марк и постдок, проходя через лабораторию Марка, математически вычислили, как это должно выглядеть. Затем нейробиологи начали находить доказательства этого в мозге".

Время придает звукам контекст, и это часть того, что придает тому, что нам говорят, смысл. Говард сказал, что математика аккуратно сводится к следующему.

"Временные ячейки в мозге, похоже, подчиняются этому уравнению", - сказал Говард.

UVA кодирует голосовой декодер

Около пяти лет назад Седерберг и Говард определили, что область искусственного интеллекта может извлечь выгоду из таких представлений, вдохновленных мозгом. Работая с лабораторией Говарда и консультируясь с Зораном Тиганджем и коллегами из Университета Индианы, Лаборатория вычислительной памяти Седерберга приступила к созданию и тестированию моделей.

Около трех лет назад Жак совершил большой прорыв, который помог ему выполнить кодирование для результирующего доказательства концепции. Алгоритм имеет форму сжатия, которую можно распаковывать по мере необходимости - во многом так же, как zip-файл на компьютере работает для сжатия и хранения файлов большого размера. Устройство сохраняет "память" звука только с разрешением, которое пригодится позже, экономя место для хранения.

"Поскольку информация логарифмически сжата, она не полностью меняет шаблон при масштабировании входных данных, она просто смещается", - сказал Седерберг.

Обучение ИИ для SITHCon сравнивалось с ранее существовавшим ресурсом, доступным бесплатно для исследователей, под названием "временная сверточная сеть". Цель состояла в том, чтобы преобразовать сеть из той, которая обучена слышать только на определенных скоростях.

Процесс начался с базового языка - азбуки Морзе, которая использует длинные и короткие звуковые сигналы для представления точек и тире, - и перешел к набору носителей английского языка с открытым исходным кодом, произносящих цифры от 1 до 9 для ввода.

В конце концов, никакого дальнейшего обучения не потребовалось. Как только искусственный интеллект распознал сообщение на одной скорости, его нельзя было обмануть, если говорящий растягивал слова.

"Мы показали, что SITHCon может обобщать речь, увеличенную или уменьшенную по скорости, в то время как другие модели не смогли декодировать информацию со скоростью, которую они не видели на тренировках", - сказал Жак.

Теперь UVA решила сделать свой код доступным бесплатно, чтобы расширить знания. Команда говорит, что информация должна адаптироваться к любой нейронной сети, которая переводит голос.

"Мы собираемся опубликовать и выпустить весь код, потому что мы верим в открытую науку", - сказал Седерберг. "Мы надеемся, что компании увидят это, будут по-настоящему взволнованы и скажут, что хотели бы финансировать нашу дальнейшую работу. Мы постигли фундаментальный способ обработки информации мозгом, сочетающий в себе мощь и эффективность, и мы только прикоснулись к тому, на что способны эти модели искусственного интеллекта ".

Но зная, что они создали лучшую мышеловку, беспокоятся ли исследователи вообще о том, как может быть использована новая технология?

Седерберг сказал, что он оптимистично настроен в отношении того, что к ИИ, который лучше слышит, будут подходить с этической точки зрения, поскольку все технологии должны быть в теории.

"Прямо сейчас эти компании сталкиваются с узкими местами в вычислениях, пытаясь создать более мощные и полезные инструменты", - сказал он. "Вы должны надеяться, что положительные стороны перевесят отрицательные. Если вы сможете перенести больше своих мыслительных процессов на компьютеры, это сделает наш мир более продуктивным, к лучшему это или к худшему".

Жак, новоиспеченный отец, сказал: "Приятно думать, что наша работа, возможно, дает начало новому направлению в области искусственного интеллекта".

Комментарии

0 комментариев