Дальновидный подход к машинному обучению

  • Пользователь Алексей Коровин опубликовал
  • 23 декабря 2022 г., 13:46:49 MSK
  • 0 комментариев
  • 157 просмотров
Новая методика позволяет агентам искусственного интеллекта заглядывать гораздо дальше в будущее, рассматривая, как их поведение может повлиять на поведение других агентов искусственного интеллекта в направлении выполнения задачи. Такой подход улучшает долгосрочную производительность сотрудничающих или конкурирующих агентов искусственного интеллекта.

Представьте себе две команды, сражающиеся на футбольном поле. Игроки могут сотрудничать для достижения цели и конкурировать с другими игроками с противоречивыми интересами. Вот как работает игра.

Создание агентов искусственного интеллекта, которые могут научиться конкурировать и сотрудничать так же эффективно, как люди, остается сложной проблемой. Ключевая задача заключается в том, чтобы позволить агентам искусственного интеллекта предвидеть будущее поведение других агентов, когда все они обучаются одновременно.

Из-за сложности этой проблемы современные подходы, как правило, близоруки; агенты могут только угадывать следующие несколько ходов своих товарищей по команде или конкурентов, что приводит к низкой производительности в долгосрочной перспективе.

Исследователи из Массачусетского технологического института, лаборатории искусственного интеллекта MIT-IBM Watson и других организаций разработали новый подход, который дает агентам искусственного интеллекта дальновидную перспективу. Их система машинного обучения позволяет агентам искусственного интеллекта, сотрудничающим или конкурирующим, учитывать, что будут делать другие агенты по мере приближения времени к бесконечности, а не только в течение нескольких следующих шагов. Затем агенты соответствующим образом адаптируют свое поведение, чтобы повлиять на будущее поведение других агентов и прийти к оптимальному долгосрочному решению.

Эта структура может быть использована группой автономных дронов, работающих вместе, чтобы найти заблудившегося туриста в густом лесу, или самоуправляемыми автомобилями, которые стремятся обеспечить безопасность пассажиров, предвидя будущие движения других транспортных средств, движущихся по оживленному шоссе.

"Когда агенты искусственного интеллекта сотрудничают или конкурируют, самое важное - это когда их поведение сходится в какой-то момент в будущем. На этом пути встречается множество преходящих форм поведения, которые в долгосрочной перспективе не имеют большого значения. Достижение такого конвергентного поведения - это то, о чем мы действительно заботимся, и теперь у нас есть математический способ обеспечить это", - говорит Донг-Ки Ким, аспирант Лаборатории информационных систем и систем принятия решений Массачусетского технологического института (LIDS) и ведущий автор статьи, описывающей эту структуру.


Старший автор - Джонатан П. Хоу, профессор аэронавтики и астронавтики имени Ричарда К. Маклорена и сотрудник лаборатории искусственного интеллекта MIT-IBM Watson. В число соавторов входят другие сотрудники MIT-IBM Watson AI Lab, IBM Research, Mila-Quebec Artificial Intelligence Institute и Оксфордского университета. Исследование будет представлено на конференции по нейронным системам обработки информации.

Больше агентов, больше проблем

Исследователи сосредоточились на проблеме, известной как обучение с многоагентным подкреплением. Обучение с подкреплением - это форма машинного обучения, при которой агент искусственного интеллекта учится методом проб и ошибок. Исследователи дают агенту вознаграждение за "хорошее" поведение, которое помогает ему достичь цели. Агент адаптирует свое поведение, чтобы максимизировать это вознаграждение, пока в конечном итоге не станет экспертом в выполнении задачи.

Но когда многие сотрудничающие или конкурирующие агенты одновременно обучаются, все становится все более сложным. По мере того как агенты обдумывают все больше будущих шагов своих коллег-агентов и то, как их собственное поведение влияет на других, проблема вскоре требует слишком больших вычислительных мощностей для эффективного решения. Вот почему другие подходы ориентированы только на краткосрочную перспективу.

"ИИ действительно хотят подумать о конце игры, но они не знают, когда игра закончится. Им нужно подумать о том, как продолжать адаптировать свое поведение до бесконечности, чтобы они могли победить в какой-то отдаленный момент в будущем. Наша статья, по сути, предлагает новую цель, которая позволяет ИИ думать о бесконечности", - говорит Ким.

Но поскольку невозможно включить бесконечность в алгоритм, исследователи разработали свою систему таким образом, чтобы агенты фокусировались на будущей точке, где их поведение будет сходиться с поведением других агентов, известной как равновесие. Точка равновесия определяет долгосрочную эффективность агентов, и в многоагентном сценарии может существовать множество равновесий. Следовательно, эффективный агент активно влияет на будущее поведение других агентов таким образом, что они достигают желаемого равновесия с точки зрения агента. Если все агенты влияют друг на друга, они сходятся к общей концепции, которую исследователи называют "активным равновесием".

Разработанная ими система машинного обучения, известная как FURTHER (что означает полное усиление активного влияния со средним вознаграждением), позволяет агентам научиться адаптировать свое поведение при взаимодействии с другими агентами для достижения этого активного равновесия.

ДАЛЕЕ это делается с использованием двух модулей машинного обучения. Первый, модуль вывода, позволяет агенту угадывать будущее поведение других агентов и алгоритмы обучения, которые они используют, основываясь исключительно на их предыдущих действиях.

Эта информация поступает в модуль обучения с подкреплением, который агент использует для адаптации своего поведения и влияния на других агентов таким образом, чтобы максимизировать свое вознаграждение.

"Задача заключалась в том, чтобы думать о бесконечности. Нам пришлось использовать множество различных математических инструментов, чтобы сделать это возможным, и сделать некоторые предположения, чтобы заставить это работать на практике", - говорит Ким.

Победа в долгосрочной перспективе

Они протестировали свой подход на других многоагентных системах обучения с подкреплением в нескольких различных сценариях, включая пару роботов, сражающихся в стиле сумо, и битву, в которой две команды из 25 агентов противостояли друг другу. В обоих случаях агенты искусственного интеллекта, использующие FURTHER, чаще выигрывали игры.

Поскольку их подход децентрализован, что означает, что агенты учатся выигрывать игры независимо, он также более масштабируем, чем другие методы, которые требуют центрального компьютера для управления агентами, объясняет Ким.

Исследователи использовали игры для проверки своего подхода, но в дальнейшем их можно было использовать для решения любых многоагентных задач. Например, он может быть применен экономистами, стремящимися разработать разумную политику в ситуациях, когда многие взаимодействующие субъекты имеют поведение и интересы, которые меняются с течением времени.

Экономика - это одно из приложений, изучение которого Ким особенно увлекается. Он также хочет глубже разобраться в концепции активного равновесия и продолжить совершенствовать ДАЛЬНЕЙШУЮ структуру.

Это исследование частично финансируется лабораторией искусственного интеллекта MIT-IBM Watson.

Комментарии

0 комментариев