Когда линии связи открыты, отдельные агенты, такие как роботы или беспилотные летательные аппараты, могут работать вместе, чтобы сотрудничать и выполнять задачу. Но что, если они не оснащены нужным оборудованием или сигналы заблокированы, что делает связь невозможной? Исследователи Иллинойского университета Урбана-Шампейн начали с этой более сложной задачи. Они разработали метод обучения нескольких агентов совместной работе с использованием многоагентного обучения с подкреплением, разновидности искусственного интеллекта.
"Это проще, когда агенты могут разговаривать друг с другом", - сказал Хай Тран, аэрокосмический инженер из Иллинойса. "Но мы хотели сделать это децентрализованным способом, а это означает, что они не разговаривают друг с другом. Мы также сосредоточились на ситуациях, когда не очевидно, какими должны быть различные роли или рабочие места для агентов".
Тран сказал, что этот сценарий намного сложнее и представляет собой более сложную проблему, потому что неясно, что должен делать один агент по сравнению с другим агентом.
"Интересный вопрос заключается в том, как мы учимся выполнять задачу вместе с течением времени", - сказал Тран.
Тран и его коллеги использовали машинное обучение для решения этой проблемы, создав служебную функцию, которая сообщает агенту, когда он делает что-то полезное или приносящее пользу команде.
"С командными голами трудно понять, кто внес свой вклад в победу", - сказал он. "Мы разработали метод машинного обучения, который позволяет нам определять, когда отдельный агент вносит свой вклад в достижение глобальной командной цели. Если посмотреть на это с точки зрения спорта, один футболист может забить, но мы также хотим знать о действиях других товарищей по команде, которые привели к голу, например, о голевых передачах. Трудно понять эти отсроченные эффекты".
Разработанные исследователями алгоритмы также могут определять, когда агент или робот делает что-то, что не способствует достижению цели. "Дело не столько в том, что робот решил сделать что-то неправильно, сколько в том, что не является полезным для конечной цели".
Они протестировали свои алгоритмы, используя имитационные игры, такие как Capture the Flag и StarCraft, популярная компьютерная игра.
Вы можете посмотреть видео, в котором Хай Тран демонстрирует соответствующие исследования с использованием глубокого обучения с подкреплением, чтобы помочь роботам оценить их следующий шаг в Capture the Flag.
"StarCraft может быть немного более непредсказуемым - мы были рады видеть, что наш метод хорошо работает и в этой среде".
Тран сказал, что этот тип алгоритма применим ко многим реальным ситуациям, таким как военное наблюдение, роботы, работающие вместе на складе, управление дорожными сигналами, автономные транспортные средства, координирующие поставки, или управление электросетью.
Тран сказал, что Сын Хен Ким разработал большую часть теории, лежащей в основе идеи, когда он был студентом бакалавриата, изучающим машиностроение, а Нил Ван Стрален, студент аэрокосмического факультета, помогал с реализацией. Тран и Гириш Чоудхари консультировали обоих студентов. Недавно эта работа была представлена сообществу искусственного интеллекта на конференции по рецензированию автономных агентов и мультиагентных систем.
Комментарии