В качестве шага к роботам, которые могут учиться на лету, как это делают люди, новый подход расширяет наборы обучающих данных для роботов, которые работают с мягкими объектами, такими как веревки и ткани, или в загроможденной среде.
Разработанный исследователями робототехники из Мичиганского университета, он может сократить время обучения новым материалам и средам до нескольких часов, а не недели или двух.
В ходе моделирования расширенный набор обучающих данных повысил вероятность успеха робота, обматывающего веревку вокруг блока двигателя, более чем на 40% и почти удвоил успехи физического робота в выполнении аналогичной задачи.
Эта задача относится к числу тех, с которыми робот-механик должен был бы справляться с легкостью. Но при использовании современных методов для изучения того, как управлять каждым незнакомым шлангом или ремнем, потребуется огромное количество данных, которые, вероятно, будут собираться в течение нескольких дней или недель, говорит Дмитрий Беренсон, доцент кафедры робототехники U-M и старший автор статьи, представленной сегодня на Robotics: Science and Systems в Нью-Йорке.
За это время робот поиграл бы со шлангом - растягивал его, соединял концы вместе, огибал препятствия и так далее, - пока не понял бы все способы, которыми шланг может двигаться.
"Если роботу нужно долго возиться со шлангом, прежде чем он сможет его установить, это не сработает для многих приложений", - сказал Беренсон.
Действительно, механики-люди, скорее всего, не были бы впечатлены коллегой-роботом, которому требовалось такое количество времени. Итак, Беренсон и Питер Митрано, докторант в области робототехники, изменили алгоритм оптимизации, чтобы позволить компьютеру делать некоторые обобщения, которые делаем мы, люди, - предсказывать, как динамика, наблюдаемая в одном случае, может повториться в других.
В одном примере робот толкал цилиндры по переполненной поверхности. В некоторых случаях цилиндр ни во что не врезался, в то время как в других он сталкивался с другими цилиндрами, и они двигались в ответ.
Если цилиндр ни во что не врезался, это движение можно повторить в любом месте стола, где траектория не приведет его к другим цилиндрам. Это интуитивно понятно человеку, но роботу необходимо получить эти данные. И вместо того, чтобы проводить трудоемкие эксперименты, программа Митрано и Беренсона может создавать вариации результата этого первого эксперимента, которые служат роботу таким же образом.
Они сосредоточились на трех качествах своих сфабрикованных данных. Она должна была быть актуальной, разнообразной и обоснованной. Например, если вас интересует только робот, перемещающий цилиндры по столу, данные на полу не имеют значения. Обратная сторона этого заключается в том, что данные должны быть разнообразными - должны быть изучены все части таблицы, все ракурсы.
"Если вы максимально увеличите разнообразие данных, они будут недостаточно релевантны. Но если вы максимально повысите релевантность, в нем не будет достаточного разнообразия", - сказал Митрано. "И то, и другое важно".
И, наконец, данные должны быть действительными. Например, любые симуляции, в которых два цилиндра занимают одно и то же пространство, будут недействительными и должны быть идентифицированы как недействительные, чтобы робот знал, что этого не произойдет.
Для моделирования и эксперимента с веревкой Митрано и Беренсон расширили набор данных, экстраполировав положение веревки на другие местоположения в виртуальной версии физического пространства - при условии, что веревка будет вести себя так же, как и в первоначальном случае. Используя только начальные данные обучения, имитированный робот зацепил веревку вокруг блока двигателя в 48% случаев. После обучения на расширенном наборе данных робот преуспел в 70% случаев.
Эксперимент, в котором изучалось обучение на лету с реальным роботом, показал, что, позволяя роботу расширять каждую попытку таким образом, вероятность успеха почти удваивается в течение 30 попыток, при этом 13 успешных попыток вместо семи.
Эта работа была поддержана грантами Национального научного фонда IIS-1750489 и IIS-2113401, грантом Управления военно-морских исследований N00014-21-1-2118 , и научно-исследовательский институт Toyota.
Комментарии