Исследователи разрабатывают новую модель, основанную на голосовании, для более точной оценки позы ручного объекта

  • Пользователь Алексей Коровин опубликовал
  • 30 мая 2025 г., 17:10:10 MSK
  • 0 комментариев
  • 72 просмотра
Оценка положения предметов, которые можно держать в руках, является важнейшей и сложной задачей в робототехнике и компьютерном зрении. Несмотря на то, что использование мультимодальных данных RGB и глубины является многообещающим решением, существующие подходы по-прежнему сталкиваются с проблемами из-за вызванных рукой окклюзий и слияния мультимодальных данных. В новом исследовании исследователи разработали новую платформу глубокого обучения, которая решает эти проблемы, внедряя новый модуль слияния на основе голосования и модуль оценки позы с учетом рук.

Многие роботизированные приложения полагаются на роботизированные руки для обработки различных типов объектов. Оценка положения таких ручных объектов является важной, но сложной задачей в робототехнике, компьютерном зрении и даже в приложениях дополненной реальности (AR). Многообещающим направлением является использование мультимодальных данных, таких как цветные (RGB) и глубинные (D) изображения. С ростом доступности 3D-датчиков появилось множество подходов к машинному обучению, позволяющих использовать этот метод.

Однако существующие подходы по-прежнему сталкиваются с двумя основными проблемами. Во-первых, они сталкиваются с падением точности, когда руки закрывают удерживаемые предметы, скрывая критические характеристики, необходимые для оценки позы. Кроме того, взаимодействия "рука-объект" приводят к нежестким преобразованиям, которые еще больше усложняют проблему. Это происходит, когда руки изменяют форму или структуру удерживаемого объекта, например, при сжатии мягкого шарика, искажая воспринимаемую форму объекта. Во-вторых, большинство современных методов извлекают объекты из отдельных баз данных RGB и RGB-D, которые затем объединяются на уровне объектов. Поскольку эти две магистрали обрабатывают изначально разные модальности, такое слияние может привести к сдвигам в распределении репрезентации, что означает, что функции, извлеченные из изображений RGB, могут не совпадать с функциями, извлеченными из входных данных RGB-D, что влияет на оценку позы. Кроме того, во время тонкой настройки плотное взаимодействие между двумя магистралями приводит к сбоям в производительности и ограничивает преимущества включения функций RGB.

Чтобы решить эти проблемы, исследовательская группа, возглавляемая доцентом Фан Суан Таном из Инновационной глобальной программы Инженерного колледжа Технологического института Сибаура, Япония, вместе с доктором Динь-Куонг Хоангом и другими исследователями из Университета FPT, Вьетнам, разработала инновационную глубокую нейронную сеть, специально предназначенную для оценки позы использование RGB-D изображений. "Ключевое новшество нашей платформы глубокого обучения заключается в механизме слияния на основе голосования, который эффективно интегрирует как 2D (RGB), так и 3D (глубина) ключевые точки, устраняя при этом вызванные рукой окклюзии и трудности объединения мультимодальных данных. Кроме того, это отделяет процесс обучения и включает в себя модель взаимодействия руки и объекта, основанную на само-внимании, что приводит к существенным улучшениям", - объясняет доктор Тан. Их исследование было доступно онлайн 17 февраля 2025 года и будет опубликовано в 120-м томе Александрийского инженерного журнала в мае 2025 года.

Предлагаемая платформа глубокого обучения включает в себя четыре компонента: базовые компоненты для извлечения многомерных объектов из 2D-изображений и 3D-данных облака точек, модули голосования, новый модуль слияния на основе голосования и модуль оценки положения объекта с учетом руки. Первоначально 2D- и 3D-основы предсказывают 2D- и 3D-ключевые точки обеих рук и объектов по изображениям RGB-D. Ключевые точки относятся к значимым местоположениям на входных изображениях, которые помогают описать положение рук и предметов. Затем модули голосования внутри каждой магистрали независимо отдают голоса за свои соответствующие ключевые точки.

Затем эти голоса интегрируются с помощью модели слияния на основе голосования, которая динамически объединяет 2D и 3D голоса, используя проекцию окрестностей на основе радиуса и механизмы внимания канала. Первый сохраняет локальную информацию, в то время как второй адаптируется к изменяющимся условиям ввода, обеспечивая надежность и точность. Это слияние, основанное на голосовании, эффективно использует преимущества RGB и информации о глубине, смягчая влияние окклюзии и смещения, вызванных рукой, и, следовательно, позволяя точно оценить положение руки и объекта.

Последний компонент, модуль оценки позы объекта с учетом руки, дополнительно повышает точность за счет использования механизма саморегуляции для фиксации сложных взаимосвязей между ключевыми точками руки и объекта. Это позволяет системе учитывать нежесткие изменения, вызванные различными позами рук и захватами.

Чтобы протестировать свою структуру, исследователи провели эксперименты на трех общедоступных наборах данных. Результаты показали значительное повышение точности (до 15%) и надежности по сравнению с современными подходами. Кроме того, эксперименты на месте продемонстрировали среднюю точность в 76,8% при повышении производительности до 13,9% по сравнению с существующими методами. Фреймворк также обеспечивает время вывода до 40 миллисекунд без уточнения и 200 миллисекунд с уточнением, демонстрируя применимость в реальном мире.

"Наше исследование напрямую касается давнего узкого места в робототехнике и компьютерном зрении - точной оценки положения объекта в закрытых, динамичных и сложных сценариях взаимодействия руки и объекта", - отмечает доктор Тан. "Наш подход не только более точный, но и более простой, чем многие существующие методы. Это потенциально может ускорить внедрение систем на базе искусственного интеллекта, таких как эффективные автоматизированные роботизированные сборочные линии, робототехника с поддержкой человека и иммерсивные технологии AR /VR".

В целом, этот инновационный подход представляет собой значительный шаг вперед в робототехнике, позволяя роботам более эффективно обрабатывать сложные объекты и продвигая технологии дополненной реальности для моделирования более реалистичных взаимодействий рук и объектов.

Комментарии

0 комментариев