Глубокие сверточные нейронные сети (DCNN) не видят объекты так, как это делают люди, используя восприятие конфигурационной формы, и это может быть опасно в реальных приложениях искусственного интеллекта, говорит профессор Джеймс Элдер, соавтор опубликованного сегодня исследования Йоркского университета.
Опубликовано в журнале Cell Press journal Это наука, Модели глубокого обучения не отражают конфигурационную природу восприятия человеческой формы, - это совместное исследование Элдера, который возглавляет исследовательскую кафедру Йоркского университета человеческого и компьютерного зрения и является содиректором Йоркского центра искусственного интеллекта и общества, и ассистента профессора психологии Николаса Бейкера в колледже Лойола в Чикаго, бывшего Аспирант VISTA в Йорке.
В исследовании использовались новые визуальные стимулы, называемые "Франкенштейнами", чтобы исследовать, как человеческий мозг и DCNNs обрабатывают целостные, конфигурационные свойства объектов.
"Франкенштейны - это просто предметы, которые были разобраны на части и собраны обратно неправильным способом", - говорит Элдер. "В результате у них есть все правильные местные особенности, но в неправильных местах".
Исследователи обнаружили, что в то время как зрительная система человека сбита с толку Франкенштейнами, DCNN - нет, что свидетельствует о нечувствительности к конфигурационным свойствам объекта.
"Наши результаты объясняют, почему модели глубокого искусственного интеллекта терпят неудачу при определенных условиях, и указывают на необходимость рассмотрения задач, выходящих за рамки распознавания объектов, чтобы понять визуальную обработку в мозге", - говорит Элдер. "Эти глубокие модели, как правило, используют "короткие пути" при решении сложных задач распознавания. Хотя эти ярлыки могут работать во многих случаях, они могут быть опасны в некоторых реальных приложениях искусственного интеллекта, над которыми мы в настоящее время работаем с нашими промышленными и правительственными партнерами", - отмечает Элдер.
Одним из таких приложений являются системы безопасности дорожного движения: "Объекты в оживленном дорожном движении - транспортные средства, велосипеды и пешеходы - мешают друг другу и попадают в поле зрения водителя в виде нагромождения разрозненных фрагментов", - объясняет Элдер. "Мозгу необходимо правильно сгруппировать эти фрагменты, чтобы определить правильные категории и местоположения объектов. Система искусственного интеллекта для мониторинга безопасности дорожного движения, которая способна воспринимать только отдельные фрагменты, не справится с этой задачей, потенциально создавая риски неправильного понимания для уязвимых участников дорожного движения ".
По словам исследователей, изменения в обучении и архитектуре, направленные на то, чтобы сделать сети более похожими на мозг, не привели к конфигурационной обработке, и ни одна из сетей не смогла точно предсказать суждения человека об объекте, полученные методом проб. "Мы предполагаем, что для соответствия чувствительности к конфигурации человека сети должны быть обучены решать более широкий спектр задач, выходящих за рамки распознавания категорий", - отмечает Элдер.
Комментарии