Как сокращение сети может исказить модели глубокого обучения

  • Пользователь Алексей Коровин опубликовал
  • 23 декабря 2022 г., 13:52:45 MSK
  • 0 комментариев
  • 117 просмотров
Исследователи в области компьютерных наук продемонстрировали, что широко используемый метод, называемый обрезкой нейронных сетей, может отрицательно повлиять на производительность моделей глубокого обучения, подробно описали, что вызывает эти проблемы с производительностью, и продемонстрировали метод решения проблемы.

Исследователи в области компьютерных наук продемонстрировали, что широко используемый метод, называемый обрезкой нейронных сетей, может отрицательно повлиять на производительность моделей глубокого обучения, подробно описали, что вызывает эти проблемы с производительностью, и продемонстрировали метод решения проблемы.

Глубокое обучение - это тип искусственного интеллекта, который может быть использован для классификации объектов, таких как изображения, текст или звук. Например, его можно использовать для идентификации людей на основе изображений лиц. Однако для работы моделей глубокого обучения часто требуется много вычислительных ресурсов. Это создает проблемы, когда модель глубокого обучения применяется на практике для некоторых приложений.

Чтобы решить эти проблемы, некоторые системы прибегают к "обрезке нейронных сетей". Это эффективно делает модель глубокого обучения более компактной и, следовательно, способной работать при использовании меньшего количества вычислительных ресурсов.

"Однако наше исследование показывает, что такое сокращение сети может ухудшить способность моделей глубокого обучения идентифицировать некоторые группы", - говорит Чон Ын Ким, соавтор статьи об этой работе и доцент кафедры компьютерных наук в Университете штата Северная Каролина.

"Например, если система безопасности использует глубокое обучение для сканирования лиц людей, чтобы определить, есть ли у них доступ в здание, модель глубокого обучения должна быть компактной, чтобы она могла эффективно работать. Большую часть времени это может работать нормально, но сокращение сети также может повлиять на способность модели глубокого обучения идентифицировать некоторые лица ".

В своей новой статье исследователи объясняют, почему сокращение сети может отрицательно повлиять на производительность модели при выявлении определенных групп, которые в литературе называются "группами меньшинств", и демонстрируют новый метод решения этих проблем.

Два фактора объясняют, как сокращение сети может ухудшить производительность моделей глубокого обучения.

С технической точки зрения, этими двумя факторами являются: несоответствие норм градиента между группами; и несоответствие норм Гессиана, связанное с неточностями данных группы. С практической точки зрения это означает, что модели глубокого обучения могут стать менее точными в распознавании определенных категорий изображений, звуков или текста. В частности, сокращение сети может усилить недостатки точности, которые уже существовали в модели.

Например, если модель глубокого обучения обучена распознавать лица, используя набор данных, включающий лица 100 белых людей и 60 азиатов, она может быть более точной при распознавании белых лиц, но все равно может достичь адекватной производительности при распознавании азиатских лиц. После обрезки сети модель, скорее всего, не сможет распознать некоторые азиатские лица.

"Возможно, этот недостаток не был заметен в оригинальной модели, но поскольку он усиливается при обрезке сети, недостаток может стать заметным", - говорит Ким.

"Чтобы смягчить эту проблему, мы продемонстрировали подход, который использует математические методы для выравнивания групп, которые модель глубокого обучения использует для категоризации выборок данных", - говорит Ким. "Другими словами, мы используем алгоритмы для устранения разрыва в точности между группами".

В ходе тестирования исследователи продемонстрировали, что использование их метода смягчения последствий улучшило справедливость модели глубокого обучения, которая подверглась сетевой обрезке, по существу вернув ее к уровням точности, предшествующим обрезке.

"Я думаю, что наиболее важным аспектом этой работы является то, что теперь у нас есть более глубокое понимание того, как именно сокращение сети может повлиять на производительность моделей глубокого обучения для выявления групп меньшинств, как теоретически, так и эмпирически", - говорит Ким. "Мы также открыты для сотрудничества с партнерами по выявлению неизвестных или недооцененных последствий методов сокращения моделей, особенно в реальных приложениях для моделей глубокого обучения".

Статья "Обрезка оказывает неодинаковое влияние на точность модели" будет представлена на 36-й конференции по системам обработки нейронной информации (NeurIPS 2022), которая пройдет с 28 ноября по 9 декабря в Новом Орлеане. Первым автором статьи является Куонг Тран из Сиракузского университета. Статья была написана в соавторстве с Фердинандо Фиоретто из Сиракуз и Ракшитом Найду из Университета Карнеги-Меллон.

Работа была выполнена при поддержке Национального научного фонда в рамках грантов SaTC-1945541, SaTC-2133169 и CAREER-2143706; а также премии Google Research Scholar Award и Amazon Research Award.

Комментарии

0 комментариев