Прежде чем модель машинного обучения сможет выполнить задачу, такую как идентификация рака на медицинских изображениях, модель должна быть обучена. Обучение моделей классификации изображений обычно включает в себя показ модели миллионов примеров изображений, собранных в массивный набор данных.
Однако использование реальных данных изображений может вызвать практические и этические проблемы: изображения могут противоречить законам об авторском праве, нарушать частную жизнь людей или быть предвзятыми по отношению к определенной расовой или этнической группе. Чтобы избежать этих ловушек, исследователи могут использовать программы генерации изображений для создания синтетических данных для обучения модели. Но эти методы ограничены, поскольку часто требуются экспертные знания для ручной разработки программы генерации изображений, которая может создавать эффективные обучающие данные.
Исследователи из Массачусетского технологического института, лаборатории искусственного интеллекта MIT-IBM Watson и других организаций использовали другой подход. Вместо разработки индивидуальных программ генерации изображений для конкретной учебной задачи они собрали набор данных из 21 000 общедоступных программ из Интернета. Затем они использовали эту большую коллекцию базовых программ генерации изображений для обучения модели компьютерного зрения.
Эти программы создают разнообразные изображения, отображающие простые цвета и текстуры. Исследователи не курировали и не изменяли программы, каждая из которых состояла всего из нескольких строк кода.
Модели, которые они обучили с помощью этого большого набора данных программ, классифицировали изображения более точно, чем другие синтетически обученные модели. И, хотя их модели уступали моделям, обученным на реальных данных, исследователи показали, что увеличение количества графических программ в наборе данных также повысило производительность модели, открыв путь к достижению более высокой точности.
"Оказывается, что использование большого количества незаконченных программ на самом деле лучше, чем использование небольшого набора программ, которыми людям нужно манипулировать. Данные важны, но мы показали, что вы можете довольно далеко продвинуться без реальных данных", - говорит Манель Барадад, аспирант кафедры электротехники и компьютерных наук (EECS), работающий в Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) и ведущий автор статьи, описывающей этот метод.
В число соавторов входят Тунчжоу Ван, аспирант EECS в CSAIL; Рожерио Ферис, главный научный сотрудник и менеджер лаборатории искусственного интеллекта MIT-IBM Watson; Антонио Торральба, профессор электротехники и компьютерных наук Delta Electronics и член CSAIL; и старший автор Филипп Изола, доцент EECS. и CSAIL; наряду с другими сотрудниками JPMorgan Chase Bank и Xyla, Inc. Исследование будет представлено на конференции по нейронным системам обработки информации.
Переосмысление предварительной подготовки
Модели машинного обучения обычно проходят предварительную подготовку, что означает, что сначала они обучаются на одном наборе данных, чтобы помочь им создать параметры, которые можно использовать для решения другой задачи. Модель для классификации рентгеновских лучей может быть предварительно обучена с использованием огромного набора данных синтетически сгенерированных изображений, прежде чем она будет обучена для выполнения своей реальной задачи с использованием гораздо меньшего набора данных реальных рентгеновских лучей.
Эти исследователи ранее показали, что они могут использовать несколько программ генерации изображений для создания синтетических данных для предварительной подготовки модели, но программы должны быть тщательно разработаны, чтобы синтетические изображения соответствовали определенным свойствам реальных изображений. Это затрудняло масштабирование метода.
В новой работе вместо этого они использовали огромный набор данных программ генерации изображений без обработки.
Они начали с того, что собрали коллекцию из 21 000 программ для создания изображений из Интернета. Все программы написаны на простом языке программирования и содержат всего несколько фрагментов кода, поэтому они быстро генерируют изображения.
"Эти программы были разработаны разработчиками по всему миру для создания изображений, обладающих некоторыми интересующими нас свойствами. Они создают изображения, которые выглядят как абстрактное искусство", - объясняет Барадад.
Эти простые программы могут выполняться так быстро, что исследователям не нужно было заранее создавать изображения для обучения модели. Исследователи обнаружили, что они могут генерировать изображения и обучать модель одновременно, что упрощает процесс.
Они использовали свой огромный набор данных программ генерации изображений для предварительной подготовки моделей компьютерного зрения как для контролируемых, так и для неконтролируемых задач классификации изображений. При контролируемом обучении данные изображения помечаются, в то время как при неконтролируемом обучении модель учится классифицировать изображения без меток.
Повышение точности
Когда они сравнили свои предварительно обученные модели с современными моделями компьютерного зрения, которые были предварительно обучены с использованием синтетических данных, их модели были более точными, что означает, что они чаще помещали изображения в правильные категории. Хотя уровни точности все еще были ниже, чем у моделей, обученных на реальных данных, их методика сократила разрыв в производительности между моделями, обученными на реальных данных, и моделями, обученными на синтетических данных, на 38 процентов.
"Важно отметить, что мы показываем, что для количества программ, которые вы собираете, производительность масштабируется логарифмически. Мы не перенасыщаем производительность, поэтому, если мы соберем больше программ, модель будет работать еще лучше. Итак, есть способ расширить наш подход", - говорит Манель.
Исследователи также использовали каждую отдельную программу генерации изображений для предварительной подготовки, стремясь выявить факторы, способствующие точности модели. Они обнаружили, что когда программа генерирует более разнообразный набор изображений, модель работает лучше. Они также обнаружили, что красочные изображения со сценами, которые заполняют весь холст, как правило, больше всего улучшают производительность модели.
Теперь, когда они продемонстрировали успех этого подхода к предварительной подготовке, исследователи хотят распространить свою технику на другие типы данных, такие как мультимодальные данные, которые включают текст и изображения. Они также хотят продолжить изучение способов повышения эффективности классификации изображений.
"Все еще существует пробел, который необходимо устранить с помощью моделей, обученных на реальных данных. Это дает нашим исследованиям направление, которому, как мы надеемся, последуют другие", - говорит он.
Комментарии