Глобальное сообщество исследователей в области биозащиты прилагает огромные усилия для получения знаний, касающихся COVID-19 и SARS-CoV-2. На практике эти усилия означают огромное, очень быстрое производство научных публикаций, что затрудняет просмотр и анализ всей информации. Вот почему эксперты и органы, принимающие решения, должны быть обеспечены информационными системами, позволяющими им приобретать необходимые знания.
Это именно то, что было исследовано в проекте исследователей VIGICOVID, проводимом Центром HiTZ UPV / EHU, группой NLP & IR UNED и подразделением искусственного интеллекта и языковых технологий Elhuyar, благодаря финансированию Fondo Supera COVID-19, предоставленному CRUE. В рамках исследования под руководством исследовательской группы UNED они создали прототип для извлечения информации с помощью вопросов и ответов на естественном языке из обновленного набора научных статей о COVID-19 и SARS-CoV-2, опубликованных мировым исследовательским сообществом.
"Парадигма поиска информации меняется благодаря искусственному интеллекту", - сказала Энеко Агирре, руководитель центра HiTZ UPV/EHU. "До сих пор при поиске информации в Интернете вводился вопрос, и ответ приходилось искать в документах, отображаемых системой. Однако, в соответствии с новой парадигмой, системы, которые предоставляют ответ непосредственно без какой-либо необходимости читать весь документ, становятся все более и более распространенными".
В этой системе "пользователь не запрашивает информацию, используя ключевые слова, а задает вопрос напрямую", - объяснил исследователь Elhuyar Ксабьер Саралеги. Система ищет ответы на этот вопрос в два этапа: "Во-первых, она извлекает документы, которые могут содержать ответ на заданный вопрос, используя технологию, которая сочетает ключевые слова с прямыми вопросами. Вот почему мы исследовали нейронные архитектуры", - добавил доктор Саралеги. Были использованы глубокие нейронные архитектуры, снабженные примерами: "Это означает, что модели поиска и модели ответов на вопросы обучаются с помощью глубокого машинного обучения".
Как только набор документов извлечен, они повторно обрабатываются с помощью системы вопросов и ответов, чтобы получить конкретные ответы: "Мы создали движок, который отвечает на вопросы; когда движку задают вопрос и документ, он способен определить, содержится ли ответ в документе. документ, и если это так, то он точно сообщает нам, где он находится", - объяснил доктор Агирре.
Легко продаваемый прототип
Исследователи удовлетворены результатами своего исследования: "Из методов и оценок, которые мы проанализировали в наших экспериментах, мы взяли те, которые дают прототипу наилучшие результаты", - сказал исследователь Эльхуяр. Была создана прочная технологическая база, и было опубликовано несколько научных работ на эту тему. "Мы придумали другой способ запуска поиска всякий раз, когда информация срочно необходима, и это облегчает процесс использования информации. На исследовательском уровне мы показали, что предлагаемая технология работает, и что система обеспечивает хорошие результаты", - отметил Агирре.
"Наш результат - прототип фундаментального исследовательского проекта. Это не коммерческий продукт", - подчеркнул Саралеги. Но такие прототипы могут быть легко смоделированы в течение короткого времени, что означает, что они могут быть проданы и доступны обществу. Эти исследователи подчеркивают, что искусственный интеллект делает доступными все более мощные инструменты для работы с большими базами документов. "Мы добиваемся очень быстрого прогресса в этой области. И более того, все, что исследуется, может легко попасть на рынок", - заключил исследователь UPV /EHU.
Комментарии