Автоматическая система извлечения информации для научных статей о COVID-19

  • Пользователь Алексей Коровин опубликовал
  • 23 декабря 2022 г., 13:45:59 MSK
  • 0 комментариев
  • 86 просмотров
VIGICOVID - это система, которая использует вопросы на естественном языке для получения ответов в лавине информации о COVID-19 и SARS-CoV-2.

Глобальное сообщество исследователей в области биозащиты прилагает огромные усилия для получения знаний, касающихся COVID-19 и SARS-CoV-2. На практике эти усилия означают огромное, очень быстрое производство научных публикаций, что затрудняет просмотр и анализ всей информации. Вот почему эксперты и органы, принимающие решения, должны быть обеспечены информационными системами, позволяющими им приобретать необходимые знания.

Это именно то, что было исследовано в проекте исследователей VIGICOVID, проводимом Центром HiTZ UPV / EHU, группой NLP & IR UNED и подразделением искусственного интеллекта и языковых технологий Elhuyar, благодаря финансированию Fondo Supera COVID-19, предоставленному CRUE. В рамках исследования под руководством исследовательской группы UNED они создали прототип для извлечения информации с помощью вопросов и ответов на естественном языке из обновленного набора научных статей о COVID-19 и SARS-CoV-2, опубликованных мировым исследовательским сообществом.

"Парадигма поиска информации меняется благодаря искусственному интеллекту", - сказала Энеко Агирре, руководитель центра HiTZ UPV/EHU. "До сих пор при поиске информации в Интернете вводился вопрос, и ответ приходилось искать в документах, отображаемых системой. Однако, в соответствии с новой парадигмой, системы, которые предоставляют ответ непосредственно без какой-либо необходимости читать весь документ, становятся все более и более распространенными".

В этой системе "пользователь не запрашивает информацию, используя ключевые слова, а задает вопрос напрямую", - объяснил исследователь Elhuyar Ксабьер Саралеги. Система ищет ответы на этот вопрос в два этапа: "Во-первых, она извлекает документы, которые могут содержать ответ на заданный вопрос, используя технологию, которая сочетает ключевые слова с прямыми вопросами. Вот почему мы исследовали нейронные архитектуры", - добавил доктор Саралеги. Были использованы глубокие нейронные архитектуры, снабженные примерами: "Это означает, что модели поиска и модели ответов на вопросы обучаются с помощью глубокого машинного обучения".

Как только набор документов извлечен, они повторно обрабатываются с помощью системы вопросов и ответов, чтобы получить конкретные ответы: "Мы создали движок, который отвечает на вопросы; когда движку задают вопрос и документ, он способен определить, содержится ли ответ в документе. документ, и если это так, то он точно сообщает нам, где он находится", - объяснил доктор Агирре.

Легко продаваемый прототип

Исследователи удовлетворены результатами своего исследования: "Из методов и оценок, которые мы проанализировали в наших экспериментах, мы взяли те, которые дают прототипу наилучшие результаты", - сказал исследователь Эльхуяр. Была создана прочная технологическая база, и было опубликовано несколько научных работ на эту тему. "Мы придумали другой способ запуска поиска всякий раз, когда информация срочно необходима, и это облегчает процесс использования информации. На исследовательском уровне мы показали, что предлагаемая технология работает, и что система обеспечивает хорошие результаты", - отметил Агирре.

"Наш результат - прототип фундаментального исследовательского проекта. Это не коммерческий продукт", - подчеркнул Саралеги. Но такие прототипы могут быть легко смоделированы в течение короткого времени, что означает, что они могут быть проданы и доступны обществу. Эти исследователи подчеркивают, что искусственный интеллект делает доступными все более мощные инструменты для работы с большими базами документов. "Мы добиваемся очень быстрого прогресса в этой области. И более того, все, что исследуется, может легко попасть на рынок", - заключил исследователь UPV /EHU.

Комментарии

0 комментариев