Опубликовано 3 часа назад

На пути к интеллектуальному земледелию: глубокое обучение для борьбы с сорняками в посевах

Глубокое обучение (Deep Learning, DL) является ключевым компонентом для построения систем обнаружения объектов и предлагает множество алгоритмов, применимых в различных областях. В сельском хозяйстве борьба с сорняками — одна из главных проблем, и системы обнаружения сорняков могут значительно помочь в повышении урожайности. В данной работе мы предлагаем модель обнаружения сорняков на основе DL, которая может эффективно использоваться для рационального управления сорняками в посевах.

Аннотация

Методы: Наша предложенная модель использует систему обнаружения объектов на основе сверточных нейронных сетей You Only Look Once (YOLO) для обучения и прогнозирования. Собранный набор данных содержит изображения в формате RGB четырех различных видов сорняков: злаковые (мятлик), бодяк полевой, вьюнок полевой и калифорнийский мак. Этот набор данных был обработан с применением техник преобразования изображений LAB (Lightness A и B) и HSV (Hue, Saturation, Value), а затем обучен на четырех моделях YOLO (v3, v3-tiny, v4, v4-tiny).

Результаты и обсуждение: Был проанализирован эффект преобразования изображений, и сделан вывод, что производительность модели существенно не зависит от этих преобразований. Результаты логического вывода, полученные при сравнении правильно предсказанных сорняков, довольно обнадеживающие. Среди всех моделей, реализованных в этой работе, модель YOLOv4 достигла наибольшей точности. Она правильно предсказала 98,88% сорняков со средним значением потерь 1,8 и средней средней точностью (mAP) 73,1%.

Дальнейшая работа: В будущем мы планируем интегрировать эту модель в распылитель с переменной нормой внесения для точной борьбы с сорняками в реальном времени.

1 Введение

Поскольку население мира стремительно растёт, нехватка продовольствия во всём мире увеличивается (Gilland, 2002). Чтобы справиться с дефицитом продовольствия, необходимо повышать урожайность сельскохозяйственных культур. Современные агротехнические практики, такие как точное земледелие, интеллектуальное сельское хозяйство, пищевые технологии, селекция растений и др., используют передовые технологии (Liang and Delahaye, 2019; García et al., 2021; Hati and Singh, 2021; Mavani et al., 2021; van Dijk et al., 2021; Zhang et al., 2021) для интенсификации производства сельхозкультур. В интеллектуальном сельском хозяйстве внедряются системы искусственного интеллекта для принятия обоснованных решений с целью повышения урожайности (Hague et al., 2006; Franco et al., 2017). Основными факторами, влияющими на урожайность, являются болезни растений, система орошения, применение агрохимикатов, распространение вредителей и сорняки и др. (Oerke, 2006; Mitra, 2021; Reginaldo et al., 2021; Jastrzebska et al., 2022). Только сорняки за период с 2003 по 2014 год нанесли экономический ущерб в размере около 11 млрд долларов США в 18 штатах Индии (Gharde et al., 2018). Автоматизированные системы борьбы с сорняками и управления ими позволяют снизить потери урожая до 50 % и более (Dass et al., 2017).

Автоматическое обнаружение и идентификация сорняков является первым этапом в разработке системы снижения засорённости (Fernández-Quintanilla et al., 2018; Munz and Reiser, 2020). Алгоритмы глубокого обучения лучше подходят для задач классификации и идентификации объектов на основе изображений. Они в основном строятся на нейронных сетях и хорошо известны своими возможностями распознавания образов на изображениях (Szegedy et al., 2015; Guo et al., 2016; Shrestha and Mahmood, 2019). Эти глубокие нейронные сети имеют множество скрытых слоёв, и каждый скрытый слой выполняет определённую операцию над входными данными, что приводит к идентификации объекта. Алгоритмы на основе глубокого обучения широко используются в различных исследовательских задачах в области медицинской диагностики (Bakator and Radosav, 2018; Yoo et al., 2020), интеллектуального управления дорожным движением (Aqib et al., 2018; Aqib et al., 2019a; Aqib et al., 2019b) и, в частности, в практике интеллектуального управления сельскохозяйственными культурами (Balducci et al., 2018; Mohamed et al., 2021). Они показывают значительные результаты в обнаружении вредителей (Khalid et al., 2023), сорняков (Khan et al., 2022) и др. с использованием систем обнаружения объектов в сельскохозяйственной сфере.

В данной работе мы представляем модель обнаружения объектов на основе глубокого обучения для выявления сорняков в сельскохозяйственных угодьях. Для этой цели используется система обнаружения объектов YOLO, основанная на глубоких свёрточных нейронных сетях (CNN). Для проведения эксперимента набор данных собирался в поле в различные временные интервалы и при разных условиях освещения. Набор данных из четырёх видов сорняков был собран с помощью сенсоров изображения. Этот набор данных был предварительно обработан перед использованием для обучения различных моделей системы обнаружения объектов YOLO. Модели обучались и оценивались с использованием различных конфигурационных настроек. Для валидации всех обученных моделей был подготовлен неиспользованный набор данных с применением оценочных метрик. Насколько известно авторам, мы являемся первыми, кто разработал систему обнаружения различных видов сорняков на пшеничном поле в регионе Потохар, Пакистан.

Вклад данной работы в область управления сорняками с использованием глубокого обучения включает следующее:

- Сбор и подготовка реального набора данных о сорняках, собранного с полей в Потохаре, Пакистан.

- После обучения моделей YOLO с различными конфигурациями мы предоставляем наилучшую модель обнаружения сорняков с оптимальными настройками конфигурации.

- Исследование применения методов преобразования изображений на производительность модели.

- Анализ влияния методов аугментации данных на прогнозирование объектов.

Остальная часть исследования организована следующим образом: обзор научных статей, относящихся к данной области, представлен в разделе 2. Затем в разделе 3 обсуждаются технологическая схема процесса, предлагаемая методология, входной набор данных, его предобработка и другие связанные детали. Подробное обсуждение экспериментальной установки и результатов прогнозирования приведено в разделах 4 и 5, и наконец, мы завершаем исследование в разделе 6.

2 Обзор литературы

Классификация и обнаружение объектов на сельскохозяйственных полях для распознавания сорняков является актуальной областью исследований. В этом разделе мы обсудили некоторые исследования, в которых обнаружение и классификация сорняков выполняются с использованием методов на основе искусственного интеллекта, таких как глубокое обучение, компьютерное зрение, робототехника и др.

В исследовании (Zhuang et al., 2022) была организована работа по обнаружению всходов широколистных сорняков на пшеничных полях. Авторы пришли к выводу, что FR-CNN, YOLOv3, VFNet, TridentNet и CenterNet не подходят для обнаружения, так как их показатель полноты (recall) остаётся на уровне 58 % или ниже. В то время как классификация с использованием AlexNet и VGGNet показала F1-меру выше 95 %. В этом исследовании авторы использовали набор данных с очень маленьким разрешением изображений 200 × 200 пикселей для обучения моделей.

В работе (Potena et al., 2017) была разработана система классификации сорняков с использованием мультиспектральной камеры. В процессе сбора данных использовался робот BoniRob (Chebrolu et al., 2017). Этот набор данных содержал информацию, собранную с нескольких датчиков, включая 4-канальную мультиспектральную камеру, RGB-D ИК-датчик, GPS, наземный лазерный сканер и датчик Kinect. Набор данных включал данные от стадии появления всходов до стадии, когда робот может повредить культуру. Использовались две модели CNN: лёгкая CNN для бинарной сегментации изображений и более глубокая CNN для целей классификации. Также был предложен алгоритм кластеризации для формирования подмножеств изображений, более похожих друг на друга.

В работе (Madsen et al., 2020) классификация сорняков выполнялась на наборе данных, состоящем из 7590 изображений 47 видов растений. Для классификации использовался алгоритм ResNet-50-v1, который достиг точности 77,06 % и полноты 96,79 %. Набор данных собирался в условиях хорошего освещения, а не при переменном свете. В исследовании (Gao et al., 2020) разработана модель обнаружения на основе глубокой свёрточной нейронной сети, известной как архитектура YOLO. Модель обучалась на 452 полевых изображениях и тестировалась на 100 изображениях из общего числа 2271 синтетических изображений C. sepium и сахарной свеклы. Авторы сравнили YOLOv3 и YOLOv3-tiny и достигли средней точности 76,1 % и 82,9 % соответственно, при времени вывода 6,48 мс.

Исследование по обнаружению сорняков в многолетнем райграсе с использованием глубокого обучения было проведено в работе (Yu et al., 2019). Было применено несколько моделей глубокого обучения, включая VGGNet, GoogleNet, AlexNet и DetectNet. Собрано 33086 изображений одуванчика, плюща обыкновенного, молочая пятнистого и многолетнего райграса. Набор данных содержал 15486 отрицательных и 17600 положительных изображений (содержащих сорняки). Модели обучались индивидуально для множественных и одиночных видов сорняков. Анализ показал, что VGGNet имела самую высокую F1-меру и показатель полноты — 0,928 и 0,99 соответственно. DetectNet показала самое высокое значение F1-меры — выше 0,98. В целом, в их эксперименте VGGNet и DetectNet показали лучшие результаты.

Классификация сорняков выполнялась с использованием наивного байесовского классификатора в исследовании (Giselsson et al., 2017), в котором был создан набор данных, содержащий примерно 960 растений, принадлежащих к 12 видам. Данные собирались на разных стадиях роста. Изображения собирались в течение 20 дней с интервалом 2–3 дня. Снимки делались с высоты 110–115 см над землёй. Всего было сделано 407 изображений с разрешением 5184 × 3456 пикселей. Авторы пришли к выводу, что этот классификатор может применяться только к изображениям со сходными характеристиками.

В работе (Le et al., 2020) применялись два метода улучшения изображений — локальный бинарный паттерн и маска контура листьев растений — на наборе данных о сорняках для повышения производительности классификатора. В эксперименте использовались два набора данных: Bccr-segnet и Can-rad. Классификация выполнялась с использованием метода опорных векторов, и была достигнута точность 98,63 % для 4 классов. В исследовании (Hoang Trong et al., 2020) был разработан подход к классификации с использованием поздней конкатенации многомодельных глубоких нейронных сетей (DNN). Эксперименты проводились с наборами данных Plant Seedlings и weeds с использованием 5 моделей DNN: NASNet, Resnet, InceptionResnet, Mobilenet и VGG. Использовались два набора данных, содержащих 208477 изображений. Анализ показал, что методы достигли наилучшей точности 97,31 % на наборе данных Plant Seedlings и 98,77 % на наборе данных CNU Weeds.

В работе (dos Santos Ferreira et al., 2017) было проведено исследование в Кампу-Гранди, штат Мату-Гросу-ду-Сул, Бразилия, по обнаружению сорняков на посевах сои с использованием свёрточной нейронной сети. Набор данных был создан с помощью дрона и состоял из 15000 изображений, но после предобработки было отобрано 400 изображений. Исследование проводилось в пять этапов. Сначала сбор данных, затем классификация изображений с использованием алгоритма суперпикселей. Третий этап включал извлечение признаков на основе цвета, формы и текстуры. Четвёртый этап состоял из обучения классификатора CNN. Последний этап включал визуализацию результатов сегментации и классификации. Изображения были получены с RGB-камеры с размером 4000 × 3000 пикселей с высоты 4 м. Применялись ConvNets, метод опорных векторов, AdaBoost и случайный лес, причём ConvNet достигла наилучшей точности 98 %.

В исследовании (Jiang et al., 2020) предложена комбинация графовой свёрточной сети и VGG16, ResNet-101 и AlexNet для классификации сорняков. Использовались четыре набора данных: кукурузы, салата, редиса и смешанный. Смешанный набор данных был создан путём объединения наборов кукурузы, салата и редиса. Предложенный подход GCN оказался эффективным для распознавания нескольких классов культур и сорняков при ограниченном количестве размеченных данных. Сравнивались GCN-ResNet-101, GCN-AlexNet, GCN-VGG16 и GCN-ResNet-101, и были достигнуты точности 97,80 %, 99,37 %, 98,93 % и 96,51 % соответственно.

Прототип вездехода (ATV) для точного опрыскивания был разработан в работе (Olsen et al., 2019). Был подготовлен набор данных, состоящий из 17509 размеченных изображений восьми различных видов сорняков: шиповатое яблоко, лантана, паркинсония, партениум, колючая акация, резиновая лиана, сорняк Сиам и змеиный сорняк. Этот набор данных был подготовлен в Австралийском регионе и находится в открытом доступе (Olsen et al., 2019). Было сделано около тысячи изображений каждого вида с помощью камеры высокого разрешения и GPS для отслеживания прогресса. Использовались две модели CNN на основе глубокого обучения — Inception-v3 и ResNET-50 — для установления базовых показателей производительности на наборе данных. Обе модели оценивались с использованием таких оценочных метрик, как время вывода, время предобработки, общее время вывода и частота кадров. В классификации была достигнута точность 95,1 % и 95,7 % соответственно. Полученные результаты были хорошими, но прототип ATV не испытывался в реальных полевых условиях.

В исследовании (Bosilj et al., 2020) рассматривалась роль трансферного обучения при обнаружении различных культур и сорняков на трёх наборах данных: сахарная свекла, морковь и лук. Было обнаружено, что время обучения сократилось до 80 %, даже если данные были размечены неидеально, а ошибка классификации составила 2 %.

Обнаружение сорняков с использованием трансферного обучения выполнялось в работе (Espejo-Garcia et al., 2020). Авторы объединили модели глубокого обучения и машинного обучения для идентификации сорняков. Модели глубокого обучения включали Xception, Inception-Resnet, VGNets, Mobilenet и Densenet. Моделями машинного обучения были метод опорных векторов, XGBoost и логистическая регрессия. Собрано 1268 изображений двух культур и двух видов сорняков. Установлено, что DenseNet и SVM достигли наивысшей F1-меры — 99,29 %.

Модель FCN-8s обучалась для семантической сегментации с использованием синтетических иерархических изображений (Skovsen et al., 2019). Был собран набор данных, содержащий 8000 синтетических изображений райграса, красного клевера, белого клевера, почвы и сорняков. Среднее значение пересечения над объединением (IoU) было рассчитано между эталонными изображениями и предсказанными и составило 55,0 %. Значения IoU для классов сорняков и почвы были ниже 40 %.

Семантическая сегментация сорняков выполнялась с использованием SegNet (свёрточной нейронной сети для семантической сегментации) в работе (Lameski et al., 2017). Для отделения пикселей растений от пикселей фона использовался индекс Excess Green minus Excess Red (ExG-ExR). Это улучшило обнаружение растений. Был собран набор данных сорняков моркови, состоящий из 39 изображений размером 10 МП с высоты примерно 1 м. Такие изображения большого размера преобразовывались в меньшие с использованием метода скользящего окна. Набор данных был несбалансированным, так как изображений моркови было больше, чем сорняков.

В предыдущих работах по разработке систем обнаружения сорняков обучались различные модели машинного и глубокого обучения для классификации, обнаружения и семантической сегментации сорняков с использованием различных наборов данных. Для сбора разнообразных наборов данных и обучения моделей применялись различные датчики и вычислительные системы. В обзоре литературы видно, что недостаточно реализовано применение методов обработки и преобразования изображений для получения лучших результатов. В данном исследовании мы разработали модель обнаружения сорняков для выявления четырёх видов сорняков, произрастающих на пшеничных полях. Для этого мы использовали новейшие современные модели обнаружения объектов, методы обработки и преобразования изображений для достижения лучших результатов по сравнению с другими исследованиями, представленными в этом разделе.

3 Материалы и методы

В этом разделе подробно описываются этапы всей экспериментальной установки. Эксперимент предназначен для оценки способности моделей YOLO и влияния обработки изображений на обнаружение сорняков в реальном поле. Технологическая схема нашей предлагаемой методологии проиллюстрирована на Рисунке 1. Этот рисунок выделяет различные этапы нашей предлагаемой методологии исследования, которые включают сбор данных, предобработку данных, обучение моделей, валидацию и оценку результатов прогнозирования. Краткий обзор этих этапов приведён в следующих абзацах.

Рисунок 1 — Технологическая схема нашей системы обнаружения сорняков.

На этапе сбора данных данные собираются с сельскохозяйственных полей с использованием камер в разное время, при различных экологических и световых условиях. Эти данные подготавливаются для использования в дальнейших процессах, таких как обучение, тестирование и валидация моделей и др. Этот этап разделён на три подэтапа: нормализация, аугментация и аннотирование. При нормализации данные регуляризуются и проверяются на предмет удаления нерелевантных, однородных и дублирующихся изображений и т. п. На этапе аугментации форма и размер данных изменяются для получения лучших результатов при дальнейшей обработке. При аннотировании каждой сущности в данных присваивается метка, которая служит в качестве начальной обучающей информации для моделей.

Процесс обучения моделей выполняется с применением следующих архитектур глубоких нейронных сетей YOLO:

- YOLOv3

- YOLOv4

- YOLOv3-tiny

- YOLOv4-tiny

Эти модели обучаются на предварительно обработанных данных, и для каждой модели выполняется настройка гиперпараметров для получения наилучшей конфигурации. Обученные модели валидируются на неиспользованных данных, а результаты прогнозирования оцениваются с использованием различных оценочных метрик. К ним относятся точность (precision), полнота (recall), средняя средняя точность (mean average precision) и средние потери (average loss). Эти метрики помогают анализировать результаты, полученные моделью на валидационном наборе.

3.1 Набор данных

Процесс сбора данных проводился в зимний сезон в регионе Потохар, Пакистан. Собранный набор данных состоит из RGB-изображений различных видов сорняков, произрастающих на поле Triticum (пшеницы). Эти сорняки разделены на четыре основных класса, которые включают Lolium perenne, Dactylis glomerata, Chloris cucullata (злаковые), Cirsium arvense (бодяк полевой), Convolvulus arvensis (вьюнок полевой) и Eschscholzia californica (калифорнийский мак). Собранный набор данных содержит 1065 изображений, полученных с помощью камеры Logitech HD 920c webcam pro с разрешением 1 МП и размерами 1280 × 720. Набор данных доступен на GitHub по ссылке https://github.com/Aqib-Soft-Solutions/Wheat-Crop-Weeds-Dataset.git, а его образец проиллюстрирован на Рисунке 2.

Рисунок 2 — Иллюстрация (A) классов и (B) аннотаций.

После сбора набора данных, чтобы подготовить его к обучению, его необходимо сначала нормализовать, аугментировать и аннотировать. Для получения лучших результатов на этих данных мы выполнили несколько циклов обучения и соответствующего изменения данных. Подпроцессы предобработки данных описаны ниже. После анализа изображений было установлено, что они содержат некоторые проблемы, которые необходимо сначала решить. Эти проблемы вызваны изображениями, которые являются размытыми, однородными, искажёнными камерой и т. д. Мы удалили такие изображения, которые могут потенциально препятствовать процессу обучения. Процесс нормализации разделён на подпроцессы, проиллюстрированные на Рисунке 3.

Рисунок 3 — Процесс нормализации данных.

Мы применили различные методы маскирования для выделения растений из изображения. Изображение преобразуется в цветовые схемы LAB и HSV, показанные на Рисунках 4 и 5 соответственно. После преобразования в LAB сохраняется только канал 'b'. Применяются бинаризация Отсу и инверсное пороговое преобразование, при котором порог установлен на 105, а максимальное значение — на 255. Для преобразования в HSV извлекаются пиксели в определённом диапазоне, где нижние и верхние значения установлены на (30, 25, 0) и (80, 255, 255) соответственно.

Рисунок 4 — Применённое маскирование с использованием цветовой схемы LAB.

Рисунок 5 — Применённое маскирование с использованием цветовой схемы HSV.

После применения пороговой обработки полученная маска имеет некоторые пропущенные части основного растения (объекта). Чтобы заполнить эти пропущенные части, мы применили морфологию к маске и выполнили операцию побитового И между этой маской и исходным изображением для получения окончательного результирующего изображения.

Конечное изображение, полученное с использованием цветовой схемы LAB, содержит меньше шума, чем изображение, полученное с использованием цветовой схемы HSV.

В процессе аугментации данных мы выполняли аугментацию на части изображений набора данных. Во-первых, изображения вращались под тремя разными углами: 45, 90 и 180 градусов. Во-вторых, данные также изменялись со значением насыщенности 1,5, экспозиции 1,5 и оттенка 0,1 во время обучения.

При аннотировании данных вокруг каждого объекта на изображении рисуется прямоугольная рамка и присваивается метка. Для этого мы использовали YOLO mark. Он создаёт текстовый файл, содержащий информацию о каждой аннотации на изображении.

4 Результаты и оценка

Этот эксперимент организован для оценки: (i) производительности систем обнаружения объектов YOLO для обнаружения сорняков; (ii) результатов при различных конфигурациях моделей YOLO; (iii) влияния аугментации данных на вывод; (iv) влияния маскирования изображений на производительность модели. Весь процесс выполняется в нескольких различных сценариях, описанных ниже.

4.1 Оценочные метрики

В этом разделе описаны оценочные метрики, используемые для оценки результатов моделей YOLOv3, v3-tiny, v4 и v4-tiny. Параметры, используемые для оценки результатов, описаны ниже.

4.1.1 Точность (Precision)

Точность для конкретного класса рассчитывается путём деления истинно положительных результатов на все положительные прогнозы. Мы использовали уравнение (1) для расчёта точности обученной модели.

4.1.2 Полнота (Recall)

Полнота класса рассчитывается путём деления истинно положительных результатов на сумму истинно положительных и ложноотрицательных результатов. Мы использовали уравнение (2) для расчёта точности обученной модели.

4.1.3 F1-мера

F1-мера является показателем точности модели в задачах классификации, особенно при работе с несбалансированными наборами данных. Она объединяет точность и полноту в единый показатель для сбалансированной оценки производительности модели. Мы использовали уравнение (3) для расчёта F1-меры обученной модели.

4.1.4 Средняя средняя точность (Mean Average Precision)

Средняя средняя точность (mAP) рассчитывается как среднее значение средней точности (AP) каждого класса. Средняя точность (AP) является мерой площади под кривой точности-полноты и вычисляется по формуле в уравнении (4).

Где p(r) — точность как функция r. AP вычисляет среднее значение p(r) на интервале 0 ≤ r ≥ 1 (Zhu, 2004). Для расчёта mAP мы использовали формулу в уравнении (5).

Где n — общее количество классов.

4.1.5 Средние потери (Average Loss)

Функция средних потерь (AL) YOLO является суммой потерь классификации, потерь локализации и потерь достоверности, которые вычисляются с использованием уравнения (6) остаточной суммы квадратов (RSS) (Archdeacon, 1994). Это отклонение прогнозируемых значений от фактических эталонных значений.

Где RSS = остаточная сумма квадратов, y_i = i-е значение прогнозируемой переменной, f(x_i) — прогнозируемое значение y_i, а n — верхний предел суммирования.

4.2 Реализация YOLOv3

YOLOv3 — это хорошо известная система обнаружения объектов. Мы оценили её производительность при обнаружении сорняков в различных конфигурациях. Данные разделены на три набора — обучающий, тестовый и валидационный — в соотношении 7:2:1 соответственно. Для обучения модели YOLOv3 мы настроили её параметры, такие как subdivision, размеры (width и height), max batches и filters. Максимальное количество пакетов и фильтры обновляются в соответствии с формулами (7) и (8). Оба параметра сильно зависят от количества классов (ncl) в наборе данных.

Производительность версии YOLOv3 оценивалась с несколькими конфигурационными настройками для различных случаев. В каждом случае фильтры и максимальное количество пакетов оставались одинаковыми со значениями 27 и 8000 соответственно. Гиперпараметры, используемые для настройки модели, показаны в Таблице 1.

Таблица 1 — Гиперпараметры, используемые для обучения YOLOv3.

В 1-м и 6-м случаях использовался набор данных без маскирования. Во 2-м и 5-м случаях использовалось преобразование LAB. В 3-м и 7-м случаях использовалось преобразование HSV. Как видно из результатов, наблюдается небольшое изменение значений mAP, но общая производительность остаётся одинаковой. На Рисунке 6 представлены результаты обучения всех моделей, кроме наилучших.

Рисунок 6 — Иллюстрация обучения 1-й, 2-й, 3-й, 4-й и 7-й моделей для YOLOv3 в (A) и (B).

В 5-м и 6-м случаях обе модели достигли наивысших показателей среди всех реализаций. В обоих случаях модели настроены с одинаковым значением subdivision 32, но с разными размерами: 384 × 384 и 512 × 512 соответственно. Результаты их обучения показаны на Рисунке 7.

Рисунок 7 — Графики AL и mAP для моделей YOLOv3 с 5-й и 6-й конфигурациями.

Модель YOLOv3, 5-я, обеспечила mAP 52,0 %, наилучшую mAP 57 % и AL 0,4076. Модель 6-я достигла mAP 53,2 %, наилучшей mAP 57 % и AL 0,3394. Обученные модели валидируются на одних и тех же тестовых данных. Результаты вывода показаны на Рисунке 8, где 5-я модель YOLOv3 обнаружила больше объектов, чем 6-я.

Рисунок 8 — Результаты вывода 5-й и 6-й моделей YOLOv3.

Для оценки YOLOv3 мы подготовили неиспользованный набор данных, который не применялся для обучения модели. В Таблице 2 показаны результаты вывода, полученные при оценке наилучшей модели на валидационном наборе данных.

Таблица 2 — Показывает производительность наилучшей модели YOLOv3 на тестовом наборе данных.

Модели, обученные в 3-м и 4-м случаях, обнаружили больше объектов классов «Злаковые» и «Бодяк полевой». В 7-м случае обученная модель обнаружила наибольшее количество объектов классов «Вьюнок полевой» и «Калифорнийский мак». В среднем модели, обученные в 3-м и 4-м случаях, обнаружили больше объектов каждого класса по сравнению с другими случаями. В Таблице 3 показаны значения mAP и AL для каждого случая.

Таблица 3 — Показывает AL, mAP и наилучшую AP каждой модели при обучении.

4.3 Реализация YOLOv3-tiny

При реализации YOLOv3-tiny мы оценили её производительность при различных конфигурационных настройках. В конфигурации параметры, такие как максимальное количество пакетов и фильтры, рассчитываемые по уравнениям (7) и (8), остаются одинаковыми в каждой реализации, поскольку они зависят от количества классов в наборе данных. В каждом случае фильтры и максимальное количество пакетов установлены на 27 и 8000 соответственно. Изменения других параметров приведены в Таблице 4.

Таблица 4 — Гиперпараметры, используемые для обучения YOLOv3-tiny.

В 1-м и 3-м случаях использовался набор данных без маскирования. Во 2-м и 4-м случаях использовалось преобразование LAB. В 5-м и 7-м случаях использовалось преобразование HSV. Как видно из результатов, наблюдается небольшое изменение значений mAP, но общая производительность остаётся одинаковой.

В 5-м случае модель настроена с subdivision 32 и размерами 512 × 512. Обучение этой модели проиллюстрировано на Рисунке 9. Модель имеет mAP 48,7 %, наилучшую mAP 55 % и AL 1,5265. На рисунке выше видно, что 5-я модель способна обнаружить значительное количество объектов с высоким показателем достоверности при оценке тестового набора данных.

Рисунок 9 — Графики обучения и результаты вывода 5-й обученной модели YOLOv3-tiny.

Для оценки YOLOv3-tiny в каждом случае мы валидировали модели на неиспользованном наборе данных и рассчитали правильно предсказанные объекты. Результаты вывода для наилучшего случая показаны в Таблице 5. Модели, обученные в 1-м и 2-м случаях, могут обнаружить больше объектов, чем остальные. Количество обнаруженных объектов в 4-м, 5-м и 6-м случаях является наименьшим для классов «Злаковые», «Вьюнок полевой» и «Калифорнийский мак».

Таблица 5 — Показывает производительность наилучшей модели YOLOv3-tiny на тестовом наборе данных.

В Таблице 6 показаны значения mAP и AL для каждого случая.

Таблица 6 — Показывает AL, mAP и наилучшую AP каждой модели, обученной в различных случаях.

4.4 Реализация YOLOv4

При реализации YOLOv4 мы оценили её производительность при различных конфигурационных настройках. Мы настроили каждую модель с параметрами max batches, filters, subdivisions и dimensions. Максимальное количество пакетов и фильтры рассчитываются с использованием уравнений (7) и (8), тогда как subdivision и размеры различны для каждого случая, как показано в Таблице 7.

Таблица 7 — Гиперпараметры, используемые для обучения YOLOv4.

В 1-м и 2-м случаях модели настроены с subdivision 16, размерами 384 × 384, максимальным количеством пакетов 8000 и фильтрами 27. Максимальное количество пакетов и фильтры одинаковы для каждого случая, поскольку они зависят от количества классов в наборе данных. В 1-м случае модель имеет mAP 53,6 %, наилучшую mAP 60 % и AL 2,1259. Во 2-м случае модель имеет mAP 53,1 %, наилучшую mAP 63 % и AL 2,3958.

В 1-м и 2-м случаях модели обучены на наборах данных LAB и HSV. Мы проанализировали, что 1-я модель может обнаруживать больше объектов на изображении, чем 2-я. Средняя средняя точность обеих моделей довольно схожа. В Таблице 8 показаны результаты наилучшей модели YOLOv4.

Таблица 8 — Показывает производительность наилучшей модели YOLOv4 на тестовом наборе данных.

В Таблице 9 показаны значения mAP и AL для каждого случая. Мы видим, что хотя наилучшие значения mAP в случаях 1 и 2 относительно высоки, значения mAP обоих случаев примерно одинаковы. AL обоих случаев также одинаковы. В 3-м случае, хотя мы получили меньшее mAP по сравнению с другими случаями, AL также является наименьшим среди этих экспериментов.

Таблица 9 — Показывает AL, mAP и наилучшую AP каждой модели, обученной в различных случаях.

В 4-м случае во время обучения производительность обученной модели была наилучшей по сравнению со всеми, как показано на Рисунке 10. AL этого случая также находится среди самых низких. Среднее значение mAP остаётся выше 70 %, что является наилучшим показателем на данный момент. При выводе модель также превзошла другие по обнаружению объектов.

Рисунок 10 — График AL и mAP для наилучшей модели YOLOv4 с 4-й конфигурацией.

4.5 Реализация YOLOv4-tiny

Модель YOLO версии четыре tiny — это небольшая архитектура на основе глубокого обучения. Скорость обнаружения объектов выше, чем у версии YOLOv4. Однако у неё есть недостаток — обнаружение объектов с меньшей точностью. Модель, полученная после обучения, имеет очень малый размер, что в первую очередь требуется для машин с меньшей вычислительной мощностью.

При реализации YOLOv4-tiny мы оценили её производительность при различных конфигурационных настройках. В каждой настройке изменялись такие параметры, как filters, max batches, dimensions и др. Фильтры и максимальное количество пакетов рассчитываются по уравнениям (7) и (8) соответственно, тогда как значения других параметров варьируются в каждом случае, как указано в Таблице 10.

Таблица 10 — Гиперпараметры, используемые для обучения YOLOv4-tiny.

Во время обучения YOLOv4-tiny в 3-м и 4-м случаях модели настроены с subdivision 32 и размерами 384 × 384 и 416 × 416 соответственно. В 3-м случае модель имеет mAP 56,5 %, наилучшую mAP 59 % и AL 0,8718. В 4-м случае модель имеет mAP 54,9 %, наилучшую mAP 57 % и AL 0,8083. Графики AL и mAP обоих случаев показаны на Рисунке 11.

Рисунок 11 — Графики AL и mAP для моделей YOLOv4-tiny с 3-й и 4-й конфигурациями.

Результаты вывода 3-го и 4-го случаев проиллюстрированы на Рисунке 12, где обе модели достаточно эффективно предсказывают объекты с высоким показателем достоверности. Обе модели обеспечили средний показатель достоверности 90 % при оценке на неиспользованных изображениях.

Рисунок 12 — Результаты вывода 3-й и 4-й моделей YOLOv4-tiny.

Каждая модель в реализации YOLOv4-tiny показала выдающиеся результаты при прогнозировании объектов на изображении. В Таблице 11 показаны результаты наилучшей модели YOLOv4-tiny. Производительность модели в 5-м случае является самой слабой, поскольку она обнаружила наименьшее количество объектов в валидационном наборе данных. В Таблице 12 показаны значения mAP и AL для каждого случая.

Таблица 11 — Показывает производительность YOLOv4-tiny на тестовом наборе данных.

Таблица 12 — Показывает AL, mAP и наилучшую AP каждой модели, обученной в различных случаях.

5 Обсуждение

В этом разделе мы провели анализ производительности четырёх вариантов YOLO (v3, v3-tiny, v4 и v4-tiny). Во-первых, проанализированы результаты, полученные на этапе обучения. Во-вторых, обсуждается производительность каждой модели при выводе, затем рассматривается влияние аугментации данных и обработки изображений на обучение и оценку. Наконец, мы провели сравнительный анализ производительности нашей модели с работами из обзора литературы.

На этапе обучения каждый вариант YOLO обучался на одной системе для нейтрального сравнения производительности. Мы проанализировали разницу в производительности обучения путём изменения конфигурационных параметров. В каждом случае реализации модели настраивались с комбинацией размеров (384, 416, 512, 608) и subdivision (16, 32). Наблюдается, что между всеми комбинациями существует небольшая разница в значениях mAP, но существенная разница в использовании памяти GPU. Уменьшение subdivision и увеличение ширины и высоты могут потреблять много памяти GPU. Среди всех вариантов YOLO модель YOLOv4 обеспечила наилучшие значения mAP и AL. Ей удалось правильно идентифицировать все объекты из 102 объектов со средним показателем достоверности 88,67 %.

При оценке обученных моделей YOLOv4-tiny способна идентифицировать больше объектов в целом в каждом сценарии. За ней YOLOv4 заняла второе место по частоте правильных прогнозов, тогда как YOLOv3 и YOLOv3-tiny показали примерно одинаковые результаты в большинстве случаев. На Рисунке 13 количество объектов, обнаруженных каждой моделью, приведено в (A), а средний показатель достоверности наилучших обученных моделей проиллюстрирован в (B). Наблюдается, что среди всех реализованных версий YOLO модель YOLOv4 обеспечила нам наилучший показатель достоверности при прогнозировании.

Рисунок 13 — (A) Иллюстрация количества объектов, обнаруженных каждой моделью в различных случаях, (B) Средний показатель достоверности наилучшей модели каждого варианта YOLO.

Было установлено, что с помощью аугментации данных показатель достоверности и количество правильно обнаруженных объектов для двух классов — «Вьюнок полевой» и «Калифорнийский мак» — увеличились. Результаты аугментации проиллюстрированы на Рисунке 14.

Рисунок 14 — Изменение результатов каждой модели при применении аугментации данных.

На рисунке выше видно увеличение показателя достоверности после аугментации. Значительное увеличение для класса «Вьюнок полевой» показано YOLOv3-tiny. Для класса «Калифорнийский мак» разница в результатах очень незначительна. Применение преобразований LAB и HSV для маскирования растений не оказывает существенного влияния на производительность (с точки зрения mAP) и может потенциально увеличить вычислительные затраты, время и ресурсы. Модель YOLOv4 обнаруживает объекты с высокими показателями достоверности в процессе прогнозирования независимо от предоставленных данных. Таким образом, можно сделать вывод, что YOLOv4 способна эффективно обнаруживать объекты даже при недостаточном количестве данных. Сравнительный анализ производительности нашей модели с работами из обзора литературы представлен в Таблице 13.

Таблица 13 — Показывает сравнительный анализ с исследованиями из обзора литературы.

6 Заключение

Использование глубокого обучения значительно повысило производительность систем обнаружения объектов. Обнаружение таких объектов, как сорняки, в реальном поле является сложной задачей из-за сильно изменчивых условий окружающей среды. В данном исследовании мы предложили модель обнаружения сорняков на основе глубокого обучения для идентификации сорняков в реальном времени. Для этой цели был собран реальный полевой набор данных, к которому были применены различные методы предобработки перед использованием в качестве входных данных для обучения. Четыре версии YOLO (v3, v3-tiny, v4, v4-tiny) были реализованы с различными конфигурационными настройками для обеспечения сравнительного анализа их результатов вывода на неиспользованных данных.

Мы пришли к выводу, что модели, настроенные с subdivision 16 и размерами 416 × 416, могут лучше обобщаться на неиспользованных данных, прогнозировать больше объектов и давать более высокую точность и mAP по сравнению с другими конфигурациями. Аугментация данных также значительно повлияла на производительность. Модель, обученная на аугментированных данных, обнаружила в два раза больше объектов по сравнению с другими моделями. В то же время разница в производительности при применении преобразований изображений LAB и HSV для маскирования растений невелика.

Мы проанализировали, что наилучшие результаты обучения обеспечивает архитектура YOLOv4 с mAP 73,1 % и средней скоростью потерь 1,8. Эта модель достигла точности 98,88 % путём подсчёта количества правильно предсказанных сорняков в неиспользованном наборе данных. Эта модель может быть развёрнута в реальном поле для обнаружения сорняков.

В будущем мы планируем создать систему опрыскивания с переменной нормой внесения для управления сорняками в реальном времени с использованием предложенной модели. Кроме того, мы добавим разнообразные данные о сорняках и будем использовать другие новейшие модели глубокого обучения для повышения точности обнаружения.

Saqib MA, Aqib M, Tahir MN and Hafeez Y (2023) Towards deep learning based smart farming for intelligent weeds management in crops. Front. Plant Sci. 14:1211235. doi: 10.3389/fpls.2023.1211235

Перевод статьи «Towards deep learning based smart farming for intelligent weeds management in crops» авторов Saqib MA, Aqib M, Tahir MN and Hafeez Y., оригинал доступен по ссылке. Лицензия: CC BY. Изменения: переведено на русский язык


Комментарии (0)