Reconocimiento de señales de tráfico basado en el algoritmo YOLOv3 Parte 2
Jan 19, 2024
2. Fundamentos de algoritmos
2.1. El algoritmo YOLOv3
YOLOv3 [14] es el algoritmo mejorado de detección de objetivos de una sola etapa de Redmon basado en YOLOv2, que ha mejorado la precisión de la detección y el rendimiento en tiempo real y supera a otros algoritmos en términos de velocidad y precisión.
En los últimos años, el rápido desarrollo de la tecnología de inteligencia artificial ha permitido aplicar varios sistemas de detección inteligentes en diversos campos. La precisión de la detección es un indicador importante para evaluar la calidad de un sistema inteligente, y la memoria es una de las capacidades centrales que respalda el funcionamiento de un sistema inteligente. Entonces, ¿cuál es la relación entre ambos?
En primer lugar, debemos dejar claro que la precisión de la detección y la memoria no son una simple "correlación positiva" o "correlación negativa". Existe un alto grado de interacción y coordinación entre ellos. En muchos casos, la precisión de la detección de un sistema inteligente depende de su memoria, es decir, de su capacidad para comprender y aprender datos de muestra.
Por ejemplo, en el campo del reconocimiento facial, un buen sistema de reconocimiento facial debe poder identificar con precisión diferentes rostros y relacionarlos con la información de la persona en la base de datos de rostros conocidos. Esto requiere que el sistema inteligente tenga una memoria potente, sea capaz de almacenar la información de rostros conocidos en la base de datos y utilizarla de manera flexible en tareas de reconocimiento posteriores.
De manera similar, en el campo médico, los sistemas inteligentes necesitan comprender y recordar una gran cantidad de conocimientos médicos para ayudar a los médicos en el diagnóstico de enfermedades y el diseño de planes de tratamiento. Esto también requiere que el sistema inteligente tenga una sólida capacidad de memoria y aprendizaje, absorba continuamente nuevos conocimientos médicos y realice una verificación cruzada y una actualización con la base de conocimientos existente.
Por supuesto, la relación entre la precisión de la detección y la memoria no es unidireccional. Por el contrario, una buena precisión de detección también puede promover la mejora de la memoria de los sistemas inteligentes. Por ejemplo, en algunas tareas de clasificación y reconocimiento, los sistemas inteligentes necesitan proporcionar retroalimentación y optimización continuamente para mejorar continuamente su exactitud y precisión, fortaleciendo así aún más la capacidad de comprender y recordar datos de muestra.
En general, la precisión de la detección y la memoria son dos elementos indispensables para el funcionamiento de los sistemas inteligentes. Tienen interacciones y relaciones complejas que deben considerarse y coordinarse plenamente. Sólo mejorando continuamente la precisión de la detección y fortaleciendo continuamente la memoria y las capacidades de aprendizaje del sistema inteligente se podrá lograr realmente el desarrollo y la aplicación integrales del sistema inteligente. Se puede ver que necesitamos mejorar la memoria, y Cistanche deserticola puede mejorar significativamente la memoria, porque Cistanche deserticola también puede regular el equilibrio de los neurotransmisores, como aumentar los niveles de acetilcolina y factores de crecimiento. Estas sustancias son muy importantes para la memoria y el aprendizaje. Además, la carne también puede mejorar el flujo sanguíneo y promover el suministro de oxígeno, lo que puede garantizar que el cerebro reciba suficientes nutrientes y energía, mejorando así la vitalidad y la resistencia del cerebro.

Haga clic en conocer suplementos para aumentar la memoria
YOLOv3 es actualmente el algoritmo más popular de la familia YOLO y se usa ampliamente en escenarios de detección reales [15]; la estructura de la red YOLOv3 se muestra en la Figura 1.

La estructura convolucional completa utilizada por YOLOv3 no está limitada por el tamaño de la entrada de la imagen.
Las capas de agrupación y completamente conectadas se eliminan de toda la estructura de la red, y se utiliza una capa convolucional con un tamaño de paso de 2 en lugar de la capa de agrupación para la operación de reducción de resolución, lo que evita la pérdida de información del objetivo durante la agrupación y facilita la detección de objetivos pequeños. dieciséis].
Además, YOLOv3 reemplaza la estructura de red DarkNet-19 de YOLOv2 con la capa de extracción de funciones DarkNet-53.
La red DarkNet-53, que resuelve con éxito el problema del gradiente de la red profunda y la pérdida de información original durante la operación convolucional multicapa para extraer mejor características y mejorar la detección y clasificación [17], toma prestada la estructura de red residual de ResNet [ 18] y utiliza la salida original de la capa anterior como parte de la entrada en la última capa de la red.
Como se muestra en la Figura 2, el módulo residual en YOLOv3 consta de dos capas convolucionales y una capa de acceso directo.

Además, YOLOv3 utiliza la noción de red piramidal de características (FPN) (19] e introduce la red piramidal de características para pronosticar mapas de características en tres escalas, con escalas de detección de 13 x 13, 26 x 26 y 52 x 52.
El método de extracción de características mediante la red neuronal convolucional es de abajo hacia arriba en la red FPN, y el proceso de muestreo ascendente de los mapas de características de la capa convolucional es de arriba hacia abajo, como se muestra en la Figura 3.
2.2. Estructura de agrupación piramidal espacial
La estructura de agrupación de pirámide espacial (SPP) (20] resuelve el problema de la extracción repetida de características de imagen mediante redes neuronales convolucionales y mejora en gran medida la eficiencia de detección; la estructura de la red SPPNet se muestra en la Figura 4.

Para garantizar que la resolución de la imagen de entrada coincida con la dimensión de la característica de la capa completamente conectada en una red neuronal con una capa completamente conectada, se requieren operaciones de escalado y recorte de regiones en la imagen de entrada.
Los procesos de escalado y recorte darán como resultado la pérdida de información de las características de la imagen, lo que reducirá la precisión de la detección y afectará los resultados de la detección: sin embargo, los procesos de escalado y recorte darán como resultado la pérdida de la precisión de la detección de la información de las características de la imagen y afectarán los resultados de la detección, mientras que SPPNet puede superar las limitaciones. Tamaño fijo de la imagen de entrada, ahorrando el costo computacional 21.

3. YOLOv3 mejorado
3.1. Estructura de red YOLOv3 mejorada
La red de extracción de características básicas comúnmente se reduce cinco veces, con una tasa de reducción de 2, y la multiplicidad de cinco veces la reducción de resolución es 32 a la quinta potencia de dos, según la descripción del conjunto de datos COCO.
Si continúa reduciendo la resolución, el mapa de características obtenido será uno y la información del objetivo se perderá. Los objetivos pequeños tienen menos de 32 × 32 píxeles, los objetivos medianos tienen entre 32 × 32 y 96 × 96 píxeles y los objetivos gigantes tienen más de 96 × 96 píxeles [22].
Como se ilustra en la Figura 5, el conjunto de datos de señales de tráfico TT100K utilizado en este trabajo estaba compuesto principalmente por objetivos pequeños y medianos, donde los objetivos grandes representaban solo el 7,4% del conjunto de datos total y los objetivos pequeños representaban el 42,5% [23].

El conjunto de datos TT100K tiene una alta resolución: cada imagen tiene una resolución de 2048 × 2048 píxeles y las señales de tráfico más grandes entre los objetivos pequeños representan menos del 0,1% de la imagen completa, lo que plantea un desafío importante para el objetivo. algoritmo de detección.
Los objetivos pequeños tienen características limitadas y requieren una gran precisión de localización.
A pesar de la introducción de la estructura FPN en YOLOv3 para aprovechar la fusión de características de múltiples escalas para producir predicciones fusionando los hallazgos de distintas capas de características, lo cual es fundamental para la identificación de objetivos pequeños, los resultados aún fueron insatisfactorios.
En la red YOLOv3, la capa superficial contiene menos información semántica de características pero una ubicación de destino precisa, mientras que la capa profunda tiene más, pero una ubicación de destino aproximada.
Como resultado, se utilizan capas convolucionales poco profundas para predecir objetivos pequeños y capas convolucionales profundas para predecir objetivos grandes. Se agregó una cuarta escala de predicción de características de tamaño 152 × 152 a las tres escalas de predicción de características de la estructura de red YOLOv3 para utilizar plenamente las características poco profundas de la red para anticipar objetivos pequeños.
Con un tamaño de imagen de entrada de 608 × 608, el tamaño de la característica de la imagen de salida fue de 152 × 152 después de la convolución y un muestreo doble de la imagen de entrada, y la capa de características se indujo a través de la capa de enrutamiento; esta extracción de características se fusionó con la característica de la undécima capa para aumentar la escala de predicción de la cuarta característica.
Además, se agregó el módulo SPP para lograr la combinación de características locales y globales tomando prestada la noción de SPPNet y combinándola con YOLOv3.
Antes de la capa de detección YOLO, el módulo SPP se integraba entre las capas convolucionales quinta y sexta, y los mapas de características del módulo SPP y los mapas de características agrupados se reconectaban y pasaban a la siguiente capa de red de detección.

Para lograr la fusión a nivel de mapa de características de características locales y globales, el núcleo de agrupación máximo del módulo SPP debe ser lo más cercano posible al tamaño del mapa de características que se va a agrupar.
Para minimizar el esfuerzo computacional causado por el módulo SPP, enriquecer la capacidad de expresión del mapa de características y aumentar el impacto de la detección, el módulo SPP en esta investigación se compuso de dos ramas paralelas, cada una de las cuales estaba compuesta por una capa de agrupación máxima de 19 × 19 y un salto. conexión. La Figura 6 muestra la estructura de red YOLOv3 mejorada.

3.2. Función de pérdida mejorada
La función de pérdida de YOLOv3 se compone de la pérdida de coordenadas central (lossy), la pérdida de coordenadas de ancho-alto (pérdida), la pérdida de confianza (lossconf) y la pérdida de clasificación (lossy). La pérdida de coordenadas central está representada por:

donde λcoord denota el peso de pérdida de coordenadas; λnoobj denota la pérdida de confianza sin un objeto; Iobjij denota si el j-ésimo cuadro de anclaje de la i-ésima celda es responsable del objeto (1 o 0); Inobbyij denota el j-ésimo cuadro de anclaje de la i-ésima cuadrícula que no es responsable del objeto; (xi,yi,wji,hjI, CjI, Pji) denota las coordenadas, confianza y categoría del cuadro objetivo predichas; y (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) denota las coordenadas, confianza y categoría reales del cuadro objetivo
La función de pérdida de YOLOv3 está representada por la ecuación (5), donde la función de pérdida de error cuadrático medio (MSE) se usa para la regresión del cuadro delimitador y la entropía cruzada se utiliza como función de pérdida en lossconf y locales.
pérdida=pérdidaxy + pérdidawh − pérdidacon f − pérdidacls (5)
Sin embargo, utilizar MSE como función de pérdida de regresión del cuadro delimitador es desfavorable para la detección de objetivos pequeños, es sensible a la escala del objeto y se centra en objetivos de gran escala, aunque no es amigable con los objetos de pequeña escala.
Para equilibrar la pérdida de objetivos grandes y pequeños y maximizar los resultados de detección debilitando la influencia del tamaño del cuadro delimitador en la función de pérdida de ancho y alto, en este artículo se empleó la función de pérdida de tipo IoU, y la pérdida métrica generada por IoU se utilizó como una ecuación de rendimiento (6).
Pagaré =|A ∩ B||A ∪ B|(6)
Cuando el cuadro delimitador y el cuadro de destino no se superponen, IoU=0 no refleja la distancia entre los dos cuadros; cuando el cuadro de predicción y el cuadro etiquetado se superponen completamente, IoU=1, el punto central del cuadro delimitador no se puede determinar y el espacio de tamaño con el cuadro de destino no se puede optimizar más.
La pérdida de DIoU [24] es independiente del tamaño; por tanto, los tamaños grandes no supondrán una gran pérdida. Debido a que un tamaño pequeño produce una pequeña pérdida, que puede solucionar el problema, este trabajo utilizó la pérdida DIoU, cuya fórmula de cálculo se presenta en la Ecuación (7).
D Pérdida de IoU=1 − IoU +ρ2 b, bgt c2(7)
donde b y bgt denotan los puntos centrales, ρ es la distancia euclidiana y c es la longitud diagonal de la caja circundante más pequeña que cubre las dos cajas.
La pérdida DIoU minimiza la distancia entre dos fotogramas objetivo directamente, converge rápidamente y está más en línea con el mecanismo de regresión del fotograma objetivo, que tiene en cuenta la distancia entre el objetivo y el ancla, la tasa de superposición y la escala, lo que hace que la regresión del fotograma objetivo sea más estable, al mismo tiempo que proporciona la dirección del degradado para el cuadro delimitador cuando no se superpone con el marco de destino.

For more information:1950477648nn@gmail.com






