Reconocimiento de señales de tráfico basado en el algoritmo YOLOv3, parte 3

Jan 19, 2024

3.3. Generación de marcos a priori basados ​​en el algoritmo de agrupamiento de K-Means

El mecanismo de anclaje se implementó en YOLOv2, y el número de anclajes se aumentó a nueve en YOLOv3 para hacer que las regiones candidatas generadas sean más similares a los marcos etiquetados genuinos y aumentar la recuperación de la red de detección.

Existe una fuerte relación entre los fotogramas marcados y la memoria. Marcar marcos puede ayudarnos a establecer un marco de memoria fijo, regular y ordenado, facilitando la memorización de grandes cantidades de información. Por ejemplo, al aprender un idioma, podemos utilizar marcos marcados para memorizar nuevas palabras y reglas gramaticales. Al repasar la historia, podemos utilizar marcos marcados para memorizar eventos históricos y líneas de tiempo. De esta manera, podemos hacer que el conocimiento abstracto sea más concreto y comprensible.

Al mismo tiempo, marcar marcos también puede estimular la capacidad asociativa de nuestro cerebro, mejorando así nuestra memoria. Debido a que nuestra memoria se basa en la asociación y la conexión, al establecer marcos marcados, podemos conectar de forma más natural nuevos conocimientos con los existentes, profundizando la memoria y la comprensión.

La capacidad de la memoria humana se puede entrenar y mejorar. Mediante la práctica constante y el uso de técnicas de memoria como marcar marcos, podemos mejorar nuestra memoria y afrontar mejor información y tareas complejas en la vida y el trabajo.

En definitiva, marcar fotogramas es una técnica de memoria muy eficaz. Puede ayudarnos a recordar información importante de forma más rápida y precisa. También puede estimular nuestra capacidad asociativa y mejorar nuestra memoria. ¡Utilicemos activamente cuadros marcados para mejorar continuamente nuestras habilidades de memoria! Se puede ver que necesitamos mejorar la memoria, y Cistanche deserticola puede mejorar significativamente la memoria porque Cistanche deserticola es un material medicinal tradicional chino que tiene muchos efectos únicos, uno de los cuales es mejorar la memoria. La eficacia de la carne picada proviene de los diversos ingredientes activos que contiene, incluidos ácidos, polisacáridos, flavonoides, etc. Estos ingredientes pueden promover la salud del cerebro de varias maneras.

increase brain power

Haga clic en Saber para mejorar la memoria a corto plazo

No era apropiado utilizar el ancla original, ya que las señales de tráfico son principalmente objetivos pequeños y medianos, con menos objetivos grandes en el conjunto de datos TT100K. Para un conjunto de datos específico, elegir un ancla inicial adecuada puede mejorar el efecto de detección, hacer que la red sea más fácil de aprender y aumentar la tasa de detección del cuadro delimitador.

El flujo del algoritmo de agrupamiento de K-medias para obtener cuadros de candidatos se muestra en la Figura 7.

En el conjunto de datos TT100K, la estructura de red YOLOv3 mejorada incluía una escala de predicción de características, lo que dio como resultado cuatro escalas y doce anclajes: (4, 5), (5, 6), (7, 7), (7, 13), (8, 8), (9, 10), (11, 12), (13, 14), (16, 17), (20, 22), (27, 29) y (41, 44).

supplements to improve memory

4. Experimentos y Análisis de Resultados

4.1. Conjunto de datos e indicadores de evaluación

Hay algunos conjuntos de datos de señales de tráfico grandes y disponibles públicamente, la mayoría de los cuales utilizan la GTSDB, pero la GTSDB no es lo mismo que las señales de tráfico chinas. CTSDB, CCTSDB y TT100K, entre otros, son conjuntos de datos de señales de tráfico chinos.

La CCTSDB se amplió sobre la base de la CTSDB y sus categorías se dividieron en señales de advertencia, señales direccionales y señales de prohibición, sin una clasificación detallada de las señales de tráfico.

La colección de señales de tráfico TT100K fue creada en colaboración entre Tencent y la Universidad de Tsinghua. Ofrecía una categorización e identificación exhaustivas de las señales de tráfico, cubría diversas circunstancias climáticas y de iluminación y era más preciso para situaciones de conducción reales.

Por lo tanto, en este artículo se utilizó el conjunto de datos de señales de tráfico TT100K, y algunas de las señales de tráfico y la información de categorías se muestran en la Figura 8.

ways to improve your memory

El conjunto de datos TT100K tiene 100,000 fotos con una resolución de 2048 x 2048 píxeles, aunque hay imágenes de señales de tráfico sin etiquetar y algunas categorías tienen solo unas pocas imágenes o imágenes duplicadas, lo que reduce el efecto de detección.

Por lo tanto, este documento eliminó las imágenes de señales de tráfico duplicadas y sin etiquetar del conjunto de datos y seleccionó 45 categorías con una gran cantidad de señales de tráfico, donde las 45 categorías de señales de tráfico eran: pn, pne, i5, pll, pl40, po,pl50, pl80. , io, pl60, p26, i4, pll00, pl30, il60, l5, i2, w57, p5, p10, ip, pl120, il80, p23, pr40.ph4. 5, w59, p12, p3, w55. pm20, pl20, pg, pl70, pm55, il100, p27, w13, p19, ph4, ph5, wo, p6.pm30 y w32, y el número de cada categoría de señal de tráfico se muestra en la Figura 9.

improve brain

La Figura 9 muestra que incluso si se eligieran 45 categorías con una gran cantidad de señales de tránsito, todavía había un desequilibrio significativo en la cantidad de datos entre cada categoría, lo que resultaba en una precisión deficiente de la predicción del modelo. Como resultado, como se ilustra en la Figura 10, este trabajo equilibró y amplió el conjunto de datos empleando tácticas como difuminado de color, ruido gaussiano y rotación de imágenes para garantizar que la cantidad de cada categoría fuera lo más igual posible.

improve memory

El enfoque Mosaico lee cuatro imágenes a la vez, escala y altera la gama de colores de cada imagen, las organiza en cuatro direcciones y luego une las imágenes para crear el marco real del objetivo.

El método de mejora une cuatro imágenes, lo que equivale a calcular los parámetros de cuatro imágenes con una sola entrada. Esto puede reducir la cantidad de imágenes para la entrada por lotes, reducir la dificultad y el costo del entrenamiento, mejorar la velocidad del entrenamiento y enriquecer en gran medida la cantidad de muestras en el conjunto de datos, lo que favorece el aprendizaje.

En este artículo, se utilizaron las métricas de evaluación del conjunto de datos COCO, incluidos mAPou - 050AP, APM, AP y varias otras métricas, para evaluar el rendimiento del modelo. En particular, la mayoría de las señales de tráfico en el conjunto de datos de señales de tráfico TT100K pertenecían a objetivos pequeños, por lo que era necesario prestar especial atención a la precisión de la detección de objetivos pequeños. Los significados específicos de las métricas de evaluación son los siguientes:

AP: El área debajo de la curva PR, donde PR es precisión y recuperación, respectivamente:

API {{0}}.50: cuando el umbral de IoU se establece en 0,50, es el promedio de todas las categorías de AP en el conjunto de datos, que es el índice de evaluación del conjunto de datos PASCAL VOC y corresponde a APIoU=0.50 en el índice de evaluación COCOmAPloU= 0.50: cuando el umbral de loU se establece en 0,50, es el promedio de todas las categorías de AP en el conjunto de datos, que es el índice de evaluación de el conjunto de datos PASCAL VOC y corresponde a APloU=0.5 en el índice de evaluación COCO.

AP: valor promedio de mAP para objetos pequeños: área < 322 y rango loU=(0.5, 1.00, 0.05) para un total de 10 oUs.

increase memory

APm: objetos medianos: 322 <área <962, y loU=rango (0.5, 1.00, 0.05) valor medio de mAP para un total de 10 pagarés.

AP: valor promedio de mAP para objetos grandes: área > 962 y rango loU=(0.5, 1.00, 0.05 para un total de 10 Yo nosotros.

4.2. Resultados experimentales y análisis

4.2.1. Experimento de comparación YOLOv3 mejorado

En este estudio se compararon y probaron tres redes YOLOv3 con métodos mejorados, utilizando el conjunto de datos de señales de tráfico TT100K e imágenes de entrada de 608 × 608 píxeles de tamaño. La Figura 11 muestra el mapa y AR de M-YOLOv3 entrenado en el conjunto de datos TT100.

Los resultados de detección para varios tamaños de objetivos se muestran en la Figura 12 y la Tabla 1. Entre ellos, YOLOv3-DK adoptó la estrategia de mejorar la función de pérdida DIoU y el ancla de reagrupación; YOLOv3-SPP adoptó la estrategia espacial de fusión de la estructura de agrupación piramidal; YOLOv3-4l adoptó la estrategia de agregar la cuarta capa de funciones de predicción con escalas de 152 × 152; y M-YOLOv3 fue la estructura de red YOLOv3 que utiliza todas las estrategias mejoradas.

boost memory


10 ways to improve memory

La Tabla 1 y la Figura 12 muestran que la precisión media promedio del YOLOv3 original sin emplear ninguna estrategia fue del 68,9%. Por el contrario, el mapa del YOLOv3 actualizado con todos los métodos fue del 77,3%, una mejora del 8,4% en la detección.

La función de pérdida DIoU y la técnica de anclaje de reagrupación mejoraron la precisión de la detección en un 1,3 %; sin embargo, la mejora se debió a una convergencia más rápida de la función de pérdida durante el entrenamiento, lo que hizo que la regresión del cuadro objetivo fuera más estable y mejoró la tasa de recuperación. Se observaron mejoras más pronunciadas en mAP en YOLOv3, que incluyó una estructura SPP y logró un 73,2%.

La estructura SPP combinó características locales y globales, mejorando la capacidad del mapa de características para expresarse y aumentando significativamente la precisión de la detección. Utilizando el método de agregar una cuarta capa de características de predicción con escalas de 152 × 152, el AP también mejoró considerablemente.

La precisión de la detección de objetivos pequeños se mejoró en un 10,5 % en comparación con YOLOv3, que hizo uso completo de las características poco profundas de la red para la predicción de objetivos pequeños, lo que resultó en un efecto de detección considerablemente mejorado, pero a costa de una mayor complejidad y procesamiento de la red. . La mejor mejora fue M-YOLOv3, que combinó los tres procedimientos de mejora y logró un mAP del 77,3%, que es un 8,4% más alto que la precisión media promedio del YOLOv30 original. La Figura 13 muestra los resultados de la prueba de M-YOLOv3 en TT100K.

short term memory how to improve

4.2.2. Comparación del algoritmo YOLOv3 mejorado con otros algoritmos

M-YOLOv3 se comparó con varios otros algoritmos clásicos de detección de objetivos para validar aún más el reconocimiento de detección de la red mejorada, y los resultados se muestran en la Tabla 2.

ways to improve memory

La Tabla 2 demuestra que M-YOLOv3 tuvo el mAP más alto de 77,3%, y SSD tuvo el mejor rendimiento en tiempo real, con un FPS de 42. En comparación con el algoritmo YOLOv3 original, la precisión media promedio mejoró mucho, aunque el tiempo real El rendimiento se redujo. En comparación con el SSD de algoritmo de una etapa, mAP mejoró en un 12%, pero todavía había una brecha en el rendimiento en tiempo real. En comparación con el algoritmo de detección de objetivos de dos etapas Faster-RCNN, el FPS se mejoró a 22 y el mAP también se mejoró en un 1,7%, lo que mejoró la velocidad de detección, así como la precisión de la detección. Las pruebas demostraron que M-YOLOv3 funcionó mejor en términos de precisión y velocidad de detección.

4.2.3. Efecto de reconocimiento mejorado de YOLOv3 en señales de tráfico en un entorno especial

Debido a varios factores, como la fuerte irradiación de luz, la noche y los entornos especiales de oclusión de señales de tráfico, que afectarán la detección y el reconocimiento de señales de tráfico en escenarios de conducción del mundo real, también fue necesario considerar el efecto de reconocimiento del modelo en señales de tráfico en entornos especiales. En circunstancias particulares, se empleó el modelo YOLOv3 actualizado para reconocer señales de tráfico, como se demuestra en la Figura 13.

En la Figura 14, el efecto de detección de YOLOv3 se compara con el de M-YOLOv3 en un entorno especial. Como se muestra en la Figura 14(b1,c1), el algoritmo YOLOv3 no pudo detectar la señal de tráfico oscurecida en el caso de una señal de tráfico oscurecida, mientras que el algoritmo YOLOv3 mejorado identificó con precisión la señal de tráfico oscurecida; Como se muestra en la Figura 14 (b2, c2), el algoritmo YOLOv3 tuvo problemas de detección falsa y detección fallida para el reconocimiento de señales de tráfico en un entorno de fuerte irradiación de luz, mientras que el algoritmo YOLOv3 mejorado reconoció todas las señales de tráfico con precisión.

ways to improve brain function

El algoritmo YOLOv3 mejorado aumentó la cuarta escala de predicción de características para objetivos pequeños, mejorando el efecto de detección de objetivos pequeños, mientras que el algoritmo YOLOv3 tuvo problemas con la detección fallida y la baja confianza para objetivos pequeños, como se muestra en la Figura 14 (b3, c3); en entornos con poca iluminación, como por la noche, el algoritmo YOLOv3 actualizado reconoció las señales de tráfico, como se ilustra en la Figura 14(b4,c4); sin embargo, el método YOLOv3 no detectó objetivos. Como resultado, en situaciones particulares, el algoritmo YOLOv3 actualizado aún produjo mejores resultados de detección.

memory enhancement

5. Conclusiones

En esta investigación se sugirió una red de detección y reconocimiento de señales de tráfico basada en YOLOv3 modificado, para abordar las dificultades de los objetivos pequeños que son difíciles de detectar y la baja precisión de detección en las tareas de detección e identificación de señales de tráfico.

La nueva estructura de agrupación piramidal espacial permitió la fusión de características locales y globales en este estudio, además de aumentar la cuarta escala de predicción de características para objetivos pequeños para mejorar el efecto de detección de objetivos pequeños. Para hacer que la regresión del marco objetivo sea más estable, se utilizó la pérdida DIoU, que tenía una convergencia más rápida y era más consistente con la regresión del marco objetivo.

La precisión de la red de detección mejoró considerablemente al dañar lo menos posible la red en tiempo real. El mAP aumentó en 8,4 puntos. El algoritmo YOLOv3 actualizado mejoró la complejidad de la red y redujo la velocidad de detección. Sin embargo, la detección en tiempo real aún está muy lejos; por lo tanto, la próxima área de investigación será aumentar la velocidad de detección para lograr el efecto de la detección en tiempo real.

Contribuciones de los autores: Metodología y redacción: preparación del borrador original, AL y CG; análisis e investigación formal, YS; curación de datos, NX; recursos, AL; validación, WH Todos los autores han leído y aceptado la versión publicada del manuscrito.

Financiamiento: Este proyecto fue apoyado por el Programa Provincial de Ciencia y Tecnología de Innovación Juvenil de Educación Superior de Shandong (Subvención No.2019KJB019), la Fundación Provincial de Ciencias Naturales de Shandong de China (Subvención No. ZR2021MF131, ZR2015EL019 y ZR2020ME126) y la Fundación Nacional de Ciencias Naturales de China (Subvenciones N° 61601265 y 51505258). Este proyecto fue financiado por la Fundación Científica Postdoctoral de China (Subvención No. 2021M701405), el Proyecto Abierto del Laboratorio Estatal Clave de Comportamiento Mecánico y Seguridad del Sistema de Estructuras de Ingeniería de Tráfico, China (Subvención No. 1903), el Proyecto Abierto de Seguridad y Control del Tráfico de Hebei Key Laboratory, China (Subvención No. JTKY2019002) y el Importante Proyecto de Innovación Científica y Tecnológica en la Provincia de Shandong (Subvención No. 2022CXGC020706).

Declaración de la Junta de Revisión Institucional: No aplicable.

Declaración de Consentimiento Informado: No aplicable.

Declaración de disponibilidad de datos: No aplicable.

Agradecimientos: Agradecemos a todos los autores por sus contribuciones a la redacción de este artículo.

Conflictos de intereses: Los autores declaran no tener ningún conflicto de intereses.

improve your memory


Referencias

1. De la Escalera, A.; Armingol, JM; Mata, M. Reconocimiento y análisis de señales de tráfico para vehículos inteligentes. Imagen Vis. Computadora. 2003, 21, 247–258. [Referencia cruzada]

2. Saadna, Y.; Behloul, A. Una descripción general de los métodos de detección y clasificación de señales de tráfico. En t. J. Multimed. Información. Regreso. 2017, 6.193–210. [Referencia cruzada]

3. Boumediene, M.; Cudel, C.; Basset, M.; Ouamri, A. Detección de señales de tráfico triangulares basada en el algoritmo RSLD. Mach. Vis. Aplicación 2013, 24, 1721–1732. [Referencia cruzada]

4. Maldonado-Bascón, S.; Lafuente-Arroyo, S.; Gil-Jiménez, P.; Gómez-Moreno, H.; López-Ferreras, F. Detección y reconocimiento de señales de tráfico basado en máquinas de vectores de soporte. Traducción IEEE. Intel. Transp. Sistema. 2007, 8, 264–278. [Referencia cruzada]

5. Bahlmann, C.; Zhu, Y.; Ramesh, V.; Pellkofer, M.; Koehler, T. Un sistema para la detección, seguimiento y reconocimiento de señales de tráfico utilizando información de color, forma y movimiento. En Actas de las Actas del IEEE. Simposio sobre vehículos inteligentes, 2005, Las Vegas, NV, EE. UU., 6 a 8 de junio de 2005; págs. 255–260.

6. Ren, S.; Él, K.; Girshick, R.; Sun, J. R-CNN más rápido: hacia la detección de objetos en tiempo real con redes de propuesta regional.Adv. Información neuronal. Proceso. Sistema. 2015, 28, 91–99. [Referencia cruzada] [PubMed]

7. Liu, W.; Anguelov, D.; Erhan, D.; Szegedy, C.; Caña, S.; Fu, C.-Y.; Berg, AC SSD: detector MultiBox de disparo único. En Conferencia Europea sobre Visión por Computador; Springer: Cham, Suiza, 2016; págs. 21–37.

8. Redmon, J.; Divvala, S.; Girshick, R.; Farhadi, A. Solo miras una vez: detección de objetos unificada en tiempo real. En Actas de la Conferencia IEEE sobre visión por computadora y reconocimiento de patrones, Las Vegas, NV, EE. UU., 27 a 30 de junio de 2016; IEEE: Piscataway, Nueva Jersey, EE. UU., 2016; págs. 779–788.

9. Wang, Z.; Guo, H. Investigación sobre detección de señales de tráfico basada en redes neuronales convolucionales. En actas del 12.º Simposio internacional sobre comunicación e interacción de información visual, Shanghai, China, 20 a 22 de septiembre de 2019; págs. 1 a 5.

10. Han, C.; Gao, G.; Zhang, Y. Detección de pequeñas señales de tráfico en tiempo real con RCNN más rápido revisado. Multimedia. Herramientas Aplica. 2019, 78,13263–13278. [Referencia cruzada]

11. Zhang, J.; Huang, M.; Jin, X.; Li, X. Un algoritmo de detección de señales de tráfico chinas en tiempo real basado en YOLOv2 modificado. Algoritmos2017, 10, 127. [CrossRef]

12. Zhu, Z.; Liang, D.; Zhang, S.; Huang, X.; Li, B.; Hu, S. Detección y clasificación de señales de tráfico en la naturaleza. En Actas de la Conferencia IEEE sobre visión por computadora y reconocimiento de patrones 2016, Las Vegas, NV, EE. UU., 27 a 30 de junio de 2016; págs. 2110–2118.


For more information:1950477648nn@gmail.com





También podría gustarte