Extracción de parámetros de características mejorada de las señales de voz mediante el algoritmo de aprendizaje automático(1)
May 30, 2023
Abstracto: El reconocimiento de voz se refiere a la capacidad del software o hardware para recibir una señal de voz, identificar las características del hablante en la señal de voz y reconocer al hablante a partir de entonces. En general, el proceso de reconocimiento de voz implica tres pasos principales: procesamiento acústico, extracción de características y clasificación/reconocimiento. El propósito de la extracción de características es ilustrar una señal de voz utilizando un número predeterminado de componentes de señal. Esto se debe a que toda la información en la señal acústica es excesivamente engorrosa de manejar y alguna información es irrelevante en la tarea de identificación. Este estudio propone un enfoque basado en el aprendizaje automático que realiza la extracción de parámetros de características de las señales de voz para mejorar el rendimiento de las aplicaciones de reconocimiento de voz en entornos de ciudades inteligentes en tiempo real. Además, el principio de asignar un bloque de memoria principal a la memoria caché se usa de manera eficiente para reducir el tiempo de cálculo. El tamaño de bloque de la memoria caché es un parámetro que afecta fuertemente el rendimiento de la caché. En particular, la implementación de este tipo de procesos en sistemas de tiempo real requiere una alta velocidad de cálculo. La velocidad de procesamiento juega un papel importante en el reconocimiento de voz en los sistemas en tiempo real. Requiere el uso de tecnologías modernas y algoritmos rápidos que aumentan la aceleración en la extracción de los parámetros característicos de las señales de voz. Los problemas con el overclocking durante el procesamiento digital de señales de voz aún no se han resuelto por completo. Los resultados experimentales demuestran que el método propuesto extrae con éxito las características de la señal y logra un rendimiento de clasificación perfecto en comparación con otros algoritmos de reconocimiento de voz convencionales.

Cistanche desertica
Palabras clave: reconocimiento de voz; computación paralela; Computación distribuída; procesador multinúcleo; extracción de características; análisis espectral
1. Introducción
El establecimiento de enfoques de comunicación entre humanos y tecnología informática es una tarea crítica en la inteligencia artificial moderna. Uno de los métodos más fáciles para que los usuarios ingresen información es a través de señales de voz. Por lo tanto, la tecnología de procesamiento de señales de voz y sus herramientas se han convertido en una parte necesaria de la sociedad de la información. El reconocimiento de voz es un aspecto de investigación esencial del procesamiento de señales de voz y una técnica vital de interacción entre humanos y computadoras. Las señales de voz contienen información semántica, personal y ambiental [1]. El enfoque general para el procesamiento de señales de voz es utilizar un análisis a corto plazo, en el que la señal se divide en ventanas de tiempo de un tamaño fijo, asumiendo que los parámetros de la señal no cambian. Se coloca una superposición entre ventanas para obtener una representación de señal más precisa. Los algoritmos de extracción de características, como el análisis espectral y la predicción lineal, se aplican a cada ventana. Sin embargo, estos procesos también deben considerar la velocidad y el tiempo.

ginseng del desierto
La temporización es una preocupación importante en varias áreas del procesamiento de señales en tiempo real. La relación de velocidad de procesamiento se puede aumentar mediante el uso eficiente de los recursos del procesador y el desarrollo de algoritmos nuevos y rápidos para reducir el tiempo de procesamiento digital. Sin embargo, los problemas de computación de alto rendimiento aún no se han resuelto por completo [2]. Además, se han logrado avances sustanciales en el reconocimiento automático de voz con el desarrollo de hardware y software de procesamiento de señales digitales. Sin embargo, a pesar de estos avances, las máquinas no pueden igualar el desempeño de sus contrapartes humanas en términos de precisión y velocidad de reconocimiento, particularmente en el reconocimiento de voz independiente del hablante. Por lo tanto, una gran cantidad de investigación que se ha realizado sobre el reconocimiento de voz se ha centrado en problemas de reconocimiento de voz que son independientes del hablante, debido a la amplia gama de aplicaciones y limitaciones de las técnicas de reconocimiento de voz disponibles [3].
En resumen, las principales contribuciones del estudio son las siguientes:

te de cistanche
Haga clic aquí para ver los productos de té Cistanche deserticola
【Pregunte por más】 Correo electrónico:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
El proceso de identificación de una persona mediante señales de voz consta de varias etapas. Entre ellos, algunos pasos requieren más tiempo de cálculo. Este es un análisis espectral. Uno de los parámetros que es especialmente importante en los algoritmos de aprendizaje automático es el tiempo de entrenamiento. En este trabajo, encontramos que el proceso de extracción de características es importante para la identificación de señales de voz. Además, se necesita mucho tiempo en el aprendizaje automático. Se establece que el proceso de análisis espectral consta de operaciones independientes y es posible la paralelización.
Los experimentos han demostrado que las transformaciones espectrales FFT y DCT dan buenos resultados en el análisis espectral. El proceso de análisis espectral es válido para cada segmento de la señal de voz. Esto nos permite distinguir claramente estas características de la señal de voz. Con la ayuda de las herramientas OpenMP y TBB se desarrolló un algoritmo de cómputo paralelo que permitió agilizar los cálculos.
El tamaño del segmento es importante cuando se divide una señal de voz en segmentos. Durante los experimentos, se descubrió que el tamaño del segmento de la señal de voz depende de la memoria caché del procesador central. En particular, se ha descubierto que hacer coincidir el segmento con el tamaño de la memoria caché en los procesadores multinúcleo tiene un efecto positivo en la velocidad computacional en el aprendizaje automático.
Se propone un nuevo método de implementación paralela para transformaciones espectrales de señales para la extracción de parámetros de características de señales de voz utilizando un algoritmo de aprendizaje automático en procesadores multinúcleo que utilizan TBB y OpenMP.
También se encontró que el uso efectivo del principio de asignación del bloque de memoria principal al caché y el tamaño del bloque de memoria caché pueden aumentar la velocidad de procesamiento.

Suplemento de Cistanche cerca de mí-Mejorar la memoria
El resto de este documento está organizado de la siguiente manera. La Sección 2 revisa los estudios existentes para extraer propiedades específicas de señales de voz. La Sección 3 describe los pasos de extracción de características con experimentos. La Sección 4 presenta en detalle el algoritmo computacional de alto rendimiento propuesto para extraer los parámetros característicos de las señales de voz. Los resultados experimentales basados en nuestra implementación se discuten en la Sección 5. La Sección 6 destaca las limitaciones del método propuesto. Finalmente, la Sección 7 concluye el estudio resumiendo los hallazgos y señalando futuras líneas de investigación.
2. Trabajos relacionados
Actualmente se están desarrollando y mejorando nuevos métodos, algoritmos y aplicaciones más modernas para la segmentación de señales de voz y el cálculo de indicadores paramétricos de fragmentos seleccionados, creando así un espectrograma de señales de voz mediante análisis espectral [4–7]. La identificación del hablante con clips de voz diversificados en todo el mundo es una tarea crucial y desafiante, especialmente en la extracción de características vigorosas y discriminatorias [8]. Korkmaz et al. propusieron un novedoso sistema de extracción de características de coeficientes cepstrales de frecuencia de Mel (MFCC) que es más rápido y más eficiente energéticamente que la realización tradicional de MFCC. [9]. En lugar de usar un filtro de preacentuación de paso alto, usaron un filtro de paso bajo. Implementaron un filtro de paso de banda con un filtro de paso alto porque se necesita preacentuación para aumentar la energía de la señal en frecuencias altas. En nuestro trabajo anterior [10], presentamos un nuevo método basado en MFCC para la identificación de hablantes. En lugar de usar MFCC convencionales, empleamos píxeles del espectrograma Mel como nuestro conjunto de características. El espectrograma se transformó en una matriz 2-D para crear un nuevo conjunto de datos. Para identificar al hablante se pusieron en práctica varios algoritmos de aprendizaje con una técnica de validación cruzada 10-fold. Con la ayuda de un perceptrón multicapa (MLP) con una función de activación de tanh, se logró la mejor precisión del 90,2 por ciento.
La extracción de características se logra cambiando la forma de onda del habla a una forma de representación paramétrica a una velocidad de datos relativamente menor para el procesamiento y análisis posteriores [11–14]. Los enfoques de extracción de características suelen generar un vector de características multidimensional para cada señal de voz. La extracción de características es la parte más relevante del reconocimiento de hablantes. Las características del habla tienen una parte vital en la segregación de un hablante de los demás. La extracción de características reduce la magnitud de la señal de voz, sin causar ningún daño a la potencia de la señal de voz [15–17]. En [18], los autores introdujeron un nuevo enfoque que explota el ajuste fino de los parámetros de tamaño y cambio de la ventana de análisis espectral utilizada para calcular la transformada inicial de Fourier de corta duración para mejorar el rendimiento de un reconocimiento de voz automático dependiente del hablante. (ASR) sistema. En ausencia de médicos, los laicos pueden emplear sistemas de asistencia en la toma de decisiones que se crearon utilizando enfoques de inteligencia artificial. La detección temprana y no invasiva del estado cardíaco se puede lograr mediante señales de fonocardiograma (PCG) [19–21].
Se ha demostrado que las redes neuronales convolucionales (CNN) simulan con éxito la localidad estructural en el espacio de características, así como también emplean la agrupación dentro de una región de frecuencia sesgada para reducir la variación de traducción y ajustarse a las perturbaciones y pequeños cambios en el espacio de características [22]. Mukhamadiev et al. propuso un modelo de reconocimiento de voz modelo de Markov oculto de red neuronal profunda de extremo a extremo y una red de atención de clasificación temporal conexionista híbrida (CTC) para el idioma uzbeko y sus dialectos. El enfoque propuesto reduce el tiempo de entrenamiento y mejora la precisión del reconocimiento de voz mediante el uso efectivo de la función objetivo CTC en el entrenamiento del modelo de atención [23]. En [24] se propuso la extracción y clasificación de características utilizando un modelo de red neuronal convolucional unidimensional (CNN), que divide las señales de sonido cardíaco en normales y anormales directamente independientes de un electrocardiograma (ECG). Afirman que la precisión de la clasificación es mayor en la CNN 1D que en la CNN 2D para las señales de sonido cardíaco utilizadas en este estudio cuando el kernel de convolución es inferior a 52 porque un kernel de convolución grande puede generar complejidad computacional y consume cada vez más tiempo. . En [25], se entrenó una red neuronal profunda para maximizar la precisión posterior de las secuencias de estado de los modelos acústicos con respecto a las secuencias de características del habla utilizando la base de datos TIMIT (TIMIT Acoustic-Phonetic Continuous Speech Corpus).
3. Preprocesamiento: descripción general del material

Suplemento de Cistanche cerca de mí-Mejorar la memoria
Para este propósito, el desarrollo de algoritmos rápidos para extraer parámetros característicos de señales de voz y representaciones paramétricas, la extracción de muestras útiles e informativas para el procesamiento y el desarrollo de programas para la implementación de espectrogramas de segmentos acústicos seleccionados son indispensables.
Los sistemas de reconocimiento de voz constan de dos subsistemas principales:
El procesamiento primario de señales de voz (fonograma);
La clasificación de símbolos acústicos utilizando un algoritmo inteligente (espectrograma).
El primer subsistema genera símbolos acústicos como un conjunto de propiedades acústicas informativas de las señales y características de las señales. El segundo subsistema convierte la señal de voz en una forma paramétrica basada en las características acústicas obtenidas. El procesamiento de la señal de voz consta de las siguientes etapas:
Separación de los límites de la señal de voz;
filtrado digital;
Segmentación;
Aplicación de una ventana de suavizado;
Transformación espectral y normalización de frecuencias espectrales.
Estos pasos se utilizan ampliamente para extraer parámetros de características de las señales de voz, y sus características principales se consideran a continuación.
3.1. Separación de límites
La extracción de solo partes del discurso de la señal entrante o la determinación de los momentos inicial y final de una oración en un entorno ruidoso es una tarea esencial en el procesamiento del habla. Las siguientes propiedades de la señal de voz se utilizan para resolver este problema: la energía a corto plazo de la señal de voz, el número de puntos que se cruzan en cero, la densidad de la distribución de los valores del campo de silencio dentro de la señal y la entropía espectral. Los sistemas de reconocimiento de voz tradicionales utilizan técnicas que se basan en las energías espectrales y transitorias de una señal (p. ej., detección de actividad de voz) para determinar los límites del habla a partir de las señales de voz entrantes [26–28].
Los principales parámetros de la señal de voz son la energía a corto plazo de la señal de voz y el número de puntos que pasan por cero. Por regla general, los parámetros de una señal de voz cambian rápidamente con el tiempo; por lo tanto, es habitual procesar una señal de voz en fragmentos de 10 a 30 ms de longitud que no se superponen. La señal de voz es estacionaria dentro de este rango, y las áreas de silencio en la señal de voz se eliminan calculando la energía transitoria. El algoritmo para resolver este problema se divide en N secuencias de 256 valores de energía a corto plazo de la siguiente señal de voz.
El cálculo de la energía de cada fragmento dividiendo la señal de voz es apropiado para computación paralela y distribuida. Cada fragmento se procesa de forma independiente. Si el procesamiento se aplica en un multiprocesador de n núcleos, será posible calcular la energía de n fragmentos simultáneamente. Por lo tanto, es posible aumentar la eficiencia del procesamiento paralelo durante esta etapa [29–32].
3.2. Número de cruces por cero
Un cruce por cero es un punto en el que cambia el signo de una función matemática (por ejemplo, de positivo a negativo), que se representa mediante una intersección del eje (valor cero) en el gráfico de la función [33]. La frecuencia de cruce por cero en una señal puede ser el indicador más directo de sus propiedades espectrales. Por ejemplo, el número de puntos que pasan por cero en una señal de voz se puede determinar mediante la siguiente ecuación:

Figura 1. Método de separación del habla basado en análisis de entropía espectral.
3.3. Filtrado Digital
Además de una señal útil típica, están presentes varios tipos de ruido. Dado que el ruido afecta negativamente a la calidad de los sistemas de reconocimiento de voz, tratar el ruido es un problema apremiante. Se utilizan dos tipos de filtros digitales para reducir los niveles de ruido en el sistema: un filtro de línea y un filtro inicial. Un filtro lineal puede considerarse una combinación de filtros de baja y alta frecuencia, ya que captura todas las frecuencias bajas y altas. El filtrado inicial se aplica para minimizar el impacto de las perturbaciones locales en las marcas características que se utilizan para la identificación posterior. Una señal de voz debe pasar a través de un filtro de paso bajo para la alineación espectral [35].
3.4. Segmentación
La segmentación es el proceso de dividir una señal de voz en fragmentos discretos que no se superponen. La señal generalmente se divide en unidades de habla, como oraciones, palabras, sílabas, fonemas o incluso unidades fonéticas más pequeñas. La segmentación de grabaciones que contienen las declaraciones de numerosos hablantes puede consistir en atribuir fragmentos de declaraciones a hablantes particulares. El término "estaciones de segmento" se utiliza a veces para referirse a una división de la señal de voz en tramas antes de su parametrización [36,37].
3.5. Transformación espectral
Es necesario distinguir las características principales de las señales de voz que se utilizan en las últimas etapas del proceso de reconocimiento de voz. Las características iniciales se determinan analizando las propiedades espectrales de las señales de voz. El algoritmo de transformada rápida de Fourier se usa comúnmente para obtener la frecuencia espectral de una señal de voz [38,39].
3.6. Normalización de Frecuencias Espectrales
Todo el proceso computacional en algoritmos inteligentes se basa en mover números decimales. Por lo tanto, los parámetros de los objetos que se clasifican mediante redes neuronales se limitan al rango [{{0}}.0, 1.0]. El espectro resultante se normaliza entre 0 y 1 para aplicar el procesamiento espectral utilizando la red neuronal. Para lograr esto, cada componente del vector se divide en sus componentes máximos.
Los métodos de procesamiento espectral permiten el uso de todas las muestras de datos que se obtienen de la señal de voz. Muchas señales de voz tienen una estructura de frecuencia y propiedades espectrales específicas. Los métodos espectrales proporcionan un procesamiento de alta precisión de las señales de voz. Las desventajas del procesamiento espectral incluyen baja flexibilidad en las características locales de las señales, falta de dimensiones espectrales y costos computacionales relativamente altos.
La transformación de Fourier, el análisis de ondículas y muchos otros algoritmos se utilizan ampliamente en el procesamiento espectral de señales de voz. La transformación de Fourier se utiliza en muchos campos de la ciencia, incluido el procesamiento del habla. En el procesamiento de señales de voz, la transformación de Fourier convierte la señal del campo de tiempo al campo espectral como un componente de frecuencia [40].
En estudios anteriores, se aplicaron la transformada de Fourier discreta (DFT), la transformada de coseno discreta (DCT), la transformada de Fourier a corto plazo y la transformada wavelet para el análisis espectral. Estos métodos se utilizaron para transformar fragmentos de una señal de voz en el dominio de la frecuencia y calcular el espectro. Los paquetes TBB y OpenMP se utilizaron para crear algoritmos paralelos para transformaciones espectrales. En estos métodos, el comando divide la señal en cuadros; por ejemplo, N=16, 32, … o 4096 para cada fotograma [4]. El tamaño de cada cuadro creado es igual al tamaño de bloque de la memoria caché porque la memoria caché es un factor que afecta la eficiencia del procesamiento paralelo. Los resultados de la aceleración se muestran en la Figura 2.

Figura 2. Resultados de aceleración para (a) procesadores de cuatro y (b) ocho núcleos.
Para la implementación del software de los algoritmos de procesamiento en paralelo, se realizó procesamiento en serie y en paralelo en procesadores de cuatro y ocho núcleos, los cuales se aplicaron utilizando computadoras personales y servidores, como se indica en la Tabla 1.
Tabla 1. Características de los procesadores Intel.

La característica principal del algoritmo DCT es la periodicidad. Una ventaja de DCT es que tiende a concentrar la mayor parte de la energía de la señal en una pequeña cantidad de factores. Las siguientes ecuaciones proporcionan los elementos de la matriz de coeficientes:


donde L(k) es el valor de la DCT, k es un índice de coeficientes, x(n) representa elementos de datos y N es el tamaño del marco.
Los parámetros del análisis de Fourier son la base de los métodos que se utilizan para generar vectores de características en la mayoría de los sistemas de reconocimiento de voz en el procesamiento digital de señales de voz dentro del dominio espectral. Los coeficientes cepstrales de frecuencia Mel (MFCC) [41] y las técnicas de codificación predictiva lineal (LPC) [42,43] se utilizan en el análisis de Fourier para generar imágenes de espectrograma a partir de señales de voz. Los espectros que se obtienen mediante el análisis de Fourier brindan información concisa y precisa sobre una señal de voz, como se ilustra en la Figura 3.

Figura 3. DFT: (a) cambio en el rango de frecuencia dentro del dominio del tiempo y (b) espectrograma.
Se utilizaron señales bidimensionales (2D) para el análisis espectral en los experimentos. Las características del análisis espectral 2D que se utilizan en los algoritmos de procesamiento de imágenes en paralelo son adecuadas para el procesamiento en paralelo en procesadores multinúcleo [38]. En particular, los vectores y matrices de transformación directa e inversa tienen dimensiones binarias, y la compatibilidad de esta arquitectura de procesador multinúcleo puede aumentar efectivamente la velocidad computacional. Por lo tanto, aplicamos procesamiento secuencial y paralelo en una computadora con diferentes características de procesador para la implementación de hardware de los algoritmos que se usaron para procesar señales 2D (Tabla 2)
Tabla 2. Características de aplicar procesadores Intel.

Toda la señal 2D se dividió en fragmentos idénticos de diferentes tamaños en cada etapa [44]. Los valores de los fragmentos seleccionados estuvieron entre resoluciones de píxeles de 16 × 16 y 1024 × 1024. La velocidad del algoritmo DCT paralelo usando el paquete OpenMP en comparación con la del algoritmo secuencial se presenta en la Figura 4 El uso de un análisis espectral 2D paralelo El algoritmo en procesadores multinúcleo produce un resultado de overclocking cercano al número de núcleos.

Figura 4. Resultados de aceleración para análisis espectral paralelo 2D.






