Extração aprimorada de parâmetros de recursos de sinais de fala usando algoritmo de aprendizado de máquina (2)
May 30, 2023
3.7. Conjunto de dados Os processos de coleta e geração de conjuntos de dados foram executados da seguinte forma. Neste estudo, o conjunto de dados com 120 h de áudio foi utilizado para o treinamento do modelo. O conjunto de dados inclui gravações de áudio de fala que consistem em frases com no máximo 15 palavras com duração total de aproximadamente 120 h.

Ginseng do deserto
Além disso, o conjunto de dados inclui uma grande quantidade de texto diferente para uso no desenvolvimento do modelo de linguagem. Foram coletados mais de 90.650 enunciados, 415.780 palavras e 65.810 palavras únicas que foram incluídas no corpus de texto, resultando em cerca de 120 horas de dados de fala transcritos. Dividimos o conjunto de dados em conjuntos de treinamento, validação e teste. As estatísticas do conjunto de dados
são relatados na Tabela 3.
Tabela 3. As especificações do conjunto de dados.

Dividimos o conjunto de dados em três pastas correspondentes aos conjuntos de treinamento, validação e teste. Cada pasta contém gravações de áudio e transcrições. Os nomes dos arquivos de áudio e transcrição correspondentes são os mesmos, exceto que as gravações de áudio são armazenadas como arquivos WAV, enquanto as transcrições são armazenadas como arquivos TXT usando a codificação UTF-8. Todas as transcrições são representadas usando o alfabeto latino composto por 29 letras e o símbolo do apóstrofo. Para evitar o overfitting, aplicamos técnicas de aumento de dados com base na perturbação da velocidade e no aprimoramento espectral.

Cistanche deserticola
4. Método proposto
Uma tarefa importante para os programadores ao desenvolver sistemas de reconhecimento de voz é a criação de um método ótimo para a expressão paramétrica dos sinais de fala [45]. Este método permite uma excelente separação de sons e palavras faladas, garantindo que os alto-falantes sejam insensíveis aos padrões de pronúncia e mudanças no ambiente acústico. A maioria dos erros no reconhecimento de palavras é causada por uma mudança no tom do sinal devido a uma mudança no microfone ou uma diferença no tom da pronúncia [46]. Outra causa comum de erros são as deformações não lineares aleatórias da forma do espectro, que estão sempre presentes no sinal de fala de um falante [47,48]. Portanto, uma das tarefas mais importantes na criação de sistemas eficazes de reconhecimento de fala é a seleção de uma representação que seja suficiente para o conteúdo do sinal analisado, bem como insensível às vozes dos falantes e vários ambientes acústicos.

Suplemento Cistanche perto de mim - Melhorando a Memória
O sistema usado para extrair parâmetros de recursos geralmente possui os seguintes requisitos. O conteúdo da informação, ou seja, o conjunto de parâmetros de características, deve garantir a identificação confiável dos elementos de fala reconhecíveis. Além disso, o loudness, ou seja, a compressão máxima do sinal de áudio, e a correlação não estatística dos parâmetros devem ser minimizados. A independência do locutor também deve ser alcançada, ou seja, a remoção máxima de informações relativas às características do locutor do vetor de caracteres. Finalmente, a homogeneidade, que se refere aos parâmetros com a mesma variância média e a capacidade de usar métricas simples para determinar a afinidade entre conjuntos de caracteres, deve ser fornecida [49]. No entanto, nem sempre é possível satisfazer todos os requisitos simultaneamente porque tais requisitos são contraditórios. A descrição paramétrica dos elementos da fala deve ser suficientemente detalhada para distingui-los de forma confiável e deve ser o mais lacônica possível.

Superman ervas cistanche
Na prática, o sinal de fala recebido de um microfone é digitalizado a uma taxa de amostragem de 8 a 22 kHz. Valores numéricos seriais são divididos em fragmentos de fala (quadros) com duração de 10 a 30 ms, que correspondem a partes de fala quase estacionárias. Um vetor de recursos é calculado a partir de cada quadro, que é posteriormente usado no nível acústico do reconhecimento de fala. Atualmente, uma ampla variedade de métodos está disponível para a representação paramétrica de sinais com base na análise de autocorrelação, filtragem linear de hardware, análise espectral e LPC. A abordagem mais comum para a parametrização da fala é a análise espectral de fragmentos de sinal e o cálculo de seus coeficientes cepstrais.
Os MFCCs têm sido usados como recursos informativos para o sinal de fala [41]. Essas características são amplamente utilizadas no reconhecimento de fala e são baseadas em dois conceitos principais: as escalas cepstral e Mel. As principais vantagens do algoritmo são seu alto nível de familiaridade e facilidade de fala. Os recursos do MFCC são separados dos sinais de fala gravados. O algoritmo MFCC usa os resultados dos algoritmos de comutação de espectro e fonograma. O algoritmo clássico usado para calcular os MFCCs é representado na Figura 5.

Figura 5. Esquema clássico para cálculo de MFCCs.
Este estudo apresenta um método rápido para extrair os parâmetros de função de um sinal de fala. O algoritmo proposto para o cálculo rápido dos MFCCs é mostrado na Figura 6.

Figura 6. Estrutura proposta para calcular MFCCs.
Consideramos a sequência de execução do algoritmo proposto para a extração rápida dos parâmetros da função de um sinal de fala
4.1. Divisão em Quadros
Após a filtragem preliminar, o sinal de fala é dividido em quadros de 16 ms. Cada quadro (exceto o primeiro) contém os 10 ms finais do quadro anterior. Este processo continua até o final do sinal. Neste estudo, como a taxa de amostragem do sinal de fala é de 16 kHz, o comprimento do quadro é N=256 e o comprimento do deslocamento é M=160. A sobreposição é de 62,5% do comprimento do quadro. Uma cobertura de 50 por cento a 75 por cento do comprimento do quadro é geralmente recomendada.
4.2. Janela de Hanning e valores decrescentes
Um tamanho de janela Hanning de 1D foi usado. A janela de Hanning também é chamada de janela de cosseno elevado. A janela de Hanning pode ser considerada como a soma do espectro de frequência de três janelas de tempo retangulares. Ele pode usar os lóbulos laterais para cancelar uns aos outros, eliminando a interferência de alta frequência e o vazamento de energia. Janelas Hanning são funções de janela muito úteis.

Suplemento Cistanche perto de mim - Melhorando a Memória
Clique aqui para ver os produtos Cistanche melhorando a memória e prevenindo a doença de Alzheimer
【Peça mais】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Uma caixa de peso é usada para reduzir a distorção e suavizar os quadros individuais. O sinal flutuante examinado neste estudo consiste em um tom denso. A magnitude do tom bemol é determinada pela magnitude do tom puro na frequência f, que é filtrada pela janela de Hanning.
Um aspecto crítico dessa janela é que ela define as bordas dos quadros como zero. Neste caso, as energias curtas podem ser calculadas ao passar pela janela e podem ser transferidas da sequência que é usada para calcular as energias de menor amplitude. O objetivo é remover sinais de baixa energia do sinal calculando a energia do sinal enquanto suaviza o sinal dessa janela. Este processo requer a seguinte equação de energia de sinal:

onde En é a energia do fragmento do sinal de entrada e xi é o valor do sinal.
Além do processo de janela usando (11), o sinal é processado na próxima etapa, o que reduz significativamente o número de valores que entram no processador. A Figura 7 apresenta o algoritmo de processamento paralelo.
O tamanho da janela representa um número de amostras e uma duração. É o principal parâmetro da análise. O tamanho da janela depende da frequência fundamental, intensidade e mudanças no sinal.

Figura 7. Algoritmo da janela de Hanning para remover partes silenciosas. 4.3. Interruptores de Transformada de Fourier de Tempo Curto (STFT) Existe uma compreensão intuitiva do significado de uma altura alta ou baixa. STFT é uma transformada de Fourier usada para determinar a frequência senoidal e o conteúdo de fase de seções locais de um sinal à medida que ele muda ao longo do tempo. Na prática, o cálculo STFT envolve a divisão de um sinal de tempo mais longo em segmentos mais curtos de comprimento igual, seguido por um cálculo separado da transformada de Fourier em cada segmento mais curto. Isso revela o espectro de Fourier de cada segmento mais curto. Sinais de tempo discreto são usado na prática. A conversão tempo-frequência correspondente é uma conversão discreta de Fourier, que descreve o comprimento do sinal Xn como representativo do domínio da frequência de valor complexo dos N coeficientes. STFT, que descreve a evolução dos componentes de frequência ao longo do tempo, é uma das ferramentas mais utilizadas para análise e processamento de fala [50]. Semelhante ao próprio espectro, uma vantagem do STFT é que seus parâmetros têm interpretações físicas e intuitivas. A STFT é normalmente visualizada usando os espectros de log 20log10 (X(h, k)). Esses espectros de log 2D podem então ser visualizados usando um mapa térmico conhecido como espectrograma. Na terceira etapa do algoritmo, o procedimento de comutação espectral STFT é aplicado aos quadros que passam pela janela de pesos. A STFT do sinal é obtida abrindo as janelas e determinando a DFT de cada janela. Em particular, a transformação para as janelas Xn e Wn do sinal de entrada é determinada da seguinte forma:

onde o k-index corresponde aos valores de frequência e wn é a função da janela, que geralmente é uma janela de Hanning ou uma janela Gaussiana centrada em torno de zero.
4.4. Mel Transform
Na quarta etapa, o sinal que é transferido para a banda de frequência é dividido em faixas por filtros triangulares. Os limites do filtro são calculados usando a frequência de giz. A transição para o campo de frequência de giz é baseada na seguinte equação:

onde f é a faixa de frequência.
A chave reversa é determinada da seguinte forma:

Considere NN como o número de fifilters (geralmente são usados 26 fifilters) e flflows, tão altos quanto a faixa de frequência em estudo. Este intervalo é transferido para a escala Mel e dividido em NN intervalos de interseção distribuídos uniformemente. Os limites lineares apropriados à frequência são determinados dentro do fifield, enquanto os coeficientes de ponderação que são obtidos com base na filtração são denotados por H. Posteriormente, os fifilters são aplicados ao módulo quadrado dos coeficientes obtidos da transformada de Fourier. Os valores obtidos são logarítmicos devido à seguinte expressão:

O algoritmo de decomposição de valor singular é implementado na etapa final do cálculo dos MFCCs.
5. Resultados Experimentais
Implementamos e testamos o método proposto no Visual Studio 2019 C plus plus em um PC com CPU de 4,90 GHz, 32 GB de RAM e duas GPUs Nvidia GeForce 2080Ti, conforme Tabela 4. O sistema foi testado em diferentes ambientes de dispositivos para avaliar o desempenho do método de extração de características de sinal. Nos experimentos, durante a operação do algoritmo (Figura 8), quando a sequência de superfícies do sinal era n=15, o número de valores foi reduzido em 40–50 por cento e o tempo de processamento aumentou 1. 2-dobre. Consequentemente, este algoritmo exibiu eficiência significativamente maior. Além disso, esse algoritmo permitiu a separação e eliminação de áreas de silêncio durante a passagem pela janela de Hanning.
Vários meios possíveis estão disponíveis para evitar o desperdício de largura de banda de memória. Propomos uma nova solução que aumenta o desempenho da computação combinando o tamanho dos quadros de sinal com um tamanho de bloco de memória cache. Esse tipo de otimização pode afetar significativamente o desempenho geral do processamento paralelo. No entanto, pode ser usado no processamento de sinal digital, dividindo o sinal em quadros por meio de implementações em processadores multicore. Porém, na prática, a seleção costuma ser realizada em pequena escala, correspondendo à largura do barramento de dados que conecta a memória cache à memória principal e ao tamanho do seu bloco. Nosso método implementa o uso ótimo dessas memórias em computação paralela. A organização da memória cache desempenha um papel essencial nos algoritmos de processamento paralelo ao dividir os dados em fluxos. Em particular, a presença de efeitos vetor-matriz no processamento de sinal digital e o tamanho de seus fluxos devem ser ajustados de acordo com o tamanho dos blocos de cache. Isso pode ser alcançado usando o método proposto, conforme ilustrado na Figura 9.
Tabela 4. As especificações detalhadas da configuração experimental.


figura 8. (a) Sinal de entrada inicial e (b) aparência do sinal após a aplicação do algoritmo proposto.

Figura 9. Estrutura de computação paralela usando processadores RK3288.
Nesta seção, discutimos uma análise quantitativa para comparar o desempenho de diferentes sistemas. Comparamos nosso método com algoritmos de reconhecimento de fala bem conhecidos baseados em abordagens de aprendizado profundo. Métricas de avaliação são essenciais para calcular várias estratégias de reconhecimento de fala e avaliar o desempenho de diferentes abordagens. Embora tenhamos usado os resultados de outros estudos para comparação, não temos certeza se eles são verdadeiros porque os códigos-fonte e conjuntos de dados desses métodos não estão disponíveis publicamente para verificar o desempenho real. A Figura 10 representa o resultado da remoção das partes silenciosas durante a passagem de um fragmento de sinal de fala através da janela Hanning com base no algoritmo rápido proposto. Os resultados de velocidade obtidos com a análise são apresentados na Tabela 5.

Figura 10. Valor k do algoritmo KNN (com seleção de atributos).
Tabela 5. Resultados experimentais do método proposto.

Um intervalo foi determinado para encontrar o grau da vizinhança que fornece o melhor valor de precisão no algoritmo KNN. O intervalo especificado abrange 1–25. Na Figura 10, foi aplicado o grafo do algoritmo KNN com seleção de características. Quando o gráfico foi examinado, quando o valor da vizinhança era 1 no início, a precisão do treinamento foi muito maior do que a precisão do teste. No algoritmo KNN criado usando os recursos selecionados por correlação, a precisão do modelo foi determinada como 99,15% no conjunto de dados de treinamento e 97,35% no conjunto de dados de teste.
A taxa de erro de palavra (WER) ou taxa de erro de caractere é normalmente usada para avaliar a precisão da extração de recursos de um sinal de fala. Estas são matrizes objetivas que são úteis para uma comparação justa das técnicas de reconhecimento. Em nossos estudos anteriores [51–56], calculamos métricas como a medida F (FM), precisão e revocação. O FM é a média ponderada que equilibra as medições entre as taxas de precisão e recuperação. A precisão é a razão entre o número de observações positivas previstas corretamente e o número total de observações positivas previstas. A recordação é a razão entre o número de observações positivas previstas corretamente e o número total de observações na classe real, conforme indicado em (9). As seguintes equações podem ser usadas para calcular a precisão média e as taxas de recuperação dos métodos de extração de recursos:

onde TP denota o número de verdadeiros positivos, FP denota o número de falsos positivos e FN denota o número de falsos negativos.
O FM é calculado usando (10), considerando tanto a precisão quanto a revocação.

O FM médio, recall e precisão do método proposto foi de 98,4%. A falsa detecção ocorreu em 1,6 por cento dos casos devido ao ruído indesejado de sinais no microfone. A faixa de precisão do modelo estava entre 0 e 1, e as pontuações de estimativa métrica atingiram seus melhores valores em 1. Uma avaliação de nosso método e de outros métodos de extração de recursos de fala publicados recentemente é apresentada na Tabela 6. O mesmo número de recursos foi usado para uma comparação justa. Um total de 325 amostras de fala de cada grupo foram analisadas a partir de indivíduos com antecedentes de recursos semelhantes. Os efeitos de diferentes comprimentos de quadros de acordo com o número de bancos de filtros no MFCC e diferentes comprimentos de quadros na ordem do LPC também foram examinados para maior precisão.
Tabela 6. Resultados de precisão quantitativa da extração de recursos de fala.

Como mencionado anteriormente, o WER é a medida mais comum para o desempenho do reconhecimento de fala. É calculado comparando uma transcrição de referência com a saída do reconhecedor de fala. Com base nessa comparação, é possível calcular o número de erros, que normalmente pertencem a três categorias: (1) inserções quando uma palavra não está presente na referência na saída do reconhecimento automático de fala (ASR), (2) exclusões quando uma palavra é perdida na saída ASR e (3) substituições quando uma palavra é confundida com outra palavra. O WER pode ser calculado da seguinte forma.

onde S é o número de substituições de palavras que são reconhecidas incorretamente, D é o número de exclusões, I é o número de inserções e N é o número de palavras na transcrição de referência. O principal problema no cálculo dessa pontuação é o alinhamento entre as sequências de duas palavras. Isso pode ser determinado por meio de programação dinâmica usando a distância de Levenshtein [67].
Com base na Tabela 6, realizamos uma análise estatística para indicar a precisão média dos métodos comparados usando a métrica de avaliação WER, conforme ilustrado na Figura 11. O extrator de recursos aprimorado rendeu uma precisão de aproximadamente 98,4 por cento, enquanto as outras abordagens renderam precisões entre 78 por cento e 96 por cento. Usamos os resultados fornecidos nos artigos relevantes para comparação; no entanto, a precisão desses valores não é facilmente verificável porque os códigos-fonte e conjuntos de dados desses métodos não estão disponíveis publicamente para confirmar seu desempenho real. No entanto, no caso de cenas padrão, o método proposto demonstrou experimentalmente fornecer excelente precisão de extração de recursos de fala, reduzindo o tempo computacional, mesmo quando os dados de fala são ruidosos ou de baixa qualidade.

Figura 11. Resultados quantitativos das abordagens de extração de características do sinal de fala usando gráficos verticais.
Além disso, avaliamos os resultados falso-positivos dos métodos selecionados. Como pode ser observado na Figura 12, a abordagem proposta apresentou o menor número de erros. Além disso, o método de computação paralela altamente eficiente reduziu significativamente os erros de seleção e extração de características do sinal sonoro. O overfifitting foi um dos principais problemas durante o treinamento e quase todos os modelos de aprendizado de máquina sofrem com isso. Tentamos reduzir o risco de superajuste usando uma técnica de seleção de recursos que visa, em vez disso, classificar a importância dos recursos existentes no conjunto de dados e descartar os menos importantes (nenhum novo recurso é criado).

Figura 12. Resultados visíveis de experimentos de extração de características de sinal de fala falso-positivo.
A Tabela 7 apresenta os resultados de desempenho dos métodos utilizados em ambientes de reconhecimento de fala com base em diferentes propriedades. Nossa abordagem proposta não sofre de ruído de fundo indesejado e desnecessário e não é afetada por vozes humanas de baixa qualidade, como vozes roucas, vozes produzidas com dor de garganta ou mesmo sons de humanos com perda total da voz. Nosso método visa superar os problemas de equipamento de gravação inadequado, ruído de fundo, sotaques e dialetos difíceis e vários tons de voz. Em um ambiente normal, os melhores resultados para detectar e extrair com precisão os desafios de recursos de fala foram obtidos usando o método proposto com um tempo de processamento reduzido.
Tabela 7. Revisão da detecção de recursos de fala e desempenho de extração usando vários recursos.

Os resultados dos métodos de reconhecimento de fala foram classificados como potentes, normais ou fracos para as sete categorias. O poderoso critério demonstra que o algoritmo pode superar todos os tipos de desafios. Em contraste, o critério normal indica que o algoritmo pode falhar em certas instâncias porque os limites da palavra não são definidos de antemão. Finalmente, o critério fraco sugere que o algoritmo não é confiável sob ruído ou vibrações de fundo.
6. Limitações
É difícil concluir que os métodos propostos até agora não apresentam deficiências. Nosso método proposto também pode resultar em erros devido a vários ambientes de ruído. Para superar esse problema, buscamos reduzir o número de feições no conjunto de dados criando novas feições a partir de feições existentes [69]. Como o overfitting era um dos principais problemas para treinar diferentes modelos durante a competição, enriquecer os dados de treinamento adicionando amostras de dados de diferentes recursos poderia ser uma possível solução para melhorar os resultados. Independentemente dos problemas mencionados, os resultados experimentais revelaram que nosso método foi muito robusto e eficaz para tarefas de extração de recursos de fala, com uma precisão média de 98,4 por cento e FM de 99,5 por cento.
7. Conclusões
Uma nova abordagem de computação paralela de alto desempenho usando um método de aprendizado de máquina foi proposta para sistemas de reconhecimento de fala. Problemas de aceleração em máquinas com recursos computacionais limitados podem ser resolvidos usando sistemas distribuídos. A velocidade de computação em sistemas de reconhecimento de sinal pode ser aumentada e o desempenho de plataformas multicore pode ser melhorado criando e usando algoritmos rápidos e eficientes. Os resultados demonstram que o modelo proposto reduz o tempo de processamento e melhora a precisão da extração de características em 98,4 por cento usando efetivamente MFCCs. Observou-se que as características com baixos valores de correlação extraídas por seleção de características também são efetivas no sucesso do modelo. A análise estatística foi realizada nos dados pré-processados e informações significativas foram produzidas a partir dos dados usando o algoritmo de aprendizado de máquina K-vizinhos mais próximos (KNN).
Estudos futuros se concentrarão em melhorar a precisão de nosso método usando abordagens de aprendizado profundo e otimizando a memória cache de processadores multicore para detectar e extrair sinais de fala sem uma perda significativa de qualidade. Além disso, planejamos construir um modelo de análise espectral baseado em processamento paralelo com desempenho de análise robusto que permitirá o estabelecimento de dispositivos embarcados com baixos recursos computacionais usando conjuntos de dados de fala Taris [70] no ambiente 3D CNN e 3D U-Net [71– 75]
Referências
1. Meng, YJ; Liu, WJ; Zhang, RZ; Du, HS Speech Feature Parameter Extraction and Recognition Based on Interpolation. Appl. Mec. Mate. 2014, 602–605, 2118–2123. [CrossRef] 2. Musaev, M.; Rakhimov, M. Treinamento acelerado para redes neurais convolucionais. Nos Anais da Conferência Internacional de 2020 sobre Ciência da Informação e Tecnologias de Comunicação (ICISCT), Tashkent, Uzbequistão, 4–6 de novembro de 2020; pp. 1–5. [CrossRef] 3. Sim, F.; Yang, J. Um modelo de rede neural profunda para identificação de alto-falante. Appl. ciência 2021, 11, 3603. [CrossRef] 4. Musaev, M.; Rakhimov, M. Um método de mapear um bloco de memória principal para cache em processamento paralelo do sinal de fala. Nos Anais da Conferência Internacional de 2019 sobre Ciência da Informação e Tecnologias de Comunicação (ICISCT), Karachi, Paquistão, 9–10 de março de 2019; pp. 1–4. [CrossRef] 5. Jiang, N.; Liu, T. Uma segmentação de fala aprimorada e algoritmo de agrupamento baseado em SOM e k-means. Matemática. Problema Eng. 2020, 2020, 3608286. [CrossRef] 6. Hu, W.; Yang, Z.; Chen, C.; Sol, B.; Xie, Q. Uma abordagem de segmentação de vibração para o sistema multiação de torre de controle numérico. Processo de vídeo de imagem de sinal. 2021, 16, 489–496. [CruzRef]
7. Popescu, TD; Aiordachioaie, D. Detecção de falhas de rolamentos de elementos rolantes usando segmentação ótima de sinais vibratórios. Mec. Sist. Processo de sinal. 2019, 116, 370–391. [Ref] 8. Shihab, MSH; Aditya, S.; Setu, JH; Imtiaz-Ud-Din, KM; Efat, MIA Uma técnica híbrida de extração de recursos GRU-CNN para identificação de alto-falantes. Nos Anais da 2020 23ª Conferência Internacional sobre Computação e Tecnologia da Informação (ICCIT), Dhaka, Bangladesh, 19–21 de dezembro de 2020; pp. 1–6. [CrossRef] 9. Korkmaz, O.; Atasoy, A. Reconhecimento de emoção do sinal de fala usando coeficientes cepstrais de frequência mel. Nos Anais da 9ª Conferência Internacional de Engenharia Elétrica e Eletrônica (ELECO), Bursa, Turquia, 26–28 de novembro de 2015; pp. 1254–1257. 10. Ayvaz, U.; Gürüler, H.; Khan, F.; Ahmed, N.; Whangbo, T.; Abdusalomov, A. Reconhecimento automático de alto-falante usando coeficientes cepstral de frequência Mel por meio de aprendizado de máquina. CMC-Computação. Mate. Contin. 2022, 71, 5511–5521. 11. Al-Qaderi, M.; Lahamer, E.; Rad, A. Um sistema de identificação de alto-falante de dois níveis por meio da fusão de classificadores heterogêneos e cooperação de recursos complementares. Sensors 2021, 21, 5097. [CrossRef] 12. Batur Dinler, Ö.; Aydin, N. Um conjunto de parâmetros de recurso ideal baseado em redes neurais recorrentes de unidade recorrente fechada para detecção de segmento de fala. Appl. ciência 2020, 10, 1273. [CrossRef] 13. Kim, H.; Shin, JW Aprimoramento de fala com microfone duplo baseado em TF-GSC com supressão de vazamento e recuperação de sinal. Appl. ciência 2021, 11, 2816. [CrossRef] 14. Lee, S.-J.; Kwon, H.-Y. Uma estratégia de pré-processamento para remoção de ruído de dados de fala com base na detecção de segmento de fala. Appl. ciência 2020, 10, 7385. [CrossRef] 15. Rusnac, A.-L.; Grigore, O. CNN Arquiteturas e métodos de extração de recursos para reconhecimento de fala imaginária EEG. Sensors 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; Khan, MQ; Malik, F.; Abdusalomov, AB; Cho, YI; Odarchenko, R. O impacto da metodologia ágil no sucesso do projeto, com um papel moderador do ajuste do trabalho da pessoa na indústria de TI do Paquistão. Appl. ciência 2022, 12, 10698. [CrossRef] 17. Aggarwal, A.; Srivastava, A.; Agarwal, A.; Chahal, N.; Singh, D.; Alnuaim, AA; Alhadlaq, A.; Lee, H.-N. Extração de recursos bidirecionais para reconhecimento de emoções de fala usando aprendizado profundo. Sensors 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; Vanello, N.; Fanucci, L. Otimizando os parâmetros de extração de recursos dependentes do locutor para melhorar o desempenho do reconhecimento automático de fala para pessoas com disartria. Sensors 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; Jain, A.; Sharma, AK; Almustafa, KM Phonocardiogram Signal Based Multi-Class Cardiac Diagnostic Decision Support Syste. IEEE Access 2021, 9, 110710–110722. [CrossRef] 20. Mohtaj, S.; Schmitt, V.; Möller, S. Um modelo baseado em extração de recursos para identificação de discurso de ódio. arXiv 2022, arXiv: 2201.04227. 21. Kuldoshbay, A.; Abdusalomov, A.; Mukhiddinov, M.; Baratov, N.; Makhmudov, F.; Cho, YI Uma melhoria para o método de classificação automática para imagens de ultrassom usadas na CNN. Int. J. Wavelets Multiresolução Inf. Processo. 2022, 20, 2150054. 22. Passricha, V.; Aggarwal, RK Um híbrido de deep CNN e LSTM bidirecional para reconhecimento automático de fala. J. Intel. Sist. 2020, 29, 1261–1274. [CrossRef] 23. Mukhamadiyev, A.; Khujayarov, I.; Djuraev, O.; Cho, J. Método de Reconhecimento Automático de Fala Baseado em Abordagens de Deep Learning para a Língua Uzbeque. Sensors 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; Liu, M.; Zhao, Y.; Kong, L.; Dong, L.; Liu, X.; Hui, M. Extração de características e classificação do som do coração usando redes neurais convolucionais 1D. EURASIP J. Adv. Processo de sinal. 2019, 2019, 59. [CrossRef] 25. Chang, L.-C.; Hung, J.-W. Um estudo preliminar da extração robusta de recursos de fala com base na maximização da probabilidade de estados em modelos acústicos profundos. Appl. Sist. inov. 2022, 5, 71. [CrossRef] 26. Ramírez, J.; Górriz, JM; Segura, JC Detecção de Atividade de Voz. Fundamentos e Robustez do Sistema de Reconhecimento de Voz. Em reconhecimento e compreensão de fala robustos; Grimm, M., Kroschel, K., Eds.; I-TECH Education and Publishing: Londres, Reino Unido, 2007; pp. 1–22. 27. Oh, S. DNN Baseado em extração robusta de recursos de fala e método de remoção de ruído de sinal usando filtro LMS de previsão média aprimorado para reconhecimento de fala. J. Converg. Inf. Tecnol. 2021, 11, 1–6. [Ref] 28. Abbaschian, BJ; Sierra-Sosa, D.; Elmaghraby, A. Técnicas de Deep Learning para Reconhecimento de Emoções de Fala, de Bancos de Dados a Modelos. Sensors 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; Mamadjanov, D.; Mukhiddinov, A. Uma Abordagem Paralela de Alto Desempenho para Processamento de Imagens em Computação Distribuída. Nos Anais da 14ª Conferência Internacional IEEE 2020 sobre Aplicação de Tecnologias de Informação e Comunicação (AICT), Uzbequistão, Tashkent, 7–9 de outubro de 2020; pp. 1–5. [CrossRef] 30. Abdusalomov, A.; Mukhiddinov, M.; Djuraev, O.; Khamdamov, U.; Whangbo, TK Extração Automática de Objetos Salientes Baseada em Limiares Adaptativos Localmente para Gerar Gráficos Táteis. Appl. ciência 2020, 10, 3350. [CrossRef] 31. Abdusalomov, A.; Whangbo, TK Uma melhoria para o método de reconhecimento de primeiro plano usando a técnica de remoção de sombra para ambientes internos. Int. J. Wavelets Multiresolução Inf. Processo. 2017, 15, 1750039. [CrossRef] 32. Abdusalomov, A.; Whangbo, TK Detecção e remoção de sombras de objetos em movimento usando geometria e informações de cores para fluxos de vídeo internos. Appl. ciência 2019, 9, 5165. [CrossRef] 33. Mery, D. Computer Vision for X-ray Testing; Springer International Publishing: Cham, Suíça, 2015; pág. 271, ISBN 978-3319207469. 34. Mark, S. As imagens da fala recalibram os limites da percepção da fala. Às dez. Perceba. Psychophys. 2016, 78, 1496–1511. [CrossRef] 35. Mudgal, E.; Mukuntharaj, S.; Modak, MU; Rao, YS Reconhecimento de fala em tempo real baseado em modelo usando filtros digitais em DSP-TMS320F28335. Nos Anais da Quarta Conferência Internacional de 2018 sobre Controle e Automação de Comunicações Computacionais (ICCUBEA), Pune, Índia, 16–18 de agosto de 2018; pp. 1–6. [CruzRef]






