Novo Reconhecimento de Linguagem de Sinais Espaço-Temporal Contínua Usando Uma Rede Atentiva Multifuncional(1)

Jun 01, 2023

Abstrato: Dados os fluxos de vídeo, nosso objetivo é detectar corretamente os sinais não segmentados relacionados ao reconhecimento contínuo da linguagem de sinais (CSLR). Apesar do aumento dos métodos de deep learning propostos nesta área, a maioria deles se concentra principalmente em usar apenas um recurso RGB, seja a imagem full-frame ou detalhes de mãos e rosto. A escassez de informações para o processo de treinamento CSLR restringe fortemente a capacidade de aprender vários recursos usando quadros de entrada de vídeo. Além disso, explorar todos os quadros em um vídeo para a tarefa CSLR pode levar a um desempenho abaixo do ideal, pois cada quadro contém um nível diferente de informação, incluindo os principais recursos na inferência de ruído. Portanto, propomos um novo reconhecimento de linguagem de sinais contínua espaço-temporal usando a rede multifuncional atenta para aprimorar o CSLR, fornecendo recursos de ponto-chave extras. Além disso, exploramos a camada de atenção nos módulos espacial e temporal para enfatizar simultaneamente vários recursos importantes. Os resultados experimentais de ambos os conjuntos de dados CSLR demonstram que o método proposto atinge um desempenho superior em comparação com os métodos atuais de última geração em 0,76 e 20,56 para a pontuação WER nos conjuntos de dados CSL e PHOENIX, respectivamente.

Desert living cistanche

Superman ervas cistanche

Palavras-chave: língua de sinais contínua; espacial; temporal; multifuncional; pontos chave; auto-atenção

1. Introdução

A Língua de Sinais prioriza a comunicação manual usando gestos de mão, linguagem corporal e movimentos labiais em vez de som para se comunicar [1,2]. Normalmente, a língua de sinais é usada por pessoas surdas ou com deficiência auditiva, mas também pode ser usada em situações em que é impossível ou difícil ouvir sons. Portanto, um sistema de reconhecimento de linguagem de sinais (SLR) é necessário, pois ajuda a conectar pessoas com deficiência auditiva e aquelas que não são.

Nos últimos anos, os pesquisadores concentraram muita atenção no SLR por causa da rica informação visual que ele fornece. Estudos recentes de SLR são geralmente agrupados em reconhecimento isolado de linguagem de sinais (ISLR) ou reconhecimento contínuo de linguagem de sinais (CSLR). Vários trabalhos abordam apenas ISLR [3,4], enquanto outros analisam apenas tarefas mais fáceis, como gestos estáticos para reconhecimento de alfabeto [5]. Enquanto isso, os métodos mais recentes são geralmente mais complicados, pois resolvem tarefas CSLR [6-8]. Comparado ao ISLR, o CSLR é um problema mais desafiador, pois envolve a reconstrução de sentenças.

Cistanche tea2

chá cistanche

Clique aqui para ver os produtos de chá Cistanche deserticola

【Peça mais】 E-mail:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

A pesquisa CSLR ainda é muito procurada porque sua implementação está intimamente relacionada às condições cotidianas do mundo real. Essa abordagem visa reconhecer a série de glosas que ocorrem em uma série de vídeos sem segmentação clara ou mesmo sem segmentação. Além disso, incorpora uma grande quantidade de pesquisa de aprendizado de máquina e uma compreensão completa do comportamento humano. Por exemplo, envolve rastreamento de movimento humano [9], reconhecimento de gestos [10] e reconhecimento facial [11]. No entanto, existem vários desafios para realizar tarefas CSLR.

Primeiro, a coleta e anotação de dados são caras para CSLR [12]. Este talvez seja um dos desafios enfrentados em seu desenvolvimento, uma vez que o CSLR está envolvido em uma grande rede e a quantidade de dados afeta fortemente o desempenho [13]. Além disso, vários conjuntos de dados disponíveis para língua de sinais são fracamente anotados [12,14,15]. Para resolver esse problema, vários estudos usaram uma abordagem fracamente supervisionada, juntamente com a aplicação de um alinhamento e um módulo extrator de recursos para a arquitetura de rede [12].

Em segundo lugar, em comparação com o ISLR, o CSLR é mais complicado. Informações suficientes são adquiridas usando vários recursos; isso provou alcançar melhor desempenho do que usar um único recurso, conforme relatado em trabalhos anteriores [16–18]. Essas múltiplas características consistem na característica principal que é uma imagem corporal que atinge a maior precisão e características adicionais, como pose, cabeça, mão esquerda e mão direita, que tem menor precisão para o desempenho individual [17,18]. O treinamento de uma grande rede com uma grande quantidade de dados é demorado [13]. Adicionar o fluxo de entrada também aumenta o tempo de treinamento, enquanto o uso de recursos adicionais baseados em imagem aumenta o custo [19]. Portanto, precisamos escolher características importantes para que possamos treinar com eficiência.

Cistanche deserticola slice (1)

erva chinesa cistanche

Em terceiro lugar, a entrada de vídeo possui um grande número de imagens na sequência. Algumas imagens têm um formato de mão pouco claro devido ao movimento rápido, possivelmente levando a informações incorretas. Portanto, nosso modelo proposto utiliza a autoatenção com base em [20] para ajudar a selecionar informações importantes. Além disso, a autoatenção comprovada por [21,22] tem impacto na melhoria do desempenho.

Portanto, propomos um novo modelo chamado romance multifuncional atento ao espaço-tempo (STAMF) para lidar com todos os problemas. Seguimos trabalhos anteriores [17,23], que provaram funcionar para CSLR com problemas de anotação fraca. Eles constroem o modelo usando três componentes principais: o primeiro é o módulo espacial, o segundo é o módulo temporal e o terceiro é o módulo de aprendizado de sequência. Propomos uma entrada multifuncional eficiente e eficaz usando o recurso de quadro completo junto com os recursos de ponto-chave para executar tarefas CSLR. O recurso full-frame representa a imagem do corpo como o recurso principal e os recursos de ponto-chave como o recurso adicional. O ponto chave é a pose do corpo, incluindo os detalhes da pose da mão. Essa pose corporal é o recurso adicional mais eficaz, pois em alguns trabalhos foi comprovado que ela atinge a maior precisão após o recurso full-frame [17,18]. Também utilizamos um módulo de atenção que usa auto-atenção com base em [20] para capturar o recurso importante e ajudar o aprendizado de sequência a melhorar o desempenho.

A contribuição deste manuscrito é resumida da seguinte forma: • Introduzimos uma nova atenção temporal no módulo de sequência para capturar os pontos de tempo importantes que contribuem para a saída final; • Apresentamos o recurso múltiplo que consiste no recurso de quadro completo do valor RGB do quadro como o recurso principal e os recursos de ponto-chave que incluem a pose do corpo com o detalhe da forma da mão como um recurso adicional para aprimorar o desempenho do reconhecimento do modelo; • Usamos a métrica WER para mostrar que nosso modelo STAMF proposto supera os modelos de última geração em ambos os conjuntos de dados de benchmark CSLR por meio dos experimentos.

cistanche—Improve memory4

Suplemento Cistanche perto de mim - Melhore a Memória

2. Trabalhos Relacionados

Houve vários avanços na tecnologia e muita pesquisa foi feita em SLR. Estudos anteriores [24-27] exploraram a possibilidade de usar ISLR que tem uma segmentação para cada palavra. Nos últimos anos, métodos baseados em aprendizado profundo têm sido usados ​​para extrair recursos usando redes convolucionais, 2D [28,29] ou 3D [30,31], por sua forte representação visual. A maioria das pesquisas iniciais sobre reconhecimento de linguagem de sinais centrou-se em ISLR com características multimodais [30-32], como RGB, mapas de profundidade e esqueletos, que fornecem um melhor desempenho.

Atualmente, o CSLR tornou-se mais popular, embora não tenha sido segmentado claramente entre cada palavra. Os primeiros trabalhos usam um extrator de recursos CNN [6,33] e HMM [34] para construir o alvo da sequência. Algumas pesquisas recentes para sistemas CSLR [17,23] incluíram três etapas principais na execução da tarefa de reconhecimento de problemas. Primeiro, eles conduziram a extração de características espaciais, depois a segmentação temporal e, finalmente, a síntese de sentenças com um modelo de linguagem [35], ou usaram o aprendizado de sequência [17,23]. Esse aprendizado de sequência usou Bi-LSTM e CTC para explorar a relação entre o brilho do sinal nas sequências de vídeo. Apesar de usar uma anotação fraca que possui sequências de vídeo não segmentadas para definir as glosas do sinal, essas abordagens têm mostrado resultados promissores.

No entanto, o estudo CLSR relacionado mais recente que implementou uma abordagem multifuncional [17] usou cinco recursos simultaneamente. A abordagem de vários recursos é mais pesada em comparação com o uso de menos recursos [19]. Essa abordagem também não pode lidar com os quadros ruidosos da sequência de vídeo que possuem informações pouco claras, como uma forma de mão borrada devido ao movimento rápido. Além disso, confiar no aprendizado de sequência baseado em RNN pode encontrar problemas com sequências longas e pode perder o contexto global [20].

cistanche—Improve memory3

Suplemento Cistanche perto de mim - Melhore a Memória

A pesquisa atual visa melhorar o desempenho adicionando um mecanismo de auto-atenção [21,22] que pode lidar com sequências mais longas para aprender o contexto global. A autoatenção é baseada em pesquisas iniciais [20] que mostraram que a autoatenção tem a vantagem de ser capaz de lidar com longas dependências. No entanto, essa auto-atenção é mais fácil de aprender um caminho mais curto em comparação com um caminho mais longo com longas dependências. Nos trabalhos anteriores do CLSR [21,22] a autoatenção poderia ajudar a rede a aprender o recurso de forma mais eficaz.

Portanto, neste artigo, apresentamos um novo modelo multifuncional atento espaço-temporal. Este modelo proposto extrai efetivamente os recursos importantes e aprende melhor a sequência, fornecendo informações importantes usando um mecanismo de auto-atenção de vários recursos. Todos os processos são executados em uma abordagem de ponta a ponta.

3. Método proposto

Esta seção detalha as principais técnicas de nosso modelo proposto para CSLR. Portanto, começamos esta seção explicando a visão geral do nosso modelo proposto. Além disso, fornecemos mais detalhes sobre cada componente-chave, incluindo o módulo espacial, o módulo temporal e o módulo de aprendizagem sequencial. Além disso, também explicamos nosso módulo de atenção proposto para ajudar o modelo a aprender melhor. Finalmente, podemos integrar a estrutura de treinamento e inferência em nosso modelo proposto.

3.1. Visão geral da estrutura

Dada uma entrada de vídeo, nosso modelo proposto visa predizer o sinal correspondente em uma frase de glosa correta. O primeiro módulo gera vários recursos espaciais, como recursos de quadro completo e ponto-chave para cada quadro T do vídeo. Então, o módulo temporal nos permite extrair correlações temporais das características espaciais entre quadros para ambos os fluxos. Como etapa final, as redes espaciais e temporais foram ligadas à memória bidirecional de longo prazo (Bi-LSTM) e CTC para aprendizado e inferência de sequências. A seguir, explicamos nossos principais componentes de forma mais detalhada e consecutiva. A visão geral de nossa arquitetura proposta é mostrada na Figura 1.

Figure 1


Figura 1. A arquitetura geral do método proposto consiste em três componentes: um módulo espacial, um módulo temporal e um módulo de aprendizagem sequencial. O módulo espacial primeiro pega a sequência de imagens para extrair recursos do quadro e, em seguida, aplica o módulo temporal para extrair os recursos temporais. Em seguida, as características temporais são enviadas para o módulo de aprendizado de sequência para realizar a previsão de palavras e construí-las em uma frase

3.2. Módulo Espacial

O módulo espacial explora um recurso de quadro completo e recursos de ponto-chave, conforme mostrado na Figura 2. Este módulo usa a arquitetura de rede 2D-CNN como backbone, e o ResNet50 é escolhido para capturar os vários recursos. O ResNet50 é mais eficaz para ser usado em comparação com a arquitetura ResNet recente em termos de tempo, tendo um resultado comparável [36,37]. O RGB usa o ResNet50 diretamente, enquanto o ponto-chave é obtido pelo HRNet [38] do quadro de vídeo e é extraído usando o ResNet50 para obter os recursos do ponto-chave.

Figure 2


Figura 2. A arquitetura do módulo espacial usa entrada multifluxo. Fluxo RGB como um recurso de quadro completo e fluxo de pontos-chave como um recurso de ponto-chave.

3.2.1. Recurso Full-Frame

Aplicamos nossas etapas de pré-processamento aos dados RGB e, em seguida, inserimos nossos dados no modelo. Em seguida, os colocamos como uma entrada de quadro completo em nossa arquitetura. A Figura 3 mostra a ilustração da imagem RGB original no lado esquerdo e a imagem recortada no lado direito. A imagem recortada é usada como entrada pelo modelo. Isso ilustra a etapa de pré-processamento que reduz as partes menos importantes da imagem e coloca mais foco no signatário. Este corte usa um método de corte aleatório de [12] para aumentar o conjunto de dados. O recurso fullframe é extraído da imagem cortada para cada quadro na sequência usando o ResNet50.

Figure 3


Figura 3. Recurso full-frame usando imagem RGB, a (imagem da esquerda) é a imagem original e a (imagem da direita) é a imagem recortada para ajustar com o modelo proposto

3.2.2. Características principais

Extraímos os recursos de ponto-chave no módulo espacial dos dados RGB para cada quadro na entrada de vídeo. A qualidade dos recursos de ponto-chave tem um papel importante em nosso modelo proposto, por isso precisamos usar uma abordagem robusta, como HRNet [38]. Empregamos HRNet pré-treinado [38] para estimar todos os 133 pontos-chave do corpo e utilizamos 27 dos 133 pontos-chave de seu resultado. Conforme mostrado na Figura 4, o lado esquerdo é o ponto-chave original da parte superior do corpo e o lado direito são os 27 pontos-chave selecionados da parte superior do corpo. Esses 27 pontos-chave incluem pulsos, cotovelos, ombros, pescoço, mãos e dedos.

Figure 4


Figura 4. Características dos pontos-chave do conjunto de dados PHOENIX-RWTH [33,39], (imagem da esquerda) extração da imagem RGB, e (imagem da direita) é o ponto-chave selecionado usado pelo modelo proposto.

3.3. Módulo Temporal

O módulo temporal visa aprender informações espaço-temporais do módulo espacial. Os módulos temporais são construídos por agrupamento temporal empilhado para cada fluxo. Conforme mostrado na Figura 5, o módulo Temporal pooling consiste em uma camada de convolução temporal e uma camada de pooling para extrair recursos de entradas sequenciais.

Figure 5.


Figura 5. A arquitetura do módulo temporal consiste em uma 1D-CNN empilhada e uma camada de agrupamento incorporada com um módulo de atenção. Trabalhe em paralelo para ambos os fluxos de recursos concatenados no final das camadas empilhadas e produza um único recurso temporal com um comprimento de sequência quatro vezes menor.

A entrada é uma lista de multifunções espaciais do estágio anterior. O recurso temporal é obtido usando a camada de convolução temporal, que é uma única camada de convolução 1D com os mesmos comprimentos de entrada e saída, seguida por uma única camada de pooling que diminui o tamanho pela metade. Usar essas duas camadas de agrupamento temporal empilhadas é a melhor configuração, de acordo com os trabalhos anteriores [12]. Após cada agrupamento temporal, incorporamos um módulo de atenção que será explicado em detalhes na Seção 3.4. No final, concatenamos a saída do agrupamento temporal de ambos os fluxos.

3.4. Módulo de atenção

O vídeo tem vários quadros em que algumas partes da imagem às vezes ficam desfocadas. O conjunto de dados RTWH-PHOENIX [33,39] tem mais quadros defeituosos do que o conjunto de dados CSL [8,40,41]. Isso acontece quando o movimento é muito rápido, criando uma imagem borrada e resultando na localização errada do ponto-chave. Este quadro é considerado defeituoso e potencialmente leva à má interpretação dos recursos de RGB e ponto-chave. A Figura 6 mostra uma ilustração de quadros defeituosos no conjunto de dados RTWH-PHOENIX [33]. Para lidar com esse problema, adicionamos uma camada de atenção.

Figure 6


Figura 6. Ilustração de quadros de defeitos no conjunto de dados RWTH-PHOENIX [33,39]. Alguns dos pontos-chave na área da mão estão na posição errada devido a imagens borradas.

Usando o algoritmo CTC, o alinhamento do caminho junto com sua rotulagem é realizado usando um rótulo em branco e removendo os rótulos repetidos. A CTC prefere prever rótulos em branco em vez de limites de brilho quando não consegue distinguir o limite de brilho, mas nenhum dos resultados é convincente. Isso leva a rede a usar o CTC para produzir picos nos resultados ao analisar, aprender e prever [42,43]. Geralmente, a perda de CTC busca os quadros-chave, e o último resultado é a previsão de um quadro-chave específico que tem alta probabilidade de ser um rótulo em branco ou não em branco. Se o brilho prever a mesma etiqueta ou etiqueta em branco consecutivamente, resultará na mesma saída. No entanto, se houver uma etiqueta de inserção entre a mesma etiqueta, mesmo que haja apenas um erro, a perda será muito maior. Aqui, a adição de uma camada de atenção ajuda a selecionar a sequência temporal importante antes de ser usada para aprendizado sequencial.

O módulo de atenção usa um mecanismo de auto-atenção multicabeça [20]. O módulo multi-head é usado para executar vários mecanismos de atenção paralelos ao mesmo tempo. A atenção de várias cabeças é executada de forma independente para se concentrar nas dependências de curto prazo ou nas dependências de longo prazo em uma cabeça separada. Cada saída é então concatenada linearmente e transformada na forma desejada.

Concomitantemente, o mecanismo de autoatenção multicabeças cuida das informações de múltiplos subespaços de representação, dependendo do histórico das observações. Para simplificar, denotamos as sequências de entrada como X. Matematicamente, para o modelo de atenção de cabeça única, dada a entrada X t − T mais 1:t=[X t − T mais 1, · · ·, X t ] ∈ RT × N × P, três subespaços são obtidos, a saber, o subespaço de consulta Q ∈ RN ×dq, o subespaço de chave K ∈ RN × dk, e o subespaço de valor V ∈ RN × dv. O processo de aprendizado do subespaço latente pode ser formulado como [20]:

Q=XWQ, K=XWK , V=XWV ,

Em seguida, a atenção escalada do produto escalar é usada para calcular a saída de atenção como [20]:

Atenção(Q, K, V)=so f tmaxQKT/ p dkV,

Além disso, se tivermos várias cabeças que seguem simultaneamente as múltiplas representações da entrada, podemos obter resultados mais relevantes ao mesmo tempo. O passo final é concatenar todas as cabeças e projetá-las novamente para calcular a pontuação final [20]:

MultiHead(Q,K,V)=Concat(head1,..., heads )WO,

cabeça=Atenção(Qi,Ki,Vi),

onde Qi=XWQ i , Ki=XWVi , e WO ∈ R hd × dmodel. Finalmente, ele pode selecionar a parte importante da sequência de recursos porque nem todas as informações na sequência são importantes.

Conforme mostrado na Figura 7, utilizamos o módulo de atenção em diversas configurações. O primeiro módulo de atenção é colocado no final do módulo espacial, enquanto o segundo e terceiro módulos de atenção são colocados no módulo temporal. O segundo módulo de atenção, denominado módulo temporal inicial, é colocado após o primeiro bloco de agrupamento temporal como entrada, enquanto o terceiro módulo de atenção temporal, denominado módulo de atenção temporal tardia, é colocado após o segundo bloco de agrupamento temporal.

Figure 7

Figura 7. Módulos de atenção são embutidos em módulos espaciais e temporais em diferentes configurações.

Você pode gostar também