Microsoft Word - Aprendizado profundo versus modelos tradicionais_Abdel Hai_Final.Parte 2

Jan 03, 2024

Para preparar os dados para modelos de aprendizado de máquina foram realizadas as seguintes técnicas de pré-processamento de dados.

Dados e memória estão intimamente relacionados. Na sociedade moderna, recebemos diariamente uma grande quantidade de informações e dados, incluindo textos, imagens, vídeos, etc. A forma de processar e organizar eficazmente estes dados exige que tenhamos uma memória forte.

Por um lado, os dados podem nos fornecer suporte de memória. Por exemplo, quando aprendemos novos conhecimentos, podemos compreender e dominar pontos de conhecimento de forma mais rápida e melhor, memorizando dados e factos relevantes. Esse tipo de método de aprendizagem pode nos ajudar a construir uma memória forte e a manter a capacidade de controlar o conhecimento por muito tempo.

Por outro lado, os dados também podem nos ajudar a treinar e melhorar a memória. Através de vários métodos de treinamento de memória, podemos usar os dados de maneira flexível para realizar o treinamento de memória, melhorar até certo ponto nossa capacidade de memória e, assim, nos adaptar melhor ao desenvolvimento da sociedade e às necessidades do trabalho e da vida.

Percebe-se que a relação entre dados e memória é muito próxima e importante. Somente processando e utilizando dados de forma ativa e eficaz poderemos utilizar melhor nossas capacidades de memória e obter melhores resultados. Portanto, devemos tratar ativamente a relação entre dados e memória, fazer treinamentos e aplicações relevantes e melhorar constantemente nossas habilidades. Percebe-se que precisamos melhorar a memória, e a Cistanche deserticola pode melhorar significativamente a memória, pois a Cistanche deserticola também pode regular o equilíbrio dos neurotransmissores, como aumentar os níveis de acetilcolina e fatores de crescimento. Estas substâncias são muito importantes para a memória e a aprendizagem. Além disso, a carne também pode melhorar o fluxo sanguíneo e promover o fornecimento de oxigênio, o que pode garantir que o cérebro receba nutrientes e energia suficientes, melhorando assim a vitalidade e a resistência do cérebro.

improve short term memory

Clique em conhecer maneiras de melhorar a função cerebral

Os recursos categóricos eram codificados a quente; características contínuas e discretas foram normalizadas usando técnicas de normalização min-max,32 definidas como:

increase brain power

Houve diferentes números de gravações em cada encontro para cada um dos seguintes recursos. Assim, os seguintes valores estatísticos foram calculados. Para as pressões arteriais diastólica e sistólica foram calculados os valores mínimo, máximo e médio.

Para o IMC foram utilizados mínimo, máximo, média e coeficiente de variância. Esses valores estatísticos foram normalizados e usados ​​como recursos. Além disso, o número de características diferiu nos encontros devido ao diferente número de exames laboratoriais, diagnósticos e procedimentos. Um encontro pode ter vários diagnósticos e/ou códigos de procedimento ou nenhum.

Para remediar isso e unificar a dimensionalidade dos vetores de características, as seguintes técnicas de representação de dados foram utilizadas para aprimorar o aprendizado dos modelos. Para códigos de diagnóstico e procedimento, utilizamos a representação de codificações one-hot, onde cada valor foi definido como 0 ou 1, indicando se existia ou não um código de diagnóstico/procedimento para cada encontro. Modificamos ligeiramente esta técnica de representação de dados para testes laboratoriais porque cada teste tinha um resultado associado.

Portanto, substituímos 1, que indicava a existência de um código, pelo resultado do laboratório. Os resultados laboratoriais foram normalizados utilizando a Equação 1. Como os resultados eram de unidades e medidas diferentes, ao normalizar os resultados laboratoriais, consideramos o mínimo e o máximo para cada código laboratorial separadamente. Esta técnica criou uma matriz esparsa de alta dimensão devido aos muitos códigos exclusivos.
Em seguida, utilizamos o algoritmo Singular Value Decomposition (SVD) para aprender uma incorporação e dimensionalidade reduzida. SVD foi usado porque não assume uma matriz quadrada como entrada e é melhor para dados esparsos.33 Os testes de laboratório foram reduzidos para 50 componentes, procedimento os códigos foram reduzidos para 45 componentes e os códigos de diagnóstico foram reduzidos para 25 componentes.

Diferentes componentes foram explorados e a razão da soma das variâncias foi observada para determinar o número ideal de componentes para reduzir a dimensionalidade. Todos os recursos foram concatenados em um vetor de recursos para cada encontro. SVD foi aplicado em cada encontro separadamente para reduzir e unificar dimensões; a dimensão dos encontros foi reduzida para 50 características por encontro.

help with memory

Em seguida, concatenamos todos os encontros de um determinado paciente em um vetor de características ordenado sequencialmente por data de admissão. A distribuição das classes foi de 27.511 pacientes sem readmissão (classe negativa) e 9.130 pacientes que foram readmitidos (classe positiva).

Abordagens Experimentais

Conduzimos extensos experimentos usando os dados EHR para atingir os seguintes objetivos:

- Prever se pacientes com diabetes serão readmitidos dentro de 30 dias

- Comparar o desempenho dos métodos de DL utilizados com diversos modelos tradicionais

- Analisar quantos encontros anteriores (ou seja, dados históricos) dentro de 2 anos são ideais para prever a readmissão

- Avaliar os efeitos da incorporação de todos os testes laboratoriais nos dados versus aprender com um subconjunto de testes escolhido por um especialista no domínio

Neste estudo, os modelos DL tomam como entrada um tensor dimensional 3-3- � x � x � para representar f características para cada um dos encontros para p pacientes. Em contraste, nos modelos tradicionais, os dados são normalmente representados como uma matriz 2-dimensional, com todas as características de todos os encontros correspondendo a um único paciente concatenado em um longo vetor de características.

A dimensionalidade de cada encontro foi reduzida e unificada para 50 características, portanto, em um modelo profundo � é de tamanho 50. Em um modelo tradicional o vetor de características consiste em todos os encontros e, portanto, tem tamanho � x 50.

Os pacientes têm diferentes números de encontros, resultando em dimensões não uniformes; portanto, os vetores de recursos foram preenchidos com 0s para obter uma forma unificada. A representação dos dados utilizados como entrada para modelos DL e tradicionais é ilustrada nos painéis esquerdo e direito da Figura 1, respectivamente.
Para modelar dados sequenciais heterogêneos, desenvolvemos duas variantes de modelos DL e comparamos ambas com vários modelos tradicionais usados ​​como linhas de base. Os modelos DL utilizados em nosso estudo foram: 1) redes 1-way Long Short-Term Memory (LSTM), que são uma variante da Rede Neural Recorrente (RNN) que é capaz de aprender dependência de ordem em dados sequenciais32; e 2) Unidade Recorrente Bidirecional (GRU), que é outra variante do RNN.

Os modelos tradicionais utilizados como linhas de base foram: 1) Random Forest (RF), um método conjunto para classificação e regressão; durante o treinamento, ele constrói múltiplas árvores de decisão;30 A RF frequentemente alcança o desempenho de última geração na literatura existente sobre previsões usando dados médicos. 2) Perceptron multicamadas (MLP), um modelo de rede neural simples que não leva em conta informações temporais.

MLP consiste em múltiplas camadas de perceptron, realiza aprendizado de retropropagação e utiliza uma função de ativação não linear.31 3) Regressão Logística (LR), um modelo interpretável usado frequentemente na literatura existente de previsões de readmissão e aplicado a dados médicos; e 4) AdaBoost, que é menos propenso a overfitting, pois seus parâmetros de entrada não são otimizados em conjunto.

help with memory


Os modelos DL foram implementados usando bibliotecas Python "Keras", uma API de alto nível do "TensorFlow". A biblioteca "Scikit-learn" foi utilizada para implementar modelos tradicionais em Python.

A arquitetura do modelo proposto, LSTM, compreende 128 neurônios, uma camada sequencial, uma camada de remodelação que foi usada para remodelar a entrada para um tensor dimensional 3- e uma camada de mascaramento com um valor de máscara de 0 usado para pular os intervalos de tempo para os quais os dados estavam faltando.

Como o preenchimento com 0s foi realizado para unificar as dimensões, a camada de máscara foi utilizada para evitar qualquer cálculo com os valores ausentes em todas as camadas seguintes à camada de máscara, portanto, os valores ausentes não foram contabilizados durante o aprendizado.

Além disso, um dropout foi adicionado entre as camadas oculta e de saída. Utilizar esta técnica para selecionar aleatoriamente uma determinada porcentagem a ser descartada é uma técnica de regularização comum que auxilia o modelo no aprendizado de padrões gerais nos dados.

RNN é uma variante de redes neurais, que consiste em neurônios ocultos que são capazes de analisar dados EHR temporais.32 RNN compreende a mesma estrutura da rede neural básica, mas neurônios na mesma camada estão conectados, permitindo que um neurônio aprenda com o mesmo camadas vizinhas, além de aprender com as saídas das camadas anteriores e com os dados de entrada. Assim, os neurônios RNN incluem duas fontes de entrada, o presente e o passado recente. O processo de aprendizagem é definido como:

increase memory power

Para calcular o valor �" de um neurônio oculto, �, uma função de transformação não linear, ReLU, é aplicada ao valor � ponderado de seu neurônio oculto esquerdo �"#$ e ao valor � ponderado de sua entrada �".

As previsões são calculadas usando a função asigmóide da soma ponderada de todos os neurônios ocultos com viés adicionado. A desvantagem do RNN é que ele sofre do problema do gradiente evanescente, o que significa que os pesos permanecem inalterados, dificultando a convergência do modelo, portanto, o modelo tem dificuldade para aprender.

Para resolver isso, foi introduzida uma camada LSTM na qual neurônios sigmóides de RNN são substituídos por uma estrutura de memória de curto prazo mais complexa. O LSTM compartilha os mesmos pesos entre camadas, o que reduz o número de parâmetros que a rede calcula.

supplements to improve memory

O GRU é uma solução alternativa para um problema de gradiente de desaparecimento. Ele substitui o neurônio simples por uma unidade fechada, que possui menos parâmetros que os neurônios LSTM porque não possui uma porta de saída.33


For more information:1950477648nn@gmail.com

Você pode gostar também