Machine Learning – Guia de Referência Rápida
Trabalhando com dados estruturados em Python
Descrição do livro
Com notas, tabelas e exemplos detalhados, esta referência prática ajudará você a navegar pelo básico do machine learning com dados estruturados. O autor Matt Harrison oferece um ótimo guia que você poderá usar como material complementar para cursos, além de servir como um recurso conveniente quando você iniciar o seu próximo projeto de machine learning.
Ideal para programadores, cientistas de dados e engenheiros da área de IA, este livro apresenta uma visão geral do processo de machine learning e da classificação com dados estruturados. Você conhecerá métodos para clustering (agrupamento), regressão e redução de dimensões, entre outros assuntos.
Este guia de referência rápida inclui:
classificação, usando o conjunto de dados do Titanic;
limpeza de dados e métodos para lidar com dados ausentes;
análise de dados exploratória;
passos comuns de pré-processamento usando dados de amostras;
seleção de atributos úteis ao modelo;
seleção do modelo;
métricas e avaliação da classificação;
exemplos de regressão usando diversas técnicas de ML;
métricas para avaliação de regressão;
clustering;
redução de dimensões;
pipelines do scikit-learn.
Sumário
- Prefácio
- Capítulo 1 ■ Introdução
- Bibliotecas usadas
- Instalação com o pip
- Instalação com o conda
- Capítulo 2 ■ Visão geral do processo de machine learning
- Capítulo 3 ■ Descrição da classificação: conjunto de dados do Titanic
- Sugestão para layout dos projetos
- Importações
- Faça uma pergunta
- Termos para os dados
- Colete os dados
- Limpe os dados
- Crie os atributos
- Separe as amostras
- Faça a imputação de dados
- Normalize os dados
- Refatore
- Modelo de base
- Várias famílias
- Stacking
- Crie o modelo
- Avalie o modelo
- Otimize o modelo
- Matriz de confusão
- Curva ROC
- Curva de aprendizado
- Implante o modelo
- Capítulo 4 ■ Dados ausentes
- Analisando dados ausentes
- Descartando dados ausentes
- Imputando dados
- Acrescentando colunas informativas
- Capítulo 5 ■ Fazendo uma limpeza nos dados
- Nomes das colunas
- Substituindo valores ausentes
- Capítulo 6 ■ Explorando os dados
- Tamanho dos dados
- Estatísticas resumidas
- Histograma
- Gráfico de dispersão
- Gráfico conjunto
- Matriz de pares
- Gráfico de caixas e gráfico violino
- Comparando dois valores ordinais
- Correlação
- RadViz
- Coordenadas paralelas
- Capítulo 7 ■ Pré-processamento dos dados
- Padronize os dados
- Escale para um intervalo
- Variáveis dummy
- Codificador de rótulos
- Codificação de frequência
- Extraindo categorias a partir de strings
- Outras codificações de categoria
- Engenharia de dados para datas
- Adição do atributo col_na
- Engenharia de dados manual
- Capítulo 8 ■ Seleção de atributos
- Colunas colineares
- Regressão lasso
- Eliminação recursiva de atributos
- Informações mútuas
- Principal Component Analysis
- Importância dos atributos
- Capítulo 9 ■ Classes desbalanceadas
- Use uma métrica diferente
- Algoritmos baseados em árvores e ensembles
- Modelos de penalização
- Upsampling da minoria
- Gerando dados de minorias
- Downsampling da maioria
- Upsampling e depois downsampling
- Capítulo 10 ■ Classificação
- Regressão logística
- Naive Bayes
- Máquina de vetores suporte
- K vizinhos mais próximos
- Árvore de decisão
- Floresta aleatória
- XGBoost
- Gradient Boosted com LightGBM
- TPOT
- Capítulo 11 ■ Seleção do modelo
- Curva de validação
- Curva de aprendizagem
- Capítulo 12 ■ Métricas e avaliação de classificação
- Matriz de confusão
- Métricas
- Acurácia
- Recall
- Precisão
- F1
- Relatório de classificação
- ROC
- Curva de precisão-recall
- Gráfico de ganhos cumulativos
- Gráfico de elevação
- Balanceamento das classes
- Erro de predição de classe
- Limiar de discriminação
- Capítulo 13 ■ Explicando os modelos
- Coeficientes de regressão
- Importância dos atributos
- LIME
- Interpretação de árvores
- Gráficos de dependência parcial
- Modelos substitutos
- Shapley
- Capítulo 14 ■ Regressão
- Modelo de base
- Regressão linear
- SVMs
- K vizinhos mais próximos
- Árvore de decisão
- Floresta aleatória
- Regressão XGBoost
- Regressão LightGBM
- Capítulo 15 ■ Métricas e avaliação de regressão
- Métricas
- Gráfico de resíduos
- Heterocedasticidade
- Resíduos com distribuição normal
- Gráfico de erros de predição
- Capítulo 16 ■ Explicando os modelos de regressão
- Shapley
- Capítulo 17 ■ Redução da dimensionalidade
- PCA
- UMAP
- t-SNE
- PHATE
- Capítulo 18 ■ Clustering
- K-Means
- Clustering (hierárquico) aglomerativo
- Entendendo os clusters
- Capítulo 19 ■ Pipelines
- Pipeline de classificação
- Pipeline de regressão
- Pipeline de PCA
Sobre o autor
Matt Harrison administra a MetaSnake, uma empresa de treinamento e consultoria para Python e ciência de dados. O autor usa Python desde 2000 em diversos domínios: ciência de dados, inteligência de negócios, armazenagem, testes e automação, gerenciamento de pilhas open source, área financeira e pesquisa de informações.… Ver perfil completo ▶
Livros relacionados
Opinião dos leitores
Francisco F
Um ótimo livro, colorido e que mesmo de propondo a ser um guia rápido trás informações relevantes,recomendo fortemente.
Fernando F
Guia com roteiro e dicas relevantes. Serve como referência rápida e na estruturação de processo de análise.
Guilherme de C F
Excelente livro, mesmo para quem já possui conhecimentos em Machine Learning e Data Science.
Luciane A
Livro muito bom.






