Machine Learning – Guia de Referência Rápida

Trabalhando com dados estruturados em Python

Machine Learning – Guia de Referência Rápida
× Machine Learning – Guia de Referência Rápida

Machine Learning – Guia de Referência Rápida

Autor: Matt Harrison

ISBN impresso: 978-85-7522-817-3
ISBN ebook: 978-85-7522-818-0
Ano: 2019
Páginas: 272
Preço impresso: R$ 84,00 O ebook deste livro está disponível na Amazon.

9 opiniões | Opine sobre este livro

Descrição do livro

Com notas, tabelas e exemplos detalhados, esta referência prática ajudará você a navegar pelo básico do machine learning com dados estruturados. O autor Matt Harrison oferece um ótimo guia que você poderá usar como material complementar para cursos, além de servir como um recurso conveniente quando você iniciar o seu próximo projeto de machine learning.

Ideal para programadores, cientistas de dados e engenheiros da área de IA, este livro apresenta uma visão geral do processo de machine learning e da classificação com dados estruturados. Você conhecerá métodos para clustering (agrupamento), regressão e redução de dimensões, entre outros assuntos.

Este guia de referência rápida inclui:

  • classificação, usando o conjunto de dados do Titanic;

  • limpeza de dados e métodos para lidar com dados ausentes;

  • análise de dados exploratória;

  • passos comuns de pré-processamento usando dados de amostras;

  • seleção de atributos úteis ao modelo;

  • seleção do modelo;

  • métricas e avaliação da classificação;

  • exemplos de regressão usando diversas técnicas de ML;

  • métricas para avaliação de regressão;

  • clustering;

  • redução de dimensões;

  • pipelines do scikit-learn.

Ver menos ▲

Sumário

  • Prefácio
  • Capítulo 1 ■ Introdução
    • Bibliotecas usadas
    • Instalação com o pip
    • Instalação com o conda
  • Capítulo 2 ■ Visão geral do processo de machine learning
  • Capítulo 3 ■ Descrição da classificação: conjunto de dados do Titanic
    • Sugestão para layout dos projetos
    • Importações
    • Faça uma pergunta
    • Termos para os dados
    • Colete os dados
    • Limpe os dados
    • Crie os atributos
    • Separe as amostras
    • Faça a imputação de dados
    • Normalize os dados
    • Refatore
    • Modelo de base
    • Várias famílias
    • Stacking
    • Crie o modelo
    • Avalie o modelo
    • Otimize o modelo
    • Matriz de confusão
    • Curva ROC
    • Curva de aprendizado
    • Implante o modelo
  • Capítulo 4 ■ Dados ausentes
    • Analisando dados ausentes
    • Descartando dados ausentes
    • Imputando dados
    • Acrescentando colunas informativas
  • Capítulo 5 ■ Fazendo uma limpeza nos dados
    • Nomes das colunas
    • Substituindo valores ausentes
  • Capítulo 6 ■ Explorando os dados
    • Tamanho dos dados
    • Estatísticas resumidas
    • Histograma
    • Gráfico de dispersão
    • Gráfico conjunto
    • Matriz de pares
    • Gráfico de caixas e gráfico violino
    • Comparando dois valores ordinais
    • Correlação
    • RadViz
    • Coordenadas paralelas
  • Capítulo 7 ■ Pré-processamento dos dados
    • Padronize os dados
    • Escale para um intervalo
    • Variáveis dummy
    • Codificador de rótulos
    • Codificação de frequência
    • Extraindo categorias a partir de strings
    • Outras codificações de categoria
    • Engenharia de dados para datas
    • Adição do atributo col_na
    • Engenharia de dados manual
  • Capítulo 8 ■ Seleção de atributos
    • Colunas colineares
    • Regressão lasso
    • Eliminação recursiva de atributos
    • Informações mútuas
    • Principal Component Analysis
    • Importância dos atributos
  • Capítulo 9 ■ Classes desbalanceadas
    • Use uma métrica diferente
    • Algoritmos baseados em árvores e ensembles
    • Modelos de penalização
    • Upsampling da minoria
    • Gerando dados de minorias
    • Downsampling da maioria
    • Upsampling e depois downsampling
  • Capítulo 10 ■ Classificação
    • Regressão logística
    • Naive Bayes
    • Máquina de vetores suporte
    • K vizinhos mais próximos
    • Árvore de decisão
    • Floresta aleatória
    • XGBoost
    • Gradient Boosted com LightGBM
    • TPOT
  • Capítulo 11 ■ Seleção do modelo
    • Curva de validação
    • Curva de aprendizagem
  • Capítulo 12 ■ Métricas e avaliação de classificação
    • Matriz de confusão
    • Métricas
    • Acurácia
    • Recall
    • Precisão
    • F1
    • Relatório de classificação
    • ROC
    • Curva de precisão-recall
    • Gráfico de ganhos cumulativos
    • Gráfico de elevação
    • Balanceamento das classes
    • Erro de predição de classe
    • Limiar de discriminação
  • Capítulo 13 ■ Explicando os modelos
    • Coeficientes de regressão
    • Importância dos atributos
    • LIME
    • Interpretação de árvores
    • Gráficos de dependência parcial
    • Modelos substitutos
    • Shapley
  • Capítulo 14 ■ Regressão
    • Modelo de base
    • Regressão linear
    • SVMs
    • K vizinhos mais próximos
    • Árvore de decisão
    • Floresta aleatória
    • Regressão XGBoost
    • Regressão LightGBM
  • Capítulo 15 ■ Métricas e avaliação de regressão
    • Métricas
    • Gráfico de resíduos
    • Heterocedasticidade
    • Resíduos com distribuição normal
    • Gráfico de erros de predição
  • Capítulo 16 ■ Explicando os modelos de regressão
    • Shapley
  • Capítulo 17 ■ Redução da dimensionalidade
    • PCA
    • UMAP
    • t-SNE
    • PHATE
  • Capítulo 18 ■ Clustering
    • K-Means
    • Clustering (hierárquico) aglomerativo
    • Entendendo os clusters
  • Capítulo 19 ■ Pipelines
    • Pipeline de classificação
    • Pipeline de regressão
    • Pipeline de PCA
Ver sumário completo ▼

Sobre o autor

Matt Harrison

Matt Harrison administra a MetaSnake, uma empresa de treinamento e consultoria para Python e ciência de dados. O autor usa Python desde 2000 em diversos domínios: ciência de dados, inteligência de negócios, armazenagem, testes e automação, gerenciamento de pilhas open source, área financeira e pesquisa de informações.… Ver perfil completo ▶

Opinião dos leitores

Francisco F

Um ótimo livro, colorido e que mesmo de propondo a ser um guia rápido trás informações relevantes,recomendo fortemente.

Fernando F

Guia com roteiro e dicas relevantes. Serve como referência rápida e na estruturação de processo de análise.

Guilherme de C F

Excelente livro, mesmo para quem já possui conhecimentos em Machine Learning e Data Science.

Luciane A

Livro muito bom.

Ver todas ▼

Títulos relacionados