SQL para Análise de Dados
Técnicas avançadas para transformar dados em insights
Descrição do livro
Com a explosão do uso de dados, do poder computacional e dos data warehouses na nuvem, o SQL tornou-se uma ferramenta ainda mais indispensável para o cientista de dados ou o analista experiente. Este livro prático revela maneiras novas e ainda desconhecidas de você melhorar suas habilidades em SQL, resolver problemas e aproveitar ao máximo os recursos do SQL como parte de seu fluxo de trabalho.
Você aprenderá a usar funções SQL comuns e inusitadas, como as junções, funções de janela, subconsultas, e expressões regulares, de maneiras novas e avançadas – e também a combinar técnicas do SQL para atingir seus objetivos com mais rapidez, com um código de fácil compreensão. Se você trabalha com bancos de dados SQL, esta é uma referência indispensável.
• Aprenda as principais etapas para a preparação de seus dados para análise
• Execute análises de séries temporais usando as manipulações de data e hora do SQL
• Use a análise de coorte para investigar como os grupos mudam com o tempo
• Use as funções e os operadores poderosos do SQL para a análise de texto
• Detecte anomalias em seus dados e substitua-as por valores alternativos
• Estabeleça causalidade usando a análise experimental, também conhecida como teste A/B
Ver menos ▲Sumário
- Prefácio
- Capítulo 1 ■ Análise com SQL
- O que é análise de dados?
- Por que SQL?
- O que é SQL?
- Benefícios do SQL
- SQL versus R ou Python
- SQL como parte do fluxo de trabalho de análise de dados
- Tipos de bancos de dados e como trabalhar com eles
- Bancos de dados row-store
- Bancos de dados column-store
- Outros tipos de infraestrutura de dados
- Conclusão
- Capítulo 2 ■ Preparando os dados para análise
- Tipos de dados
- Tipos de dados de banco de dados
- Estruturados versus não estruturados
- Dados quantitativos versus qualitativos
- Dados primários, secundários e de terceiros
- Dados esparsos
- Estrutura da consulta SQL
- Criação de perfis: distribuições
- Histogramas e frequências
- Discretização (Binning)
- Funções n-tiles
- Criação de perfis: qualidade dos dados
- Detectando duplicidades
- Desduplicação com GROUP BY e DISTINCT
- Preparação: limpeza dos dados
- Limpando dados com transformações CASE
- Conversões de tipos e casting
- Lidando com nulos: funções coalesce, nullif, nvl
- Dados ausentes
- Preparação: modelando dados
- Para qual saída: BI, visualização, estatística, ML
- Pivotando com instruções CASE
- Despivotando com instruções UNION
- Funções pivot e unpivot
- Conclusão
- Capítulo 3 ■ Análise de séries temporais
- Manipulações de data, data/hora e hora
- Conversões de fuso horário
- Conversões de formato de data e timestamp
- Matemática de datas
- Matemática de horas
- Unindo dados de diferentes origens
- Conjunto de dados de vendas do varejo
- Encontrando tendências nos dados
- Tendências simples
- Comparando componentes
- Percentual em cálculos de totais
- Indexação para a detecção de alterações percentuais com o passar do tempo
- Janelas de tempo contínuas
- Calculando janelas de tempo contínuas
- Janelas de tempo contínuas com dados esparsos
- Calculando valores cumulativos
- Analisando com sazonalidade
- Comparações período a período: YoY e MoM
- Comparações período a período: mesmo mês versus ano passado
- Fazendo a comparação com vários períodos anteriores
- Conclusão
- Capítulo 4 ■ Análise de Coorte
- Coortes: uma estrutura de análise útil
- Conjunto de dados de legisladores
- Retenção
- SQL para uma curva de retenção básica
- Ajustando a série temporal para aumentar a exatidão da retenção
- Coortes derivadas da própria série temporal
- Definindo a coorte a partir de uma tabela separada
- Lidando com coortes esparsas
- Definindo coortes a partir de datas diferentes da primeira data
- Análises de coorte relacionadas
- Sobrevivência
- Retorno, ou comportamento de compra repetida
- Cálculos cumulativos
- Análise transversal, considerada com base em uma coorte
- Conclusão
- Capítulo 5 ■ Análise de texto
- Por que fazer análise de texto com SQL?
- O que é análise de texto?
- Por que o SQL é uma boa opção para a análise de texto
- Quando o SQL não é uma boa opção
- Conjunto de dados de avistamentos de OVNIs
- Características do texto
- Parsing do texto
- Transformações de texto
- Encontrando elementos dentro de blocos de texto maiores
- Correspondências com curingas: LIKE, ILIKE
- Correspondências exatas: IN, NOT IN
- Expressões regulares
- Construindo e remodelando o texto
- Concatenação
- Remodelando o texto
- Conclusão
- Capítulo 6 ■ Detecção de anomalias
- Recursos e limites do SQL para a detecção de anomalias
- Conjunto de dados
- Detectando valores discrepantes
- Ordenando para encontrar anomalias
- Calculando percentis e desvios-padrão para encontrar anomalias
- Representação gráfica para a busca de anomalias visualmente
- Tipos de anomalias
- Valores anômalos
- Contagens ou frequências anômalas
- Anomalias pela ausência de dados
- Manipulando anomalias
- Investigação
- Remoção
- Substituição por valores alternativos
- Reescalonamento
- Conclusão
- Capítulo 7 ■ Análise experimental
- Vantagens e limites da análise experimental com SQL
- Conjunto de dados
- Tipos de experimentos
- Experimentos com resultados binários: o teste qui-quadrado
- Experimentos com resultados contínuos: o teste t
- Desafios dos experimentos e opções para o resgate de experimentos que falharam
- Atribuição de variantes
- Valores discrepantes (Outliers)
- Time Boxing
- Experimentos com exposição repetida
- Se não for possível executar experimentos controlados: análises alternativas
- Pré/pós-análise
- Análise experimental natural
- Análise de populações com base em um limite
- Conclusão
- Capítulo 8 ■ Criando conjuntos de dados complexos para análise
- Quando usar SQL para conjuntos de dados complexos
- As vantagens de usar SQL
- Quando a lógica deve ser construída em ETL
- Quando inserir a lógica em outras ferramentas
- Organização do código
- Comentários
- Capitalização, indentação, parênteses e outros truques de formatação
- Armazenando o código
- Organizando a computação
- Entendendo a ordem de avaliação de cláusulas SQL
- Subconsultas
- Tabelas temporárias
- Expressões de tabela comuns
- grouping sets
- Gerenciando o tamanho do conjunto de dados e considerações sobre privacidade
- Amostragem com %, mod
- Reduzindo a dimensionalidade
- PII e privacidade dos dados
- Conclusão
- Capítulo 9 ■ Conclusão
- Análise de funil
- Desistência, inatividade e outras definições de afastamento
- Análise de cesta de compras
- Recursos
- Livros e blogs
- Conjuntos de dados
- Considerações finais
- Índice remissivo
Sobre o autor
Há mais de 20 anos Cathy Tanimura analisa dados para vários segmentos industriais, que vão do setor financeiro ao de software B2B e ao de serviços ao consumidor. Dedicada a conectar as pessoas e organizações aos dados dos quais elas precisam, Cathy construiu e gerenciou equipes e infraestruturas de dados em muitas das principais empresas de tecnologia.… Ver perfil completo ▶
Livros relacionados
Recursos
Opinião dos leitores
Osdinei F P
Gostei do livro.






