SQL para Análise de Dados

Técnicas avançadas para transformar dados em insights

SQL para Análise de Dados
× SQL para Análise de Dados

SQL para Análise de Dados

Compartilhar

Autor: Cathy Tanimura

ISBN impresso: 978-65-86057-75-1
ISBN ebook: 978-65-86057-92-8
Ano: 2022
Páginas: 400
Preço impresso: R$ 119,00 O ebook deste livro está disponível na Amazon.

1 opinião | Opine sobre este livro

Descrição do livro

Com a explosão do uso de dados, do poder computacional e dos data warehouses na nuvem, o SQL tornou-se uma ferramenta ainda mais indispensável para o cientista de dados ou o analista experiente. Este livro prático revela maneiras novas e ainda desconhecidas de você melhorar suas habilidades em SQL, resolver problemas e aproveitar ao máximo os recursos do SQL como parte de seu fluxo de trabalho.

Você aprenderá a usar funções SQL comuns e inusitadas, como as junções, funções de janela, subconsultas, e expressões regulares, de maneiras novas e avançadas – e também a combinar técnicas do SQL para atingir seus objetivos com mais rapidez, com um código de fácil compreensão. Se você trabalha com bancos de dados SQL, esta é uma referência indispensável.

• Aprenda as principais etapas para a preparação de seus dados para análise

• Execute análises de séries temporais usando as manipulações de data e hora do SQL

• Use a análise de coorte para investigar como os grupos mudam com o tempo

• Use as funções e os operadores poderosos do SQL para a análise de texto

• Detecte anomalias em seus dados e substitua-as por valores alternativos

• Estabeleça causalidade usando a análise experimental, também conhecida como teste A/B

Ver menos ▲

Sumário

  • Prefácio
  • Capítulo 1 ■ Análise com SQL
  • O que é análise de dados?
  • Por que SQL?
    • O que é SQL?
    • Benefícios do SQL
    • SQL versus R ou Python
    • SQL como parte do fluxo de trabalho de análise de dados
  • Tipos de bancos de dados e como trabalhar com eles
    • Bancos de dados row-store
    • Bancos de dados column-store
    • Outros tipos de infraestrutura de dados
  • Conclusão
  • Capítulo 2 ■ Preparando os dados para análise
  • Tipos de dados
    • Tipos de dados de banco de dados
    • Estruturados versus não estruturados
    • Dados quantitativos versus qualitativos
    • Dados primários, secundários e de terceiros
    • Dados esparsos
  • Estrutura da consulta SQL
  • Criação de perfis: distribuições
    • Histogramas e frequências
    • Discretização (Binning)
    • Funções n-tiles
  • Criação de perfis: qualidade dos dados
    • Detectando duplicidades
    • Desduplicação com GROUP BY e DISTINCT
  • Preparação: limpeza dos dados
    • Limpando dados com transformações CASE
    • Conversões de tipos e casting
    • Lidando com nulos: funções coalesce, nullif, nvl
    • Dados ausentes
  • Preparação: modelando dados
    • Para qual saída: BI, visualização, estatística, ML
    • Pivotando com instruções CASE
    • Despivotando com instruções UNION
    • Funções pivot e unpivot
  • Conclusão
  • Capítulo 3 ■ Análise de séries temporais
  • Manipulações de data, data/hora e hora
    • Conversões de fuso horário
    • Conversões de formato de data e timestamp
    • Matemática de datas
    • Matemática de horas
    • Unindo dados de diferentes origens
  • Conjunto de dados de vendas do varejo
  • Encontrando tendências nos dados
    • Tendências simples
    • Comparando componentes
    • Percentual em cálculos de totais
    • Indexação para a detecção de alterações percentuais com o passar do tempo
  • Janelas de tempo contínuas
    • Calculando janelas de tempo contínuas
    • Janelas de tempo contínuas com dados esparsos
    • Calculando valores cumulativos
  • Analisando com sazonalidade
    • Comparações período a período: YoY e MoM
    • Comparações período a período: mesmo mês versus ano passado
    • Fazendo a comparação com vários períodos anteriores
  • Conclusão
  • Capítulo 4 ■ Análise de Coorte
  • Coortes: uma estrutura de análise útil
  • Conjunto de dados de legisladores
  • Retenção
    • SQL para uma curva de retenção básica
    • Ajustando a série temporal para aumentar a exatidão da retenção
    • Coortes derivadas da própria série temporal
    • Definindo a coorte a partir de uma tabela separada
    • Lidando com coortes esparsas
    • Definindo coortes a partir de datas diferentes da primeira data
  • Análises de coorte relacionadas
    • Sobrevivência
    • Retorno, ou comportamento de compra repetida
    • Cálculos cumulativos
  • Análise transversal, considerada com base em uma coorte
  • Conclusão
  • Capítulo 5 ■ Análise de texto
  • Por que fazer análise de texto com SQL?
    • O que é análise de texto?
    • Por que o SQL é uma boa opção para a análise de texto
    • Quando o SQL não é uma boa opção
  • Conjunto de dados de avistamentos de OVNIs
  • Características do texto
  • Parsing do texto
  • Transformações de texto
  • Encontrando elementos dentro de blocos de texto maiores
    • Correspondências com curingas: LIKE, ILIKE
    • Correspondências exatas: IN, NOT IN
    • Expressões regulares
  • Construindo e remodelando o texto
    • Concatenação
    • Remodelando o texto
  • Conclusão
  • Capítulo 6 ■ Detecção de anomalias
  • Recursos e limites do SQL para a detecção de anomalias
  • Conjunto de dados
  • Detectando valores discrepantes
    • Ordenando para encontrar anomalias
    • Calculando percentis e desvios-padrão para encontrar anomalias
    • Representação gráfica para a busca de anomalias visualmente
  • Tipos de anomalias
    • Valores anômalos
    • Contagens ou frequências anômalas
    • Anomalias pela ausência de dados
  • Manipulando anomalias
    • Investigação
    • Remoção
    • Substituição por valores alternativos
    • Reescalonamento
  • Conclusão
  • Capítulo 7 ■ Análise experimental
  • Vantagens e limites da análise experimental com SQL
  • Conjunto de dados
  • Tipos de experimentos
    • Experimentos com resultados binários: o teste qui-quadrado
    • Experimentos com resultados contínuos: o teste t
  • Desafios dos experimentos e opções para o resgate de experimentos que falharam
    • Atribuição de variantes
    • Valores discrepantes (Outliers)
    • Time Boxing
    • Experimentos com exposição repetida
  • Se não for possível executar experimentos controlados: análises alternativas
    • Pré/pós-análise
    • Análise experimental natural
    • Análise de populações com base em um limite
  • Conclusão
  • Capítulo 8 ■ Criando conjuntos de dados complexos para análise
  • Quando usar SQL para conjuntos de dados complexos
    • As vantagens de usar SQL
    • Quando a lógica deve ser construída em ETL
    • Quando inserir a lógica em outras ferramentas
  • Organização do código
    • Comentários
    • Capitalização, indentação, parênteses e outros truques de formatação
    • Armazenando o código
  • Organizando a computação
    • Entendendo a ordem de avaliação de cláusulas SQL
    • Subconsultas
    • Tabelas temporárias
    • Expressões de tabela comuns
    • grouping sets
  • Gerenciando o tamanho do conjunto de dados e considerações sobre privacidade
    • Amostragem com %, mod
    • Reduzindo a dimensionalidade
    • PII e privacidade dos dados
  • Conclusão
  • Capítulo 9 ■ Conclusão
  • Análise de funil
  • Desistência, inatividade e outras definições de afastamento
  • Análise de cesta de compras
  • Recursos
    • Livros e blogs
    • Conjuntos de dados
  • Considerações finais
  • Índice remissivo
Ver sumário completo ▼

Sobre o autor

Cathy Tanimura

Há mais de 20 anos Cathy Tanimura analisa dados para vários segmentos industriais, que vão do setor financeiro ao de software B2B e ao de serviços ao consumidor. Dedicada a conectar as pessoas e organizações aos dados dos quais elas precisam, Cathy construiu e gerenciou equipes e infraestruturas de dados em muitas das principais empresas de tecnologia.… Ver perfil completo ▶

Opinião dos leitores

Osdinei F P

Gostei do livro.

Ver todas ▼