← Voltar para conteúdos

Estudo / projeto

Métodos Estatísticos para Exploração de Dados

Um guia prático sobre métodos estatísticos para exploração de dados, com exemplos do dataset Olist, para transformar números brutos em insights acionáveis.

Publicado em Jun 8, 2025

Métodos Estatísticos para Exploração de Dados

A exploração de dados (EDA) é potencializada por métodos estatísticos que ajudam a entender a estrutura e os padrões dos datasets. Como analista de dados, utilizo estatísticas para transformar números em insights acionáveis. Neste post, explico os principais métodos estatísticos que aplico em projetos, como minha análise do dataset Olist, e como eles guiam decisões estratégicas.

Por que Estatística na EDA?

Estatísticas fornecem uma base rigorosa para explorar dados, permitindo identificar tendências, validar hipóteses e preparar dados para modelagem. Esses métodos são a espinha dorsal de qualquer projeto de ciência de dados.

Métodos Estatísticos Chave

1. Estatísticas Descritivas

Resumem as características básicas de um dataset.

  • Métricas:
    • Média, mediana, moda.
    • Desvio padrão, variância.
    • Percentis (ex.: 25%, 75%).
  • Aplicação: Avaliar a centralidade e dispersão dos dados.

Exemplo Prático: No dataset Olist, calculei a média e o desvio padrão de order_value para entender a variabilidade dos pedidos.

import pandas as pd

df = pd.read_csv('olist_orders_dataset.csv')
mean_value = df['order_value'].mean()
std_value = df['order_value'].std()
print(f"Média: R${mean_value:.2f}, Desvio Padrão: R${std_value:.2f}")

2. Análise de Distribuição

Entender a forma da distribuição dos dados é crucial para escolher métodos de modelagem.

  • Técnicas:
    • Histogramas para visualizar a distribuição.
    • Testes de normalidade (ex.: Shapiro-Wilk).
    • Identificação de assimetria (skewness) e curtose.

Exemplo Prático: No Olist, usei um histograma para verificar que order_value tinha uma distribuição assimétrica à direita, sugerindo a necessidade de log-transformação.

import seaborn as sns
import matplotlib.pyplot as plt

sns.histplot(df['order_value'], bins=50)
plt.title('Distribuição de Valor de Pedidos')
plt.show()

3. Análise de Correlação

Identifica relações entre variáveis.

  • Métodos:
    • Coeficiente de Pearson (para variáveis contínuas).
    • Coeficiente de Spearman (para variáveis não paramétricas).
    • Mapas de calor para visualização.

Exemplo Prático: No Olist, calculei a correlação entre review_score e order_value, descobrindo uma relação positiva moderada (r = 0.35).

correlation = df[['review_score', 'order_value']].corr(method='pearson')
sns.heatmap(correlation, annot=True, cmap='coolwarm')
plt.title('Mapa de Calor de Correlações')
plt.show()

4. Detecção de Outliers

Outliers podem distorcer análises e precisam ser identificados.

  • Métodos:
    • Regra do IQR (Intervalo Interquartil): Q1 - 1.5IQR, Q3 + 1.5IQR.
    • Z-score para dados normalmente distribuídos.

Exemplo Prático: No Olist, usei a regra do IQR para identificar pedidos com order_value acima de R$5.000 como outliers.

Q1 = df['order_value'].quantile(0.25)
Q3 = df['order_value'].quantile(0.75)
IQR = Q3 - Q1
outliers = df[(df['order_value'] < Q1 - 1.5 * IQR) | (df['order_value'] > Q3 + 1.5 * IQR)]
print(f"Número de outliers: {len(outliers)}")

5. Testes de Hipóteses

Validam suposições sobre os dados.

  • Testes comuns:
    • Teste t para comparar médias de dois grupos.
    • Teste qui-quadrado para variáveis categóricas.
  • Aplicação: Confirmar se diferenças observadas são estatisticamente significativas.

Exemplo Prático: Testei se a média de order_value em São Paulo era significativamente maior que no Rio de Janeiro usando um teste t.

from scipy.stats import ttest_ind

sp = df[df['state'] == 'SP']['order_value']
rj = df[df['state'] == 'RJ']['order_value']
t_stat, p_value = ttest_ind(sp, rj)
print(f"p-valor: {p_value:.4f}")

Impacto no Negócio

Métodos estatísticos transformam dados brutos em insights confiáveis. Na ReConverte, usei análise de correlação e detecção de outliers para otimizar campanhas de marketing, resultando em um aumento de 15% na taxa de conversão. No projeto Olist, testes de hipóteses validaram estratégias regionais de vendas.

Conclusão

Métodos estatísticos são a base para uma EDA robusta. Com ferramentas como Python e SQL, consigo extrair insights precisos e preparar dados para modelagem avançada. Quer explorar mais? Veja meu projeto Olist no GitHub!


Escrito por Jefferson Peixoto, transformando dados em decisões estratégicas.

Jefferson Peixoto | Data & AI Analyst