Data Analyst Professional · Модуль 7 · Урок 23 із 51
Розподіл, середнє, медіана й варіативність
Одне середнє не описує дані. Професійний summary показує location, spread і shape, перевіряє skew, tails, outliers і сегменти, а вже потім обирає доречний показник «типового» значення.
Три запитання до кожного числового поля
Де центр: mean, median, mode або percentile?
Наскільки values різняться: range, IQR, variance, standard deviation?
Symmetric, skewed, heavy-tailed, multimodal чи з outliers?
Чи загальний distribution приховує різні populations?
Mean і median відповідають на різні питання
| Показник | Сильна сторона | Ризик | Приклад |
|---|---|---|---|
| Mean | використовує всі values; additive totals | чутливий до extreme values | середня витрата на всіх users |
| Median | стійка до outliers і skew | не відображає сумарний економічний ефект | типовий час завантаження |
| Percentile | показує tail/SLA | потребує достатнього N і стабільної definition | p95 response time |
SELECT
AVG(load_time_ms)::numeric(12,2) AS mean_ms,
PERCENTILE_CONT(0.5) WITHIN GROUP (ORDER BY load_time_ms) AS median_ms,
PERCENTILE_CONT(0.95) WITHIN GROUP (ORDER BY load_time_ms) AS p95_ms
FROM seowork_lab.stat_observations;Варіативність — частина результату
Дві групи можуть мати однакове mean і зовсім різний spread. Range залежить від extremes; IQR = p75−p25 описує центральні 50%; standard deviation має ті самі одиниці, що й поле, але її інтерпретація залежить від distribution та assumptions.
SELECT segment,
COUNT(*) AS n,
AVG(load_time_ms) AS mean_ms,
STDDEV_SAMP(load_time_ms) AS sd_ms,
PERCENTILE_CONT(0.75) WITHIN GROUP (ORDER BY load_time_ms)
- PERCENTILE_CONT(0.25) WITHIN GROUP (ORDER BY load_time_ms) AS iqr_ms
FROM seowork_lab.stat_observations
GROUP BY segment;Histogram — діагностика, не декорація
Histogram показує center, spread, skewness, outliers і кілька modes. Результат залежить від bin width: надто широкі bins приховують structure, надто вузькі створюють шум. Завжди додавайте N, unit, scope і period.
Не видаляйте outlier лише через box plot
Спочатку перевірте data quality, provenance і business event. Реальний великий order може бути найважливішим спостереженням.
Практична лабораторія
Завантажити synthetic statistics lab (.sql)
- Порахуйте N, min/max, mean, median, p25/p75/p95, SD та IQR.
- Порівняйте mean і median load_time; поясніть різницю.
- Побудуйте distribution окремо для new/returning.
- Знайдіть extreme values і перевірте їх provenance у генераторі.
- Сформулюйте summary з center, spread, shape та limitation.
Офіційні джерела
Готовність до тесту
Ви не зводите distribution до average, обираєте mean/median/percentile за питанням і повідомляєте spread, shape, N та scope.
Закріпіть матеріал уроку
Три сценарні питання. Для зарахування уроку потрібно дати щонайменше дві правильні відповіді.