Data Analyst Professional · Модуль 7 · Урок 23 із 51

Розподіл, середнє, медіана й варіативність

Одне середнє не описує дані. Професійний summary показує location, spread і shape, перевіряє skew, tails, outliers і сегменти, а вже потім обирає доречний показник «типового» значення.

90 хвExploratory statisticsМінітест: 3 питання

Три запитання до кожного числового поля

Location

Де центр: mean, median, mode або percentile?

Spread

Наскільки values різняться: range, IQR, variance, standard deviation?

Shape

Symmetric, skewed, heavy-tailed, multimodal чи з outliers?

Segments

Чи загальний distribution приховує різні populations?

Mean і median відповідають на різні питання

ПоказникСильна сторонаРизикПриклад
Meanвикористовує всі values; additive totalsчутливий до extreme valuesсередня витрата на всіх users
Medianстійка до outliers і skewне відображає сумарний економічний ефекттиповий час завантаження
Percentileпоказує tail/SLAпотребує достатнього N і стабільної definitionp95 response time
SELECT AVG(load_time_ms)::numeric(12,2) AS mean_ms, PERCENTILE_CONT(0.5) WITHIN GROUP (ORDER BY load_time_ms) AS median_ms, PERCENTILE_CONT(0.95) WITHIN GROUP (ORDER BY load_time_ms) AS p95_ms FROM seowork_lab.stat_observations;

Варіативність — частина результату

Дві групи можуть мати однакове mean і зовсім різний spread. Range залежить від extremes; IQR = p75−p25 описує центральні 50%; standard deviation має ті самі одиниці, що й поле, але її інтерпретація залежить від distribution та assumptions.

SELECT segment, COUNT(*) AS n, AVG(load_time_ms) AS mean_ms, STDDEV_SAMP(load_time_ms) AS sd_ms, PERCENTILE_CONT(0.75) WITHIN GROUP (ORDER BY load_time_ms) - PERCENTILE_CONT(0.25) WITHIN GROUP (ORDER BY load_time_ms) AS iqr_ms FROM seowork_lab.stat_observations GROUP BY segment;

Histogram — діагностика, не декорація

Histogram показує center, spread, skewness, outliers і кілька modes. Результат залежить від bin width: надто широкі bins приховують structure, надто вузькі створюють шум. Завжди додавайте N, unit, scope і period.

Не видаляйте outlier лише через box plot

Спочатку перевірте data quality, provenance і business event. Реальний великий order може бути найважливішим спостереженням.

Практична лабораторія

Завантажити synthetic statistics lab (.sql)

  • Порахуйте N, min/max, mean, median, p25/p75/p95, SD та IQR.
  • Порівняйте mean і median load_time; поясніть різницю.
  • Побудуйте distribution окремо для new/returning.
  • Знайдіть extreme values і перевірте їх provenance у генераторі.
  • Сформулюйте summary з center, spread, shape та limitation.

Офіційні джерела

Готовність до тесту

Ви не зводите distribution до average, обираєте mean/median/percentile за питанням і повідомляєте spread, shape, N та scope.

Практична перевірка · урок 23 з 51

Закріпіть матеріал уроку

Три сценарні питання. Для зарахування уроку потрібно дати щонайменше дві правильні відповіді.

1. Які три характеристики описують distribution?
2. Коли median часто доречніша за mean?
3. Що відбувається з mean у right-skewed data?