Data Analyst Professional · Модуль 7 · Урок 24 із 51

Вибірка, похибка й довірчий інтервал

Sample statistic — це оцінка population parameter, а не точне число. Її невизначеність залежить не лише від N, а й від sampling frame, способу відбору, незалежності, variability та коректності формули.

90–120 хвUncertaintyМінітест: 3 питання

Population, frame, sample, estimate

ТермінПитанняПриклад
Target populationПро кого хочемо висновок?усі eligible visitors кварталу
Sampling frameКого реально можемо відібрати?users із consent і tracking
SampleХто потрапив у analysis?random 10% frame
StatisticЩо пораховано у sample?sample conversion rate
ParameterЩо невідоме у population?true population conversion rate

Навіть випадковий sample з неповного frame не виправляє coverage bias. Спочатку опишіть, хто не міг потрапити в дані.

Random error і systematic bias

Random sampling errorРізні випадкові samples дають різні estimates; з N зазвичай зменшується.
Coverage biasFrame не містить частину population.
Selection biasЙмовірність включення пов’язана з outcome.
Measurement biasІнструмент систематично спотворює value.

Більший N звужує random uncertainty, але не лікує systematic bias. Мільйон self-selected responses може бути дуже точним estimate не тієї population.

Standard error і confidence interval

Standard deviation описує spread observations; standard error — variability estimator між повторними samples. Для mean він часто масштабується як s / √n за відповідних assumptions.

WITH stats AS ( SELECT COUNT(*) AS n, AVG(load_time_ms)::numeric AS mean_ms, STDDEV_SAMP(load_time_ms)::numeric AS sd_ms FROM seowork_lab.stat_observations WHERE simple_sample ) SELECT *, sd_ms / SQRT(n) AS standard_error, mean_ms - 1.96 * sd_ms / SQRT(n) AS approx_ci_low, mean_ms + 1.96 * sd_ms / SQRT(n) AS approx_ci_high FROM stats;

Це навчальна normal approximation. У реальній роботі оберіть метод для metric/design: t‑interval при unknown variance, Wilson/other interval для proportion, cluster/weighted survey method або bootstrap; перевірте assumptions.

Правильне читання 95% CI

Frequentist interpretation

Якби ми багато разів повторювали sampling procedure і будували intervals тим самим методом, приблизно 95% таких intervals накрили б fixed population parameter. Це не означає, що 95% observations лежать у interval, і не гарантує відсутності bias.

Практика

  • Опишіть target population і sampling frame лабораторії.
  • Порівняйте full-table mean із simple_sample mean.
  • Порахуйте N, SD, SE та approximate 95% CI.
  • Збільште sample і відстежте ширину interval.
  • Запишіть assumptions, exclusions і bias, яких CI не враховує.

Офіційні джерела

Готовність до тесту

Ви розрізняєте population/frame/sample, random error і bias, SD та SE, і читаєте confidence interval без хибної впевненості.

Практична перевірка · урок 24 з 51

Закріпіть матеріал уроку

Три сценарні питання. Для зарахування уроку потрібно дати щонайменше дві правильні відповіді.

1. Що таке target population?
2. Що таке sampling frame?
3. Чи великий N усуває coverage bias?