Data Analyst Professional · Модуль 7 · Урок 24 із 51
Вибірка, похибка й довірчий інтервал
Sample statistic — це оцінка population parameter, а не точне число. Її невизначеність залежить не лише від N, а й від sampling frame, способу відбору, незалежності, variability та коректності формули.
Population, frame, sample, estimate
| Термін | Питання | Приклад |
|---|---|---|
| Target population | Про кого хочемо висновок? | усі eligible visitors кварталу |
| Sampling frame | Кого реально можемо відібрати? | users із consent і tracking |
| Sample | Хто потрапив у analysis? | random 10% frame |
| Statistic | Що пораховано у sample? | sample conversion rate |
| Parameter | Що невідоме у population? | true population conversion rate |
Навіть випадковий sample з неповного frame не виправляє coverage bias. Спочатку опишіть, хто не міг потрапити в дані.
Random error і systematic bias
Більший N звужує random uncertainty, але не лікує systematic bias. Мільйон self-selected responses може бути дуже точним estimate не тієї population.
Standard error і confidence interval
Standard deviation описує spread observations; standard error — variability estimator між повторними samples. Для mean він часто масштабується як s / √n за відповідних assumptions.
WITH stats AS (
SELECT COUNT(*) AS n,
AVG(load_time_ms)::numeric AS mean_ms,
STDDEV_SAMP(load_time_ms)::numeric AS sd_ms
FROM seowork_lab.stat_observations
WHERE simple_sample
)
SELECT *,
sd_ms / SQRT(n) AS standard_error,
mean_ms - 1.96 * sd_ms / SQRT(n) AS approx_ci_low,
mean_ms + 1.96 * sd_ms / SQRT(n) AS approx_ci_high
FROM stats;Це навчальна normal approximation. У реальній роботі оберіть метод для metric/design: t‑interval при unknown variance, Wilson/other interval для proportion, cluster/weighted survey method або bootstrap; перевірте assumptions.
Правильне читання 95% CI
Frequentist interpretation
Якби ми багато разів повторювали sampling procedure і будували intervals тим самим методом, приблизно 95% таких intervals накрили б fixed population parameter. Це не означає, що 95% observations лежать у interval, і не гарантує відсутності bias.
Практика
- Опишіть target population і sampling frame лабораторії.
- Порівняйте full-table mean із simple_sample mean.
- Порахуйте N, SD, SE та approximate 95% CI.
- Збільште sample і відстежте ширину interval.
- Запишіть assumptions, exclusions і bias, яких CI не враховує.
Офіційні джерела
Готовність до тесту
Ви розрізняєте population/frame/sample, random error і bias, SD та SE, і читаєте confidence interval без хибної впевненості.
Закріпіть матеріал уроку
Три сценарні питання. Для зарахування уроку потрібно дати щонайменше дві правильні відповіді.