Каждый раз, когда я консультирую аспирантов и врачей-исследователей, повторяется одна и та же история. Человек уже собрал данные, обработал их в SPSS или R, получил результат — а потом выясняется, что выборки не хватило. Эффект вроде бы есть, а p-value не дотягивает до 0.05. Или наоборот — различие «статистически значимо», но такое крошечное, что клинического смысла в нём нет.
Причина в обоих случаях одна: размер выборки не был рассчитан заранее.
Размер выборки — это не формальность для раздела «Материалы и методы». Это то, что определяет, найдёте ли вы эффект вообще и будете ли ему доверять. В этой статье разберу, как рассчитать размер выборки правильно и какие ошибки допускают чаще всего.
Что такое размер выборки и зачем его считать
Представьте, что вы проверяете новый препарат от гипертонии. Гипотеза: он снижает давление сильнее, чем стандартная терапия.
Вы набрали 20 пациентов — 10 в каждой группе. Через месяц разница в давлении — 4 мм рт. ст. Звучит неплохо? Но при таком размере выборки стандартная ошибка среднего настолько велика, что это различие легко объяснить случайностью.
Набрали бы 200 пациентов — и то же различие в 4 мм рт. ст. стало бы статистически значимым.
Размер выборки — это ответ на вопрос: сколько наблюдений нужно, чтобы с высокой вероятностью обнаружить эффект такого размера, если он реально существует.
Считать его нужно до начала сбора данных. Если считать после — это уже не планирование, а подгонка.
Четыре параметра, без которых не обойтись
В основе любого расчёта размера выборки лежат четыре величины. Разберём каждую.
1. Размер эффекта (effect size)
Это величина различия, которое вы хотите обнаружить. Может выражаться по-разному:
- Cohen's d — для сравнения средних: разница между средними, делённая на стандартное отклонение
- Разница долей — для сравнения частот
- Коэффициент корреляции — для связи между переменными
- η² (eta-squared) — для ANOVA
Как выбрать размер эффекта для расчёта:
- Из литературы. Посмотрите похожие исследования — какой эффект они обнаружили?
- Из пилота. Проведите маленькое предварительное исследование.
- Из клинической значимости. Какой эффект будет считаться клинически значимым? Даже если он маленький.
- Консервативно. Если не знаете — берите эффект меньше ожидаемого. Тогда выборка будет больше, и мощности точно хватит.
Ориентиры для Cohen's d:
| d | Интерпретация |
|---|---|
| 0.2 | малый эффект |
| 0.5 | средний эффект |
| 0.8 | большой эффект |
2. Мощность (power)
Мощность — вероятность обнаружить эффект, если он существует. Стандарт — 80%. Для критичных исследований (клинические испытания, диссертации) — 90% или 95%.
Что значит 80%? Если эффект реально есть, вы обнаружите его в 80% случаев. В 20% — не обнаружите и получите ложноотрицательный результат.
Повышение мощности резко увеличивает размер выборки: с 80% до 90% выборка растёт примерно на 30%.
3. Уровень значимости α
α — допустимая вероятность ложноположительного результата. Стандарт — 0.05. Это значит: в 5% случаев вы найдёте «значимое» различие, когда его нет.
Для строгих исследований берут 0.01 — но выборка при этом вырастет.
4. Отсев (dropout)
Не все участники дойдут до конца: кто-то откажется, кто-то выпадет из наблюдения, кто-то потеряет данные. Обычно закладывают 10–20%.
Если расчёт дал 100 человек — при 15% отсеве нужно набрать 118.
Формулы для типовых исследований
Разберу пять основных случаев.
Сравнение двух средних (t-тест)
Задача: сравнить среднее в двух независимых группах.
Формула: n = 2 · (Zα/2 + Zβ)² / d²
Где:
- n — размер каждой группы
- Zα/2 — критическое значение для α (при α = 0.05 двусторонний: 1.96)
- Zβ — критическое значение для мощности (при 80%: 0.84)
- d — Cohen's d
Пример. Хотите обнаружить различие в гемоглобине между двумя группами. Ожидаемый эффект — d = 0.6 (средний). α = 0.05, мощность 80%.
n = 2 · (1.96 + 0.84)² / 0.6² = 2 · 7.84 / 0.36 = 43.5
Округляем вверх: 44 человека в каждой группе, 88 всего. С учётом 10% отсева — по 49 в каждой, 98 всего.
Сравнение долей (χ²)
Задача: сравнить частоту события в двух группах.
Формула: n = (Zα/2 + Zβ)² · (p₁(1−p₁) + p₂(1−p₂)) / (p₁ − p₂)²
Пример. Хотите показать, что новый метод снижает частоту осложнений с 30% до 15%. α = 0.05, мощность 80%.
n = 7.84 · (0.3 · 0.7 + 0.15 · 0.85) / 0.15² = 7.84 · 0.3375 / 0.0225 ≈ 118
118 человек в каждой группе, 236 всего.
Корреляция
Задача: обнаружить связь между двумя переменными.
Через z-преобразование Фишера:
n = (Zα/2 + Zβ)² / Zᵣ² + 3
Где Zᵣ = 0.5 · ln((1+r)/(1−r)).
Пример. Хотите обнаружить корреляцию r = 0.3 при α = 0.05 и мощности 80%.
Zᵣ = 0.5 · ln(1.3/0.7) ≈ 0.31.
n = 7.84 / 0.096 + 3 ≈ 85 человек.
ANOVA (сравнение трёх и более групп)
Задача: сравнить средние в k независимых группах.
Размер выборки зависит от числа групп и η² (доли объяснённой дисперсии).
Ориентиры для η²:
| η² | Интерпретация |
|---|---|
| 0.01 | малый эффект |
| 0.06 | средний эффект |
| 0.14 | большой эффект |
При k = 3, η² = 0.06, α = 0.05, мощности 80% — примерно 53 человека на группу.
Парный t-тест
Как для двух средних, но выборка в 2 раза меньше — потому что сравниваются одни и те же объекты.
Как считать на практике
Способ 1. Онлайн-калькулятор
Самый быстрый способ — использовать готовый инструмент. Я собрал калькулятор размера выборки, который считает все пять случаев:
- сравнение двух средних
- сравнение долей
- корреляция
- ANOVA
- парные измерения
Плюс:
- непараметрические тесты — с автоматической поправкой на меньшую эффективность (Mann-Whitney, Wilcoxon, Kruskal-Wallis, Spearman)
- режим post-hoc мощности — если данные уже собраны, можно узнать, хватило ли выборки
- поправка на отсев — сразу даёт итоговое число с запасом
Калькулятор бесплатный, работает без регистрации, данные никуда не отправляются — всё считается в браузере.
Способ 2. G*Power
Бесплатная программа, установленная на компьютер. Мощная, но требует понимания параметров. Подходит, если у вас есть время разобраться.
Способ 3. R или Python
R
library(pwr)
pwr.t.test(d = 0.6, sig.level = 0.05, power = 0.8, type = "two.sample")
python
Python
from statsmodels.stats.power import TTestIndPower
analysis = TTestIndPower()
analysis.solve_power(effect_size=0.6, alpha=0.05, power=0.8)
Если вы работаете с R или Python постоянно — этот способ самый гибкий.
Частые ошибки при расчёте
1. Расчёт post factum
Считать размер выборки после сбора данных — бессмысленно. Вы просто подгоните результат под то, что получилось. Считать нужно всегда до.
2. Завышенный размер эффекта
Берут из литературы эффект, который был в идеальных условиях, и получают маленькую выборку. Реальный эффект в вашем исследовании может быть меньше. Берите консервативную оценку.
3. Игнорирование отсева
Рассчитали 100 человек, набрали 100 — к концу исследования осталось 78. Не хватило мощности. Всегда закладывайте 10–20% запаса.
4. Множественные сравнения без поправки
Если сравниваете 5 групп попарно — это 10 сравнений. Без поправки (Бонферрони, Холма) α «размножается» и растёт вероятность ложноположительного результата. При расчёте это нужно учитывать.
5. Одно исследование на все случаи
Размер выборки для основной цели и для второстепенных задач исследования различается. Планируйте отдельно под каждую гипотезу.
Что делать, если выборка уже собрана
Бывает и так: данные уже есть, а размер выборки задним числом не считался. Что делать?
Post-hoc расчёт мощности. Он покажет, какой эффект вы могли бы обнаружить при имеющейся выборке. Если мощность < 80% — результат «не значимо» может быть следствием не отсутствия эффекта, а недостатка наблюдений.
Это нужно обязательно указать в статье или диссертации: «При имеющемся размере выборки n = 45 мощность исследования составляла 62% для обнаружения эффекта d = 0.5. Полученный результат следует интерпретировать с осторожностью».
Честное признание ограничения — лучше, чем делать вид, что выборки хватило.
Итог
Размер выборки — это не «одна строчка в методах», а фундамент, на котором стоит вся статистика вашего исследования.
Алгоритм:
Определите размер эффекта, который хотите обнаружить
Задайте мощность (обычно 80%, для критичных — 90%)
Задайте α (обычно 0.05)
Выберите тип исследования (две группы, доли, корреляция, ANOVA)
Посчитайте по формуле или в калькуляторе
Добавьте 10–20% на отсев
Округлите вверх — выборка должна быть целым числом наблюдений
Это займёт 15 минут. А сэкономит вам месяцы работы и сотни часов пересборки данных.
Что дальше? После того как размер выборки рассчитан, встаёт следующий вопрос: какой статистический критерий применить к этим данным? Для этого у меня есть подбор статистического критерия — интерактивный помощник, который задаёт несколько вопросов и рекомендует подходящий тест.
Все инструменты — на одной странице: ССЫЛКА НА СТРАНИЦУ С ИНСТРУМЕНТАМИ
Если нужна помощь с конкретным исследованием — напишите мне. Разберём ваш случай отдельно.
Если статья была полезна — поделитесь с коллегами, которые сейчас планируют исследование. Пусть считают размер выборки заранее, а не переделывают анализ post factum.