EssayAI
Блог
Блог
Математика и алгоритмы

Выборочный коэффициент корреляции: формула и расчёт

11 июня 2026Время чтения: 8 минут
#выборочный коэффициент корреляции#коэффициент пирсона#теория вероятностей#статистика#регрессия

Выборочный коэффициент корреляции - это число от минус единицы до единицы, которое показывает, насколько тесно связаны две количественные переменные по данным конкретной выборки. Его считают, когда есть парные наблюдения (рост и вес, время и выручка, температура и давление) и нужно понять, есть ли между ними линейная зависимость, и насколько она сильна. В отличие от «истинного» коэффициента корреляции генеральной совокупности, который обычно неизвестен, выборочный коэффициент вычисляется по конкретным nn парам чисел и служит его оценкой. Ниже разберём формулу, пошаговый расчёт через таблицу отклонений и типичные ошибки. Чтобы сразу увидеть, как разброс точек и знак связи меняют коэффициент, покрути калькулятор ниже - он строит диаграмму рассеяния и линию регрессии по тем же формулам, что разбираются дальше.

Что показывает выборочный коэффициент корреляции

Пусть есть nn пар наблюдений (x1,y1),(x2,y2),,(xn,yn)(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n). Выборочный коэффициент корреляции rr оценивает силу и направление линейной связи между XX и YY:

  • r=1r = 1 - точная прямая линейная связь (все точки лежат на возрастающей прямой);
  • r=1r = -1 - точная обратная линейная связь (точки на убывающей прямой);
  • r=0r = 0 - линейной связи нет (это не значит, что связи нет вообще: может быть сильная нелинейная зависимость);
  • промежуточные значения показывают, насколько плотно точки группируются вокруг некоторой прямой.

Важно помнить: rr измеряет именно линейную связь. Если точки образуют идеальную параболу, коэффициент корреляции может оказаться близким к нулю, хотя зависимость между переменными строгая - просто она не линейна.

На практике выборочный коэффициент корреляции считают в самых разных задачах: связь роста и веса в биометрии, зависимость выручки от расходов на рекламу в экономике, корреляция урожайности и количества осадков в агрономии, связь оценок по двум предметам в педагогике. Во всех этих случаях у исследователя есть не вся генеральная совокупность, а лишь ограниченная выборка наблюдений - поэтому и коэффициент называют выборочным: он оценивает истинную (генеральную) степень связи по доступным данным, и эта оценка сама по себе является случайной величиной, точность которой растёт с увеличением объёма выборки nn.

Формула выборочного коэффициента корреляции

Чаще всего используют формулу через суммы отклонений от выборочных средних:

r=SxySxxSyy,r = \frac{S_{xy}}{\sqrt{S_{xx}\, S_{yy}}},

где

Sxy=i=1n(xixˉ)(yiyˉ),Sxx=i=1n(xixˉ)2,Syy=i=1n(yiyˉ)2,S_{xy} = \sum_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y}), \qquad S_{xx} = \sum_{i=1}^{n} (x_i - \bar{x})^2, \qquad S_{yy} = \sum_{i=1}^{n} (y_i - \bar{y})^2,

а xˉ\bar{x} и yˉ\bar{y} - выборочные средние XX и YY. Величина SxyS_{xy} называется выборочной ковариацией (с точностью до деления на n1n-1), а SxxS_{xx} и SyyS_{yy} - суммами квадратов отклонений, из которых получаются выборочные дисперсии. Формула - это, по сути, косинус угла между центрированными векторами наблюдений, поэтому rr всегда лежит в пределах [1,1][-1, 1]: это гарантирует неравенство Коши-Буняковского.

Как посчитать вручную: таблица отклонений

Расчёт удобно вести по шагам в таблице с колонками xix_i, yiy_i, xixˉx_i - \bar{x}, yiyˉy_i - \bar{y}, их произведением и квадратами каждого отклонения:

Точки на диаграмме рассеяния постепенно расходятся вокруг прямой линии тренда; справа растёт числовое значение r, точно так же как в таблице отклонений при увеличении разброса
  1. Найти средние xˉ=1nxi\bar{x} = \frac{1}{n}\sum x_i и yˉ=1nyi\bar{y} = \frac{1}{n}\sum y_i.
  2. Для каждой точки вычислить отклонения xixˉx_i - \bar{x} и yiyˉy_i - \bar{y}.
  3. Перемножить отклонения в каждой строке и просуммировать - это даст SxyS_{xy}.
  4. Возвести каждое отклонение xixˉx_i - \bar{x} в квадрат и просуммировать - получится SxxS_{xx}; аналогично для yy - получится SyyS_{yy}.
  5. Подставить три суммы в формулу r=Sxy/SxxSyyr = S_{xy} / \sqrt{S_{xx} S_{yy}}.

Знак rr определяется знаком SxyS_{xy}: если бо́льшим значениям xix_i чаще соответствуют бо́льшие yiy_i (отклонения одного знака), сумма произведений положительна и связь прямая. Если бо́льшим xix_i чаще соответствуют меньшие yiy_i, произведения по большей части отрицательны и связь обратная.

Диаграмма отклонений: для каждой точки прямоугольник со сторонами (xi минус среднее по X) и (yi минус среднее по Y) показывает знак и величину её вклада в числитель Sxy
Диаграмма отклонений: для каждой точки прямоугольник со сторонами (xi минус среднее по X) и (yi минус среднее по Y) показывает знак и величину её вклада в числитель Sxy

Наглядно каждое слагаемое (xixˉ)(yiyˉ)(x_i - \bar x)(y_i - \bar y) можно представить как площадь прямоугольника со знаком: если точка находится в верхнем правом или нижнем левом «квадранте» относительно средних, прямоугольник положительный и усиливает прямую связь; если в верхнем левом или нижнем правом - отрицательный и тянет коэффициент к обратной связи.

Связь с линией регрессии и коэффициентом детерминации

Выборочный коэффициент корреляции тесно связан с коэффициентами линейной регрессии y=b0+b1xy = b_0 + b_1 x, построенной методом наименьших квадратов:

b1=SxySxx,b0=yˉb1xˉ.b_1 = \frac{S_{xy}}{S_{xx}}, \qquad b_0 = \bar{y} - b_1 \bar{x}.

Квадрат коэффициента корреляции r2r^2 называется коэффициентом детерминации: он показывает, какую долю разброса YY объясняет линейная зависимость от XX. Например, при r=0,8r = 0{,}8 коэффициент детерминации r2=0,64r^2 = 0{,}64 означает, что 64% вариации YY объясняется линейной связью с XX, а оставшиеся 36% приходятся на другие факторы и случайный разброс.

Шкала Чеддока: числовая ось от минус единицы до единицы разбита на зоны силы связи - слабая, умеренная, заметная, высокая, весьма высокая, с отметкой конкретного значения r
Шкала Чеддока: числовая ось от минус единицы до единицы разбита на зоны силы связи - слабая, умеренная, заметная, высокая, весьма высокая, с отметкой конкретного значения r

Для качественной оценки силы связи по значению r|r| используют шкалу Чеддока: до 0,30{,}3 - связь слабая или отсутствует, 0,30{,}3-0,50{,}5 - слабая, 0,50{,}5-0,70{,}7 - умеренная, 0,70{,}7-0,90{,}9 - сильная (заметная и высокая), выше 0,90{,}9 - весьма высокая. Шкала условна, но удобна для быстрой словесной интерпретации числа.

Пример решения типовой задачи

Даны пять пар наблюдений: xx: 2, 4, 6, 8, 10 и yy: 3, 7, 8, 12, 14. Найдём выборочный коэффициент корреляции.

Средние: xˉ=(2+4+6+8+10)/5=6\bar{x} = (2+4+6+8+10)/5 = 6, yˉ=(3+7+8+12+14)/5=8,8\bar{y} = (3+7+8+12+14)/5 = 8{,}8.

Отклонения по xx: 4,2,0,2,4-4, -2, 0, 2, 4; отклонения по yy: 5,8,1,8,0,8,3,2,5,2-5{,}8, -1{,}8, -0{,}8, 3{,}2, 5{,}2.

Произведения отклонений: 23,2; 3,6; 0; 6,4; 20,823{,}2;\ 3{,}6;\ 0;\ 6{,}4;\ 20{,}8, сумма Sxy=54S_{xy} = 54.

Квадраты отклонений xx: 16,4,0,4,1616, 4, 0, 4, 16, сумма Sxx=40S_{xx} = 40. Квадраты отклонений yy: 33,64; 3,24; 0,64; 10,24; 27,0433{,}64;\ 3{,}24;\ 0{,}64;\ 10{,}24;\ 27{,}04, сумма Syy=74,8S_{yy} = 74{,}8.

r=544074,8=5429925454,70,987.r = \frac{54}{\sqrt{40 \cdot 74{,}8}} = \frac{54}{\sqrt{2992}} \approx \frac{54}{54{,}7} \approx 0{,}987.

Значение очень близко к единице - связь весьма сильная и прямая: почти все точки лежат практически на одной прямой. Это согласуется с исходными данными: yy растёт почти пропорционально xx.

Частые ошибки

  • Деление на nn вместо использования сумм Sxx,Syy,SxyS_{xx}, S_{yy}, S_{xy} напрямую. Если считать через выборочные дисперсии и ковариацию с делителем n1n-1, множители n1n-1 в числителе и знаменателе взаимно сокращаются - итоговое rr не изменится, но при ручном счёте забывают сократить и получают неверное промежуточное число.
  • Путаница знака коэффициента. Знак rr равен знаку SxyS_{xy}, а не знаку отдельных xix_i или yiy_i. Смотреть нужно на совместное поведение отклонений от среднего, а не на исходные значения.
  • Интерпретация rr как доказательства причинности. Сильная корреляция не означает, что XX вызывает изменения YY - возможна обратная причинность или влияние третьей переменной.
  • Применение к нелинейной зависимости. Коэффициент Пирсона предназначен для линейных связей; для монотонных, но не линейных зависимостей лучше использовать ранговый коэффициент Спирмена.
  • Игнорирование выбросов. Одна аномальная точка может сильно исказить rr, особенно при малом nn - перед расчётом стоит визуально проверить диаграмму рассеяния.

FAQ

Чем выборочный коэффициент корреляции отличается от коэффициента корреляции генеральной совокупности? Коэффициент генеральной совокупности ρ\rho - теоретическая, обычно неизвестная величина. Выборочный коэффициент rr вычисляется по конкретным данным выборки и служит статистической оценкой ρ\rho; при увеличении объёма выборки rr приближается к ρ\rho.

Может ли выборочный коэффициент корреляции быть больше единицы по модулю? Нет, теоретически r1|r| \le 1 всегда, это следует из неравенства Коши-Буняковского. Если при ручном расчёте получилось r>1|r| > 1, значит, где-то допущена арифметическая ошибка в суммах отклонений.

Как проверить, что выборочный коэффициент корреляции статистически значим? Строится t-статистика t=rn2/1r2t = r\sqrt{n-2} / \sqrt{1-r^2} с n2n-2 степенями свободы и сравнивается с критическим значением распределения Стьюдента при выбранном уровне значимости; если t|t| превышает критическое значение, связь считается значимой.

Коротко

Выборочный коэффициент корреляции r=Sxy/SxxSyyr = S_{xy} / \sqrt{S_{xx} S_{yy}} измеряет силу и направление линейной связи между двумя переменными по данным выборки, принимает значения от минус единицы до единицы и связан с коэффициентами линейной регрессии (b1=Sxy/Sxxb_1 = S_{xy}/S_{xx}) и коэффициентом детерминации r2r^2. Расчёт сводится к таблице отклонений от выборочных средних: их произведения дают числитель, а квадраты отклонений - знаменатель формулы.

Доверьте текст нейросети EssayAI

Открыть EssayAI

Бесплатно, на русском языке и без VPN

Читайте также

Связь коэффициента корреляции и детерминации: r и R²

Связь коэффициента корреляции и детерминации: r и R²

Как связаны коэффициент корреляции и детерминации в парной регрессии: почему R квадрат равен квадрату r, что показывает каждый и где это правило ломается.

16 июня 20267 минут
Апостериорная вероятность гипотезы: формула Байеса

Апостериорная вероятность гипотезы: формула Байеса

Что такое апостериорная вероятность гипотезы и как её считать по формуле Байеса: разбор множителей, связь с полной вероятностью, пошаговый пример и типичные ошибки.

20 июня 20268 минут
Парадокс Монти Холла: почему выгодно менять дверь

Парадокс Монти Холла: почему выгодно менять дверь

Парадокс Монти Холла с тремя дверями простыми словами: почему смена выбора даёт вероятность выигрыша 2/3, разбор через перебор исходов и формулу Байеса, частые ошибки и FAQ.

20 июня 20268 минут
Условная вероятность: определение и пример с разбором

Условная вероятность: определение и пример с разбором

Что такое условная вероятность простыми словами: строгое определение через формулу, понятный пример с разбором по шагам, связь с независимостью событий и формулой Байеса.

20 июня 20267 минут
Вероятность через сочетания: формула и разбор

Вероятность через сочетания: формула и разбор

Как считать вероятность через сочетания: классическая формула, число сочетаний в числителе и знаменателе, разбор задач про урну, лотерею и карты с пошаговым решением.

20 июня 20267 минут
Формула Байеса: пример решения с разбором по шагам

Формула Байеса: пример решения с разбором по шагам

Формула Байеса: пример решения задачи о медицинском тесте и о двух урнах. Как пересчитать вероятность гипотезы после нового факта, формула полной вероятности и типичные ошибки.

19 июня 20268 минут