Пример нахождения статистической значимости коэффициентов регрессии

Пример нахождения статистической значимости коэффициентов регрессии

Числитель в этой формуле может быть рассчитан через коэффициент детерминации и общую дисперсию признака-результата: . Для параметра a критерий проверки гипотезы о незначимом отличии его от нуля имеет вид: , где - оценка параметра регрессии, полученная по наблюдаемым данным; μa – стандартная ошибка параметра a. Для линейного парного уравнения регрессии: . Для проверки гипотезы о незначимом отличии от нуля коэффициента линейной парной корреляции в генеральной совокупности используют следующий критерий: , где ryx - оценка коэффициента корреляции, полученная по наблюдаемым данным; mr – стандартная ошибка коэффициента корреляции ryx. Для линейного парного уравнения регрессии: . В парной линейной регрессии между наблюдаемыми значениями критериев существует взаимосвязь: t ( b =0) = t (r=0).

Пример №1 . Уравнение имеет вид y=ax+b 1. Параметры уравнения регрессии. Средние значения

По таблице Стьюдента находим Tтабл Tтабл (n-m-1;a) = (10;0.05) = 1.812 Поскольку Tнабл > Tтабл , то отклоняем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициента корреляции статистически - значим.

Анализ точности определения оценок коэффициентов регрессии

Рассчитаем границы интервала, в котором будет сосредоточено 95% возможных значений Y при неограниченно большом числе наблюдений и X = 88,16 (128.06;163.97) Проверка гипотез относительно коэффициентов линейного уравнения регрессии 1) t-статистика

Статистическая значимость коэффициента регрессии a подтверждается (3.41>1.812).

Статистическая значимость коэффициента регрессии b подтверждается (2.7>1.812). Доверительный интервал для коэффициентов уравнения регрессии Определим доверительные интервалы коэффициентов регрессии, которые с надежность 95% будут следующими (tтабл=1.812): (a - tтабл·S a; a + tтабл·Sa) (0.4325;1.4126) (b - tтабл·S b; b + tтабл·Sb) (21.3389;108.3164) 2) F-статистики

Fkp = 4.96 Поскольку F > Fkp, то коэффициент детерминации статистически значим.

Решение находим с помощью калькулятора. Использование графического метода . Этот метод применяют для наглядного изображения формы связи между изучаемыми экономическими показателями. Для этого в прямоугольной системе координат строят график, по оси ординат откладывают индивидуальные значения результативного признака Y, а по оси абсцисс - индивидуальные значения факторного признака X. Совокупность точек результативного и факторного признаков называется полем корреляции. На основании поля корреляции можно выдвинуть гипотезу (для генеральной совокупности) о том, что связь между всеми возможными значениями X и Y носит линейный характер. Линейное уравнение регрессии имеет вид y = bx + a + ε Здесь ε - случайная ошибка (отклонение, возмущение). Причины существования случайной ошибки: 1. Невключение в регрессионную модель значимых объясняющих переменных; 2. Агрегирование переменных. Например, функция суммарного потребления – это попытка общего выражения совокупности решений отдельных индивидов о расходах. Это лишь аппроксимация отдельных соотношений, которые имеют разные параметры. 3. Неправильное описание структуры модели; 4. Неправильная функциональная спецификация; 5. Ошибки измерения. Так как отклонения εi для каждого конкретного наблюдения i – случайны и их значения в выборке неизвестны, то: 1) по наблюдениям xi и yi можно получить только оценки параметров α и β 2) Оценками параметров α и β регрессионной модели являются соответственно величины а и b, которые носят случайный характер, т.к. соответствуют случайной выборке; Тогда оценочное уравнение регрессии (построенное по выборочным данным) будет иметь вид y = bx + a + ε, где ei – наблюдаемые значения (оценки) ошибок εi, а и b соответственно оценки параметров α и β регрессионной модели, которые следует найти. Для оценки параметров α и β - используют МНК (метод наименьших квадратов). Система нормальных уравнений.

Линейный коэффициент корреляции принимает значения от –1 до +1. Связи между признаками могут быть слабыми и сильными (тесными). Их критерии оцениваются по шкале Чеддока: 0.1 < rxy < 0.3: слабая; 0.3 < rxy < 0.5: умеренная; 0.5 < rxy < 0.7: заметная; 0.7 < rxy < 0.9: высокая; 0.9 < rxy < 1: весьма высокая; В нашем примере связь между среднедневной заработной платы и среднедушевым прожиточным минимумом высокая и прямая. 1.2. Уравнение регрессии (оценка уравнения регрессии).

Линейное уравнение регрессии имеет вид y = 0.92 x + 76.98 Коэффициентам уравнения линейной регрессии можно придать экономический смысл. Коэффициент b = 0.92 показывает среднее изменение результативного показателя (в единицах измерения у) с повышением или понижением величины фактора х на единицу его измерения. В данном примере с увеличением на 1 руб. среднедушевого прожиточного минимума в день среднедневная заработная плата повышается в среднем на 0.92. Коэффициент a = 76.98 формально показывает прогнозируемый уровень Среднедневная заработная плата , но только в том случае, если х=0 находится близко с выборочными значениями. Подставив в уравнение регрессии соответствующие значения х, можно определить выровненные (предсказанные) значения результативного показателя y(x) для каждого наблюдения. Связь между среднедневной заработной платы и среднедушевого прожиточного минимума в день определяет знак коэффициента регрессии b (если > 0 – прямая связь, иначе - обратная). В нашем примере связь прямая. Коэффициент эластичности. Коэффициенты регрессии (в примере b) нежелательно использовать для непосредственной оценки влияния факторов на результативный признак в том случае, если существует различие единиц измерения результативного показателя у и факторного признака х. Для этих целей вычисляются коэффициенты эластичности и бета - коэффициенты. Коэффициент эластичности находится по формуле:

Sb - стандартное отклонение случайной величины b.

(76.98 + 0.92*94 ± 7.8288) (155.67;171.33) С вероятностью 95% можно гарантировать, что значения Y при неограниченно большом числе наблюдений не выйдет за пределы найденных интервалов. 2.5. Проверка гипотез относительно коэффициентов линейного уравнения регрессии. 1) t-статистика. Критерий Стьюдента. Проверим гипотезу H0 о равенстве отдельных коэффициентов регрессии нулю (при альтернативе H1 не равно) на уровне значимости α=0.05. tкрит = (10;0.05) = 1.812

Поскольку 3.1793 > 1.812, то статистическая значимость коэффициента регрессии a подтверждается (отвергаем гипотезу о равенстве нулю этого коэффициента). Доверительный интервал для коэффициентов уравнения регрессии. Определим доверительные интервалы коэффициентов регрессии, которые с надежность 95% будут следующими: (b - tкрит Sb; b + tкрит Sb) (0.9204 - 1.812·0.2797; 0.9204 + 1.812·0.2797) (0.4136;1.4273) С вероятностью 95% можно утверждать, что значение данного параметра будут лежать в найденном интервале. (a-ta) (76.9765 - 1.812·24.2116; 76.9765 + 1.812·24.2116) (33.1051;120.8478) С вероятностью 95% можно утверждать, что значение данного параметра будут лежать в найденном интервале. 2) F-статистики. Критерий Фишера. Проверка значимости модели регрессии проводится с использованием F-критерия Фишера, расчетное значение которого находится как отношение дисперсии исходного ряда наблюдений изучаемого показателя и несмещенной оценки дисперсии остаточной последовательности для данной модели. Если расчетное значение с k1=(m) и k2=(n-m-1) степенями свободы больше табличного при заданном уровне значимости, то модель считается значимой.

📎📎📎📎📎📎📎📎📎📎