Обнаружение гетероскедастичности. Методы обнаружения гетероскедастичности

Обнаружение гетероскедастичности

В случае парной регрессии о проявлении гетероскедастичности можно судить по характеру расположения экспериментальных точек на корреляционном поле (рис. 5.1). На рис. 5.1 можно заметить, что дисперсии случайных отклонений неодинаковы и увеличиваются с возрастанием значений объясняющей переменной. Однако даже для парной регрессии выводы по определению гетероскедастичности могут являться неоднозначными при наличии локальных «выбросов» точек (пиков на диаграмме рассеивания). Естественно, что для множественной регрессии обнаружение гетероскедастичности является значительно более сложной задачей, чем для моделей с одним регрессором.

В настоящее время существует достаточно большое количество тестов для поверки на гетероскедастичность, базирующихся на дисперсионном анализе случайных отклонений. Рассмотрим наиболее распространенные из них.

Тест ранговой корреляции Спирмена . Идея данного теста заключается в том, что в случае гетероскедастичности дисперсия случайного отклонения будет либо увеличиваться, либо уменьшаться с увеличением значений регрессоров Х . Поэтому для регрессионной модели, построенной по МНК, абсолютные значения оценок отклонений e i и значения x i будут коррелированны.

Значения e i и x i ранжируются (упорядочиваются по величинам). Номеру i значения x i в упорядоченном ряду будет соответствовать ранг r xi . Аналогично упорядочим данные по абсолютным значениям остатков и каждому |e i | припишем ранг r ei . Тогда разность между рангами (d i ) запишем как d i = r xi - r ei . Например, если x 20 является 25-м по величие среди всех значений X , а e 20 является 30-м, то d i = 25 - 30 = -5.

Коэффициент ранговой корреляции Спирмена вычисляется по формуле

(5.2)

где n - число наблюдений.

Доказано, что при n > 10 статистика

(5.3)

имеет t -распределение Стьюдента с числом степеней свободы v = n - 2.

Следовательно, в соответствии со схемой проверки статистических гипотез, если наблюдаемое значение t -статистики, рассчитанное по формуле (5.3), превышает t кр = t a , n - 2 (табличное), то необходимо отклонить гипотезу Н 0 об отсутствии гетероскедастичности. В противном случае гипотеза Н 0 принимается, что соответствует гомоскедастичности.

Если анализируется модель множественной регрессии, то проверка гипотезы осуществляется с помощью t -статистики для каждой объясняющей переменной отдельно.

Следует заметить, что коэффициент ранговой корреляции Спирмена (r ) может иметь самостоятельное значение в эконометрических исследованиях. Он используется при установлении тесноты связи между порядковыми переменными. В этом случае анализируемые объекты упорядочивают по степени влияния (проявления) признака. Если объекты ранжированы по двум признакам Х иY , то имеется возможность оценить тесноту связи между этими переменными, основываясь на рангах. В том случае, если ранги всех объектов равны, то r = 1 (полная прямая связь). При полной обратной связи ранги объектов по двум переменным расположены в обратном порядке и r = -1. Во всех остальных случаях |r | < 1. Применение коэффициента ранговой корреляции не требует нормального распределения переменных и линейной связи между ними. Однако необходимо учитывать, что в случае количественных переменных переход от их первоначальных значений и размерностей к рангам сопровождается определенной потерей информации.

Тест Голдфелда-Квандта. Этот тест использует предположения о нормальности распределения случайных отклонений и о пропорциональности средних квадратических (стандартных) отклонений σ i = σ(e i ) значениям соответствующей объясняющей переменной X .

В рамках этих предположений Голдфелд и Квандт предложили следующую процедуру проверки на гетероскедастичность:

1. Все n наблюдений упорядочиваются в порядке возрастания значений регрессора X , и выборка после этого разбивается на три подвыборки размерностей k , n - 2k , k соответственно.

2. Оцениваются отдельные регрессии для первой и третьей подвыборок (рассматриваем k первых значений и k последних; средние n - 2k наблюдений отбрасываем).

3. Если, в соответствии с нашим предположением, дисперсия случайных отклонений увеличивается с ростом X , то дисперсия регрессии по первой подвыборке (сумма квадратов остатков ) будет существенно меньше дисперсии регрессии по третьей подвыборке (суммы квадратов остатков ).

4. Для сравнения соответствующих дисперсий определяется следующая F -статистика:

. (5.4)

Здесь (k - m - 1) – числа степеней свободы соответствующих выборочных дисперсий (m - одинаковое количество объясняющих переменных в уравнениях регрессии). При выполнении начальных предположений относительно остатков построенная F -статистика имеет распределение Фишера с числами степеней свободы v 1 = v 2 = k - m - 1.

5. Если наблюдаемое значение F -статистики (F набл ), рассчитанное по формуле (5.4), превосходит ее критическое значение , то гипотеза об отсутствии гетероскедастичности (о равенстве дисперсий) отклоняется на выбранном уровне значимости a.

Мощность теста Голдфелда-Квандта, т. е. вероятность отвергнуть гипотезу об отсутствии гетероскедастичности в случае, когда ее действительно нет, оказывается максимальной, если выбирать k » n /3.

Для множественной регрессии данный тест может осуществляться для каждой из объясняющих переменных или для одного выбранного регрессора, который в наибольшей степени связан с σ i .

Аналогичный тест может быть использован при условии обратной пропорциональности между стандартными отклонениями остатков σ i и значениями объясняющей переменной. При этом статистика Фишера примет вид: F = S 1 /S 3 .

Тест Уайта. Сущность данного теста заключается в том, что если в модели присутствует гетероскедастичность, то дисперсии случайных отклонений некоторым образом зависят от регрессоров; т. е. гетероскедастичность должна как-то проявляться в поведении остатков исходной регрессионной модели. Исходя из этого при использовании теста Уайта предполагается, что дисперсии остатков представляют собой некоторую функцию от наблюдаемых значений объясняющих переменных

Для получения соответствующих выводов осуществляется оценка функции (5.5) с помощью уравнения регрессии для квадратов остатков:

где v i - случайный член.

На практике чаще всего функция f выбирается квадратичной, а регрессоры в уравнении (5.6) – это регрессоры исходной модели, их квадраты и, возможно, попарные произведения. Для данного теста гипотеза об отсутствии гетероскедастичности, что соответствует условию f = const , принимается в случае незначимости регрессии (5.6) в целом.

Следует заметить, что во всех рассматриваемых тестах (критериях) осуществляется проверка нулевой гипотезы Н 0 об отсутствии гетероскедастичности.

Лекция 5. Гетероскедастичность и автокорреляция регрессионных остатков

Литература:

Эконометрика: учебник / И.И. Елисеева, С.В. Курышева, Т.В. Костеева и др.; под ред. И.И. Елисеевой. – М.: Финансы и статистика, 2006.

Бородич С.А. Эконометрика: учебное пособие. – Минск: ООО «Новое знание», 2005 – 408с.

Еремеева Н.С., Лебедева Т.В. Эконометрика: учебн. Пособие для вузов. – Оренбург: ОАО «ИПК «Южный Урал», 2010. – 296 с.

Кремер Н.Ш. Эконометрика: учебник (Н.Ш. Кремер, Б.А. Путко). – М.: ЮНИТИ-ДАНА, 2006 – 311с.

1. Гетероскедастичность. Тесты на гетероскедастичность

2. Автокорреляция регрессионных остатков. Методы выявления

3. Обобщенный метод наименьших квадратов для смягчения гетероскедастичности и устранения автокорреляции

Для получения качественных оценок параметров уравнения регрессии необходимо следить за выполнимостью предпосылок МНК. Применяя МНК мы предполагаем, что остатки ε i подчиняются условиям Гаусса-Маркова, данное предположение необходимо проверить, после построения уравнения регрессии.

1. Гетероскедастичность. Тесты на гетероскедастичность

Допущение о постоянстве дисперсии остатков известно какдопущение о гомоскедастичности. Если это допущение нарушено и дисперсия остатков не является постоянной, то говорят, что оценки гетероскедастичны.

На практике, для каждого i-го наблюдения определяется единственное значение ε i , но мы говорим об определении дисперсии остатков, т.е. о множестве ε i для каждого i-го наблюдения. Это объясняется тем, что мы имеем дело с выборочной совокупностью, а априори ε i могли принимать любые значения на основе некоторых вероятностных распределений.

Гетероскедастичность приводит к тому, что коэффициенты регрессии не являются оценками с минимальной дисперсией, следовательно, они больше не являются наиболее эффективными коэффициентами. Вследствие, выводы, получаемые на основе t и F-статистик, а также интервальные оценки будут ненадежными. Дисперсии и, следовательно, стандартные ошибки этих коэффициентов будут смещенными. Если смещение отрицательно, то оценочные стандартные ошибки будут меньше, чем они должны быть, а критерий проверки - больше чем в реальности. Таким образом, можно сделать вывод, что коэффициент значим, когда он таковым не является. И наоборот если смещение положительно, то оценочные ошибки будут больше чем они должны быть, а критерии проверки - меньше. Значит, возможно ошибочное принятие нулевой гипотезы.

Обнаружение гетероскедастичности

Существует несколько формальных тестов, позволяющих обнаружить гетероскедастичность (графический анализ остатков, тест ранговой корреляции Спирмена, тест Парка, тест Голфелда-Квандта, тест Уайта).

Графический анализ остатков

Использование графического представления отклонений позволяет определиться с наличием гетероскедастичности. В этом случае по оси абсцисс откладываются значения x i объясняющей переменной X (либо линейной комбинации объясняющих переменных

а по оси ординат либо отклонения ε i либо их квадраты , i = 1, 2, ..., п . Если все отклонения находятся внутри полуполосы постоянной ширины, параллельной оси абсцисс, это говорит о независимости дисперсий от значений переменной X и их постоянстве, т.е. в этом случае выполняются условия гомоскедастичности. Графический анализ отклонений является удобным и достаточно надежным в случае парной регрессии.

Обычно не ограничиваются визуальной проверкой гетероскедастичности, а проводят ее эмпирическое подтверждение.

5 Модели с гетероскедастичными остатками Причиной непостоянства дисперсии эконометрической модели часто является ее зависимость от масштаба рассматриваемых явлений. В модель ошибка входит как аддитивное слагаемое. В то же время часто она имеет относительный характер и определяется по отношению к измеренному уровню рассматриваемых факторов.

7 Примеры моделей с гетероскедастичным случайным членом а)в)б) а) Дисперсия 2 растет по мере увеличения значений объясняющей переменной X б) Дисперсия 2 имеет наибольшие значения при средних значениях X, уменьшаясь по мере приближения к крайним значениям в) Дисперсия ошибки наибольшая при малых значениях X, быстро уменьшается и становится однородной по мере увеличения X

12 Источники гетероскедастичности – 2 Истинная гетероскедастичность возникает также и во временных рядах, когда зависимая переменная имеет большой интервал качественно неоднородных значений или высокий темп изменения (инфляция, технологические сдвиги, изменения в законодательстве, потребительские предпочтения и т.д.).

15 Последствия гетероскедастичности 1. Истинная гетероскедастичность не приводит к смещению оценок коэффициентов регрессии 2. Стандартные ошибки коэффициентов (вычисленные в предположении. гомоскедастичности) будут занижены. Это приведет к завышению t-статистик и даст неправильное (завышенное) представление о точности оценок.

16 Обнаружение гетероскедастичности Обнаружение гетероскедастичности в каждом конкретном случае – довольно сложная задача. Для знания необходимо знать распределение случайной величины Y/X=x i. На практике часто для каждого конкретного значения x i известно лишь одно y i, что не позволяет оценить дисперсию случайной величины Y/X=x i. Не существует какого-либо однозначного метода определения гетероскедастичности.

19 Тест ранговой корреляции Спирмена При использовании данного теста предполагается, что дисперсии отклонений остатков будут монотонно изменяться (увеличиваться или уменьшаться) с увеличением фактора пропорциональности Z. Поэтому значения e i и z i будут коррелированы (возможно, нелинейно!).

25 Тест Глейзера. Алгоритм применения 1. Строится уравнение регрессии: и вычисляются остатки. 2. Выбирается фактор пропорциональности Z и оценивают вспомогательное уравнение регрессии: Изменяя, строят несколько моделей: 3. Статистическая значимость коэффициента 1 в каждом случае означает наличие гетероскедастичности. 4. Если для нескольких моделей будет получена значимая оценка 1, то характер гетероскедастичности определяют по наиболее значимой из них.

26 Тесты Парка и Глейзера. Выводы Отметим, что как в тесте Парка, так и в тесте Глейзера для отклонений i может нарушаться условие гомоскедастичности. Однако, во многих случаях используемые в тестах модели являются достаточно хорошими для определения гетероскедастичности.

28 Тест Голдфелда-Квандта. Алгоритм применения 1. Выделяют фактор пропорциональности Z = X k. Данные упорядочиваются в порядке возрастания величины Z. 2. Отбрасывают среднюю треть упорядоченных наблюдений. Для первой и последней третей строятся две отдельные регрессии, используя ту же спецификацию модели регрессии. 3. Количество наблюдений в этих подвыборках должно быть одинаково. Обозначим его l.

29 Тест Голдфелда-Квандта. Алгоритм применения 4. Берутся суммы квадратов остатков для регрессий по первой трети RSS 1 и последней трети RSS 3. Рассчитывают их отношение: 5. Используем F-тест для проверки гомоскедастичности. Если статистика GQ удовлетворяет неравенству то гипотеза гомоскедастичности остатков отвергается на уровне значимости.

33 Тест Уайта. Алгоритм применения (на примере трех переменных) 3. Определяют из вспомогательного уравнения тестовую статистику 4. Проверяют общую значимость уравнения с помощью критерия 2. Если то гипотеза гомоскедастичности отвергается. Число степеней свободы k равно числу объясняющих Переменных вспомогательного уравнения. В частности, Для рассматриваемого случая k = 9.

37 Тест Бреуша-Пагана. Алгоритм применения 4. Для вспомогательного уравнения регрессии определяют объясненную часть вариации RSS. 5. Находим тестовую статистику: 6. Если верна гипотеза H 0: гомоскедастичность остатков, то статистика BP имеет распределение. Т.е. о наличии гетероскедастичности остатков на уровне значимости свидетельствует:

40 Обобщенный метод наименьших квадратов При нарушении гомоскедастичности и наличии автокорреляции остатков рекомендуется вместо традиционного МНК использовать обобщенный МНК. Его для случая устранения гетероскедастичности часто называют методом взвешенных наименьших квадратов. Основан на делении каждого наблюдаемого значения на соответствующее ему стандартное отклонение остатков. Метод применим, если известны дисперсии для каждого наблюдения.

41 Метод взвешенных наименьших квадратов. Случай парной регрессии Получили уравнение регрессии без свободного члена, но с дополнительной объясняющей переменной Z и с «преобразованным» остатком. Можно показать, что для него выполняются предпосылки 1 0 – 5 0 МНК.

42 Метод взвешенных наименьших квадратов. Случай парной регрессии На практике, значения дисперсии остатков, как правило, не известны. Для применения метода ВНК необходимо сделать реалистичные предположения об этих значениях. Например: Дисперсии пропорциональны X i: Дисперсии пропорциональны X i 2:

Одним из условий Гаусса-Маркова является предположение о постоянстве дисперсии случайного члена :
для любого

Невыполнимость этого предположения называется гетероскедастичностью (непостоянством, неоднородностью дисперсии отклонений)

Обнаружение гетероскедастичности

В ряде случаев на базе знаний характера данных появление проблемы гетероскедастичности можно предвидеть и попытаться устранить этот недостаток еще на этапе спецификации.Однако значительно чаще эту проблему приходится решать после построения уравнения регрессии.

Обнаружение гетероскедастичности в каждом конкретном случае является довольно сложной задачей,т.к.для знания дисперсий отклонений σ 2 ()необходимо знать распределение случайной величины (СВ) Y,соответствующее выбранному значению СВ Х. В выборкедля каждого конкретного значения определяется единственное значение,что не позволяет оценить дисперсию СВYдля данного.

Не существует какого-либо однозначного метода определения гетероскедастичности.Однако к настоящему времени для выявлениягетероскедастичности разработано довольно большое число тестов и критериев:графический анализ отклонений,тест Голдфелда−Квандта (Goldfeld,Quandt, 1956),тест ранговой корреляции Спирмена,тест Парка,тест Глейзера и т.д. Рассмотрим некоторые из этих методов.

Графический анализ остатков

Использование графического представления отклонений позволяет сделать предположение о наличии или отсутствии гетероскедастичности. В этом случае по оси абсцисс откладывается объясняющая переменная Х (либо линейная комбинация объясняющих переменных,а по оси ординат либо отклонения ,либо их квадраты

Примеры таких графиков приведены на рис.4

На рис..4.а все отклонения находятся внутри полуполосы постоянной ширины, параллельной оси абсцисс. Это говорит о независимости дисперсий от значений переменной Х и их постоянстве, т.е. в этом случае мы находимся в условиях гомоскедастичности.

На рис.4.б −г наблюдаются некие систематические изменения в соотношениях между значениями x i переменной Х и квадратами отклонений . На рис. 8.4,в отражена линейная; 8.4,г − квадратичная; 8.4,д − гиперболическая зависимости между квадратами отклонений и значениями объясняющей переменной Х. Другими словами, ситуации, представленные на рис. 8.4,б −д , отражают большую вероятность наличия гетероскедастичности для рассматриваемых статистических данных.

Отметим, что графический анализ отклонений является удобным и достаточно надежным в случае парной регрессии. При множественной регрессии графический анализ возможен для каждой из объясняющих переменных Х j , j = 1, 2, …,kотдельно. Чаще же вместо объясняющих переменных Х j по оси абсцисс откладывают значения, получаемые из эмпирического уравнения регрессии. Поскольку расчетное значение зависимой переменнойявляется линейной комбинацией факторных переменных, j = 1, 2,k, то график, отражающий зависимостьот, может указать на наличие гетероскедастичности аналогично ситуациям на рис. 8.4,б −д . Такой анализ наиболее целесообразен при большом количестве объясняющих переменных.

Тест ранговой корреляции Спирмена

При использовании данного теста предполагается,что дисперсия отклонения будет либо увеличиваться,либо уменьшаться с увеличением значения Х.Поэтому для регрессии,построенной по МНК,абсолютные величины отклонений и значения СВ Х будут коррелированы.Значения и ранжируются(упорядочиваются по значению).Затем определяется коэффициент ранговой корреляции:
(1)

где−разность между рангами и,
, где n −число наблюдений

Например,если
является15-м по величине среди всех наблюдений Х;а
−является30-м,то= 15 − 30= −15.

Доказано,что если коэффициент корреляции для генеральной совокупности равен нулю,то статистика

(2)

имеет распределение Стьюдента с числом степеней свободы ν= n − 2.

Следовательно,если наблюдаемое значениеt-статистики,вычисленное по формуле(2),превышаетt кр. (α,n−2) (определяемое по таблице критических точек распределения Стьюдента),то необходимо отклонить гипотезу о равенстве нулю коэффициента корреляции ,а следовательно,и об отсутствии гетероскедастичности.В противном случае гипотеза об отсутствии гетероскедастичности принимается.

Если в модели регрессии больше чем одна объясняющая переменная,то проверка гипотезы может осуществляться с помощьюt-статистики для каждой из них отдельно.

Тест Голдфелда−Квандта

Данный тест является наиболее популярным. При проведении проверки по этому критерию предполагается, что случайный член распределен нормально и неподвержен автокорреляции. Этот тест применяется, когда есть предположение о том, что среднее квадратическое отклонение возмущений
(i =1, 2, …, n ) возрастает пропорционально значению некоторого фактора возрастает пропорционально значению фактора. Проверка проводится для всех факторов, включенных в модель, либо только для факторов, предположительно влияющих на однородность исследуемой совокупности. Проверка по некоторому фактору X j выполняется в следующей последовательности:

С помощью данного теста проверяется основная гипотеза :

H 0:гетероскедастичность отсутствует .

H 1: (альтернативная гипотеза)– дисперсии ошибок прямо пропорциональны значениям выбранной переменной .

Для проведения теста необходимо выполнить следующие действия:

Замечание. Если верна основная гипотеза, то статистика
имеет распределение Фишера сстепенями свободы.

если
, то нет оснований отвергнуть основную гипотезу;

если
, то основная гипотеза отклоняется в пользу альтернативной, т.е. существует прямо пропорциональная зависимость между дисперсиями ошибок и значениями выбранной переменной.

Тест Уайта

Тест ранговой корреляции Спирмена и тест Голдфедда-Квандта позволяют обнаружить лишь само наличие гетероскедастичности, но они не дают возможности проследить количественный характер зависимости дисперсий ошибок регрессии от значений регрессоров и, следовательно, не представляют каких-либо способов устранения гетероскедастичности.

Очевидно, для продвижения к этой цели необходимы некоторые дополнительные предположения относительно характера гетероскедастичности. В самом деле, без подобных предположений, очевидно, невозможно было бы оценить п параметров (п дисперсий ошибок регрессии ) с помощью п наблюдений.

Наиболее простой и часто употребляемый тест на гетероскедастичность - тест Уайта. При использовании этого теста предполагается, что дисперсии ошибок регрессии представляют собой одну и ту же функцию от наблюдаемых значений регрессоров, т.е.

=
(3)

Чаще всего функция
выбирается квадратичной, что соответствует тому, что средняя квадратическая ошибка регрессии зависит от наблюдаемых значений факторных переменных приближенно линейно. Гомоскедастичной выборке соответствует случай
= const.

Идея теста Уайта заключается в оценке функции (3) с помощью соответствующего уравнения регрессии для квадратов остатков:

(4)

где - случайный член.

Гипотеза об отсутствии гетероскедастичности (условие
= const) принимается в случае незначимости регрессии (4) в целом.

В большинстве современных пакетов, регрессию (4) не приходится осуществлять вручную - тест Уайта входит в пакет как стандартная подпрограмма. В этом случае функция
выбирается квадратичной, факторные переменные в (4) - это переменные рассматриваемой модели.

Недостатком метода является то, что факт невыявление гетероскедастичности еще не означает ее отсутствия.

Обоснования введения в модель ведущих факторов. Понятие мультиколлинеарности.

Если в модель включаются два или более тесно взаимосвязанных фактора, то наряду с уравнением регрессии появляется и другая линейная зависимость. Подобное явление называемое мультиколлинеарностью, искажает величину коэффициентов регрессии, затрудняет их экономическую интерпретацию.

Мультиколлинеарность – это тесная зависимость между факторными признаками, включенными в модель.

Мультиколлинеарность:

Искажает величины параметров модели, которые имеют тенденцию к завышению;

Приводит к изменению смысла экономической интерпретации коэффициентов регрессии;

Вызывает слабую обусловленность системы нормальных уравнений.

Осложняет процесс определения наиболее существенных факторных признаков.

Решение проблемы мультиколлинеарности:

Установление наличия мультиколлинеарности;

Определение причин возникновения мультиколлинеарности.

Разработка мер по устранению мультиколлинеарности.

Причины возникновения мультиколлинеарности между признаками:

Изучаемые факторные признаки характеризуют одну и ту же сторону явления или процесса (например, показатели объёма произведённой продукции и среднегодовой стоимости основных фондов одновременно включать в модель не рекомендуется, так как оба характеризуют размер предприятия)

Использование в качестве факторных признаков, суммарное значение которых представляет собой постоянную величину (например, коэффициент годности и коэффициент износа основных фондов)

Факторные признаки, являющиеся элементами друг друга (например, затраты на производство продукции и себестоимости единицы продукции)

Факторные признаки, по экономическому смыслу дублирующие друг друга (например, прибыль и рентабельность продукции).

Способы определения наличия или отсутствия мультиколлинеарности:

Анализ матрицы коэффициентов парной корреляции – факторы могут быть признаны коллинеарными, если >0,8.

Исследование матрицы Х’X– если определитель матрицы Х’Xблизок к нулю, то это свидетельствует о наличии мультиколлинеарности.

Устранение мультиколлинеарности возможно посредством исключения из корреляционной модели одного или нескольких линейно связанных факторных признаков или преобразование исходных факторных признаков в новые, укрупнённые факторы. Опрос о том, какой из факторов следует отбросить, решается на основе качественного и логического анализа изучаемого явления.

Методы устранения или уменьшения мультиколлинеарности:

Сравнение значений линейных коэффициентов корреляции: при отборе факторов предпочтение отдаётся тому фактору, который более тесно, чем другие факторы, связан с результативным признаком, причём желательно, чтобы связь данного факторного признака с у была выше, чем его связь с другим факторным признаком, т.е. и .

Метод включения факторов: метод заключается в том, что в модель включаются факторы по одному в определённой последовательности. На первом шаге в модель вводится тот фактор, который имеет наибольший коэффициент корреляции с зависимой переменной. На втором и последующих шагах в модель включается фактор, который имеет наибольший коэффициент корреляции с остатками модели. После включения каждого фактора в модель, рассматриваются её характеристики, и модель проверяется на достоверность. Построение модели заканчивается, если модель перестаёт удовлетворять определённым условиям (например, k гдеn - число наблюдений;k – число факторных признаков, включаемых в модель;l – среднеквадратическая ошибка модели, полученная на предыдущем шаге и включающая (k -1) переменных)

Метод исключения факторов: метод состоит в том, что в модель включаются все факторы. Затем после построения уравнения регрессии из модели исключают фактор, коэффициент при котором незначим и имеет наименьшее значение t-критерия. После этого получают новое уравнение регрессии и снова проводят оценку значимости всех оставшихся коэффициентов регрессии. Процесс исключения факторов продолжается до тех пор, пока модель не начнёт удовлетворять определённым условиям и все коэффициенты регрессии не будут значимы.

Оценка влияния отдельных факторов на результативный показатель по коэффициентам: детерминация, эластичность.

Понятие об эконометрических моделях. Отличие эконометрических моделей от математических моделей. Спецификация и идентификация моделей.

Однофакторная линейная модель регрессии. Определение параметров модели по МНК.

Уравнение линейной парной регрессии:

yx= где , – параметры модели; – случайная величина (величина остатка).

– свободный коэффициент (член) регрессионного уравнения. Не имеет экономического смысла и показывает значение результативного признака у, если факторный признак х=0.

Коэффициент регрессии показывает, на какую величину в среднем изменится результативный признак у, если переменную х увеличить на единицу измерения. Знак при коэффициенте регрессии показывает направление связи: при >0 – связь прямая; при <0 – связь обратная.

– независимая, нормально распределённая случайная величина, остаток с нулевым математическим ожиданием ( =0) и постоянной дисперсией (). Отражает тот факт, что изменение у будет неточно описываться изменением х, так как присутствуют другие факторы, не учтённые в данной модели.

Оценка параметров модели и осуществляется методом наименьших квадратов. Сущность метода наименьших квадратов заключается в том, что отыскиваются такие значения параметров модели ( и ), пери которых сумма квадратов отклонений фактических значений результативного признакаyi от вычисленных по уравнению регрессии будет наименьшей из всех возможных.

При оценке параметров уравнения регрессии мы применяем метод наименьших квадратов. При этом делаем определенные предпосылки относительно случайной составляющей . В модели

у = а + b 1  x + 

случайная составляющая  представляет собой ненаблюдаемую величину. После того как проведена оценка параметров модели, рассчитав разности фактических и теоретических значений результативного признака у , можно определить оценки случайной составляющей (у ). При изменении спецификации модели, добавлении в нее новых наблюдений выборочные оценки остатков i , могут меняться. Поэтому в задачу регрессионного анализа входит не только построение самой модели, но и исследование случайных отклонений  i , т.е. остаточных величин.

В предыдущем разделе рассматривались формальные проверки статистической достоверности коэффициентов регрессии и корреляции с помощью t -критерия Стьюдента и F -критерия. При использовании этих критериев делаются предположения относительно поведения остатков  i . Остатки представляют собой независимые случайные величины, и их среднее значение равно 0; они имеют одинаковую (постоянную) дисперсию и подчиняются нормальному распределению.

Оценки параметров регрессии должны отвечать определенным критериям: быть несмещенными, состоятельными и эффективными.

Несмещенность оценки означает, что математическое ожидание остатков равно нулю. Следовательно, при большом числе выборочных оцениваний остатки не будут накапливаться и найденный параметр регрессии b i можно рассматривать как среднее значение из возможного большого количества несмещенных оценок.

Для практических целей важна не только несмещенность, но и эффективность оценок. Оценки считаются эффективными , если они характеризуются наименьшей дисперсией.

Степень реалистичности доверительных интервалов параметров регрессии обеспечивается, если оценки будут не только несмещенными и эффективными, но и состоятельными . Состоятельность оценок характеризует увеличение их точности с увеличением объема выборки.

Исследования остатков  i предполагают проверку наличия следующих пяти предпосылок МНК (см. условия ГауссаМаркова):

Случайный характер остатков.

Для этого строится график зависимости остатков  i от теоретических значений результативного признака .Если на графике нет направленности в расположении точек  i , то остатки  i представляют собой случайные величины и МНК оправдан, теоретические значения хорошо аппроксимируют фактические значенияу .

Нулевая средняя величина остатков, не зависящая от х i .

Вторая предпосылка МНК относительно нулевой средней величины остатков означает, что (у ) = 0. Это выполнимо для линейных моделей и моделей, нелинейных относительно включаемых переменных. Для моделей, нелинейных по оцениваемым параметрам и приводимых к линейному виду логарифмированием, средняя ошибка равна нулю для логарифмов исходных данных. Так, для модели вида

Гомоскедастичность  дисперсия каждого отклонения  i одинакова для всех значений х .

В соответствии с третьей предпосылкой метода наименьших квадратов требуется, чтобы дисперсия остатков была гомоскедастичной . Это значит, что для каждого значения фактора х i остатки имеют одинаковую дисперсию. Если это условие применения МНК не соблюдается, то имеет место гетероскедастичность (рис. 1).

Гомоскедастичность остатков означает, что дисперсия остатков  i одинакова для каждого значения х .

Наличие гетероскедастичности в отдельных случаях может привести к смещенности оценок коэффициентов регрессии, хотя несмещенность оценок коэффициентов регрессии в основном зависит от соблюдения второй предпосылки МНК, т.е. независимости остатков и величин факторов.

Гетероскедастичность будет сказываться на уменьшении эффективности оценок b i . В частности, становится затруднительным использование формулы стандартной ошибки коэффициента регрессии , предполагающей единую дисперсию остатков для любых значений фактора.

Рассмотрим тесты , которые позволяют провести анализ модели на гомоскедастичность.

При малом объеме выборки, что наиболее характерно для эконометрических исследований, для оценки гетероскедастичности может использоваться метод Гольдфельда  Квандта , разработанный в 1965 г. Гольдфельд и Квандт рассмотрели однофакторную линейную модель, для которой дисперсия остатков возрастает пропорционально квадрату фактора. Для того чтобы оценить нарушение гомоскедастичности, они предложили параметрический тест , который включает в себя следующие шаги:

Упорядочение п наблюдений по мере возрастания переменной х .

Исключение из рассмотрения С центральных наблюдений; при этом (п  С)/2 > р , где р  число оцениваемых параметров.

Из экспериментальных расчетов, проведенных авторами метода для случая одного фактора, рекомендовано при п = 30 принимать С = 8, а при п = 60 – соответственно С = 16.

Разделение совокупности из (п  С ) наблюдений на две группы (соответственно с малыми и большими значениями фактора х ) и определение по каждой из групп уравнений регрессии.

Определение остаточной суммы квадратов для первой (S 1) и второй (S 2) групп и нахождение их отношения: R = S 1 /S 2 , где S 1 > S 2 .

При выполнении нулевой гипотезы о гомоскедастичности отношение R будет удовлетворять F -критерию с (п С 2р )/2 степенями свободы для каждой остаточной суммы квадратов. Чем больше величина R превышает табличное значение F -критерия, тем более нарушена предпосылка о равенстве дисперсий остаточных величин.

Критерий ГольдфельдаКвандта используется и при проверке остатков множественной регрессии на гетероскедастичность.

Наличие гетероскедастичности в остатках регрессии можно проверить и с помощью ранговой корреляции Спирмэна . Суть проверки заключается в том, что в случае гетероскедастичности абсолютные остатки  i коррелированы со значениями фактора х i . Эту корреляцию можно измерять с помощью коэффициента ранговой корреляции Спирмэна:

, (31)

где d  абсолютная разность между рангами значений х i и | i |.

Статистическую значимость  можно оценить с помощью t -критерия:

. (32)

Сравнив эту величину с табличной величиной при  = 0,05 и числе степеней свободы (п  m ). Принято считать, что если t  > t  , то корреляция между  i и х i статистически значима, т. е. имеет место гетероскедастичность остатков. В противном случае принимается гипотеза об отсутствии гeтероскедастичности остатков.

Рассмотренные критерии не дают количественной оценки зависимости дисперсии ошибок регрессии от соответствующих значений факторов, включенных в регрессию. Они позволяют лишь определить наличие или отсутствие гетероскедастичности остатков. Поэтому если гетероскедастичность остатков установлена, можно количественно оценить зависимость дисперсии ошибок регрессии от значений факторов. С этой целью могут быть использованы тесты Уайта, Парка, Глейзера и др.

Тест Уайта предполагает, что дисперсия ошибок регрессии представляет собой квадратичную функцию от значений факторов, т.е. при наличии одного фактора  2 = а + bx + cx 2 + u , или при наличии факторов:

 2 = a + b 1 x 1 + b 11 +b 2 x 2 + b 22 +b 12 x 1 x 2 + … + b p x p + b pp + + b 1 p x 1 x p + b 2 p x 2 x p + … + u .

Так что модель включает в себя не только значения факторов, но и их квадраты, а также попарные произведения. Поскольку каждый параметр модели =f (х i ) должен быть рассчитан на основе достаточного числа степеней свободы, то чем меньше объем исследуемой совокупности, тем в меньшей мере квадратичная функция сможет содержать попарные произведения факторов. Например, если регрессия строится по 30 наблюдениям как y i = a + b 1 x +  i , то последующая квадратичная функция для остатков может быть представлена лишь как

 2 = а + b 1 x + b 11 х 2 + u ,

поскольку на каждый параметр при х должно приходиться не менее 67 наблюдений. В настоящее время тест Уайта включен в стандартную программу регрессионного анализа в пакете Econometric Views. О наличии или отсутствии гетероскедастичности остатков судят по величине F -критерия Фишера для квадратичной функции регрессии остатков. Если фактическое значение F -критерия выше табличного, то, следовательно, существует четкая корреляционная связь дисперсии ошибок от значений факторов, включенных в регрессию, и имеет место гетероскедастичность остатков. В противном случае (F факт < F табл) делается вывод об отсутствии гeтероскедастичности остатков регрессии.

Тест Парка также относится к формализованным тестам гетероскедастичности. Предполагается, что дисперсия остатков связана со значениями факторов функций ln  2 = а + b ln х + и . Данная регрессия строится для каждого фактора в условиях многофакторной модели. Проверяется значимость коэффициента регрессии b по t -критерию Стьюдента. Если коэффициент регрессии для уравнения ln 2 окажется статистически значимым, то, следовательно, существует зависимость ln 2 от lnх , т.е. имеет место гетероскедастичность остатков.

Если тесты Уайта и Парка предназначены для оценки гетероскедастичности для квадрата остатков  2 , то тест Глейзера основывается на регрессии абсолютных значений остатков ||, т.е. рассматривается функция | i | = а + b + и i . Регрессия | i | от х i строится при разных значениях параметра с , и далее отбирается та функция, для которой коэффициент регрессии b оказывается наиболее значимым, т.е. имеет место наибольшее значение t -критерия Стьюдента или F -критерия Фишера и R 2 .

При обнаружении гетероскедастичности остатков регрессии ставится цель ее устранения, чему служит применение обобщенного метода наименьших квадратов (см. ниже).

Отсутствие автокорреляции остатков. Значения остатков  i , распределены независимо друг от друга .

Автокорреляция остатков означает наличие корреляции между остатками текущих и предыдущих (последующих) наблюдений.

При построении регрессионных моделей чрезвычайно важно соблюдение данного условия. Коэффициент корреляции между  i и  i -1 , где  i  остатки текущих наблюдений,  i -1  остатки предыдущих наблюдений может быть определен как

, (33)

что соответствует формуле линейного коэффициента корреляции. Если этот коэффициент окажется существенно отличным от нуля, то остатки автокоррелированы и функция плотности вероятности F () зависит от j -й точки наблюдения и от распределения значений остатков в других точках наблюдения.

Отсутствие автокорреляции остатков обеспечивает состоятельность и эффективность оценок коэффициентов регрессии. Особенно актуально соблюдение данной предпосылки МНК при построении регрессионных моделей по рядам динамики, где при наличии тенденции последующие уровни динамического ряда, как правило, зависят от своих предыдущих уровней.

Остатки подчиняются нормальному распределению.

Предпосылка о нормальном распределении остатков позволяет проводить проверку параметров регрессии и корреляции с помощью критериев t иF . Вместе с тем оценки регрессии, найденные с применением МНК, обладают хорошими свойствамидаже при отсутствии нормального распределения остатков, т.е. при нарушении пятой предпосылки метода наименьших квадратов.

Наряду с предпосылками метода наименьших квадратов как метода оценивания параметров регрессии при построении регрессионных моделей должны соблюдаться определенные требования относительно переменных, включаемых в модель. Прежде всего, число переменных т должно быть не больше, чем
. Иначе параметры регрессии оказываются статистически незначимыми. В общем виде применение МНК возможно, если число наблюдений п превышает число оцениваемых параметров т , т.е. система нормальных уравнений имеет решение только тогда, когда п > т .

При несоблюдении основных предпосылок МНК приходится корректировать модель, изменяя ее спецификацию, добавлять (исключать) некоторые факторы, преобразовывать исходные данные для того, чтобы получить оценки коэффициентов регрессии, которые обладают свойством несмещенности, имеют меньшее значение дисперсии остатков и обеспечивают в связи с этим более эффективную статистическую проверку значимости параметров регрессии. Этой цели, как уже указывалось, служит применение обобщенного метода наименьших квадратов.