Парная линейная регрессия. Метод наименьших квадратов

⇐ ПредыдущаяСтр 22 из 27Следующая ⇒

Рис.1

На рисунке изображены три ситуации:

• на графике (а) взаимосвязь х и у близка к линейной; прямая линия (1) здесь близка к точкам наблюдений, и последние отклоняются от нее лишь в результате сравнительно небольших случайных воздействий;

• на графике (b) реальная взаимосвязь величин х и у описывается нелинейной функцией (2), и какую бы мы ни провели прямую линию (например, 1), отклонения точек наблюдений от нее будут существенными и неслучайными;

• на графике (с) явная взаимосвязь между переменными х и у отсутствует; какую бы мы ни выбрали формулу связи, результаты ее параметризации будут здесь неудачными. В частности, прямые линии 1 и 2, проведенные через "центр" "облака" точек наблюдений и имеющие противоположный наклон, одинаково плохи для того, чтобы делать выводы об ожидаемых значениях переменной у по значениям переменной х.

Начальным пунктом эконометрического анализа зависимостей обычно является оценка линейной зависимости переменных. Если имеется некоторое "облако" точек наблюдений, через него всегда можно попытаться провести такую прямую линию, которая является наилучшей в определенном смысле среди всех прямых линий, то есть "ближайшей" к точкам наблюдений по их совокупности. Для этого мы вначале должны определить понятие близости прямой к некоторому множеству точек на плоскости; меры такой близости могут быть различными. Однако любая разумная мера должна быть, очевидно, связана с расстояниями от точек наблюдений до рассматриваемой прямой линии (задаваемой уравнением у = а + bх).

Обычно в качестве критерия близости используется минимум суммы квадратов разностей наблюдений зависимой переменной у и теоретических, рассчитанных по уравнению регрессии значений (а + bх_i):

Q = e_i² = (y_i-(a+bx_i))² min (1)

считается, что у и х - известные данные наблюдений, а и b - неизвестные параметры линии регрессии. Поскольку функция Q непрерывна, выпукла и ограничена снизу нулем, она имеет минимум. Для соответствующих точке этого минимума значений а и b могут быть найдены простые и удобные формулы (они будут приведены ниже). Метод оценивания параметров линейной регрессии, минимизирующий сумму квадратов отклонений наблюдений зависимой переменной от искомой линейной функции, называется Методом наименьших квадратов (МНК), или Least Squares Method (LS).

"Наилучшая" по МНК прямая линия всегда существует, но даже наилучшая не всегда является достаточно хорошей. Если в действительности зависимость y=f (х) является, например, квадратичной (как на рисунке 1(b)), то ее не сможет адекватно описать никакая линейная функция, хотя среди всех таких функций обязательно найдется "наилучшая". Если величины х и у вообще не связаны (рис. 1 (с)), мы также всегда сможем найти "наилучшую" линейную функцию у = а+bх для данной совокупности наблюдений, но в этом случае конкретные значения а и b определяются только случайными отклонениями переменных и сами будут очень сильно меняться для различных выборок из одной и той же генеральной совокупности.Возможно, на рис. 1(с) прямая 1 является наилучшей среди всех прямых линий (в смысле минимального значения функции Q), но любая другая прямая, проходящая через центральную точку "облака" (например, линия 2), ненамного в этом смысле хуже, чем прямая 1, и может стать наилучшей в результате небольшого изменения выборки.

Рассмотрим теперь задачу оценки коэффициентов парной линейной регрессии более формально. Предположим, что связь между х и у линейна: у = х. Здесь имеется в виду связь между всеми возможными значениями величин х и у, то есть для генеральной совокупности. Наличие случайных отклонений, вызванных воздействием на переменную у множества других, неучтенных в нашем уравнении факторов и ошибок измерения, приведет к тому, что связь наблюдаемых величин x_i и y_i приобретет вид у_i= х_i+є_i,. Здесь є_i. - случайные ошибки (отклонения, возмущения). Задача состоит в следующем: по имеющимся данным наблюдений {x_i}, {у_i} оценить значения параметров айв, обеспечивающие минимум величины Q. Если бы были известны точные значения отклонений є_i, то можно было бы (в случае правильности предполагаемой линейной формулы) рассчитать значения параметров и Однако значения случайных отклонений в выборке неизвестны, и по наблюдениям x_i и у_i можно получить оценки параметров с и р, которые сами являются случайными величинами, поскольку соответствуют случайной выборке. Пусть а - оценка параметра, b - оценка параметра. Тогда оцененное уравнение регрессии будет иметь вид:

y_i=а+bx_i+е_i,

где е_i - наблюдаемые значения ошибок є_i.

Для оценки параметров и воспользуемся МНК, который минимизирует сумму квадратов отклонений фактических значений у_i от расчетных. Минимум ищется по переменным а и b.

Для того, чтобы полученные МНК оценки а и b обладали желательными свойствами, сделаем следующие предпосылки об отклонениях є_i:

1) величина є_i является случайной переменной;

2) математическое ожидание є_i равно нулю: М (є_i) = 0;

3) дисперсия є постоянна: D(є_i) = D(є_i) = 2 для всех i, j;

4) значения є_i независимы между собой. Откуда вытекает, в частности,

Известно, что, если условия 1)-4) выполняются, то оценки, сделанные с помощью МНК, обладают следующими свойствами:

1) Оценки являются несмещенными, т.е. математическое ожидание оценки каждого параметра равно его истинному значению: М(а) =; М(b)=. Это вытекает из того, что М(є_i) = 0, и говорит об отсутствии систематической ошибки в определении положения линии регрессии.

2) Оценки состоятельны, так как дисперсия оценок параметров при возрастании числа наблюдений стремится к нулю. Иначе говоря, если п достаточно велико, то практически наверняка а близко к, а b близко к. надежность оценки при увеличении выборки растет.

3) Оценки эффективны, они имеют наименьшую дисперсию по сравнению с любыми другими оценками данного параметра, линейными относительно величин у_i. В англоязычной литературе такие оценки называются BLUE (Best Linear Unbiased Estimators - наилучшие линейные несмещенные оценки).

Перечисленные свойства не зависят от конкретного вида распределения величин є_i, тем не менее, обычно предполагается, что они распределены нормально N(0;y²). Эта предпосылка необходима для проверки статистической значимости сделанных оценок и определения для них доверительных интервалов. При ее выполнении оценки МНК имеют наименьшую дисперсию не только среди линейных, но среди всех несмещенных оценок.

Если предположения 3) и 4) нарушены, то есть дисперсия возмущений непостоянна и/или значения є. связаны друг с другом, то свойства несмещенности и состоятельности сохраняются, но свойство эффективности - нет.

Рассмотрим теперь процедуру оценивания параметров парной линейной регрессии а и b. Для того, чтобы функция Q = e_i² = (y_i-(a+bx_i))² достигала минимума, необходимо равенство нулю ее частных производных:

(3) (4)

Если уравнение (3) разделить на n, то получим у=а+bх (здесь - средние значения х и у). Таким образом, линия регрессии проходит через точку со средними значениями х и у. Подставив величину а из (3) в (4), получаем

(5)

Откуда

(6)

Иначе можно записать, что (где r коэффициент корреляции х и у). Таким образом, коэффициент регрессии пропорционален показателю ковариации и коэффициенту корреляции х и у, а коэффициенты этой пропорциональности служат для соизмерения перечисленных разноразмерных величин. Оценки a и b, очевидно, являются линейными относительно y_i (если x_i считать коэффициентами) - выше об этом упоминалось.

Итак, если коэффициент r уже рассчитан, то легко рассчитать коэффициент парной регрессии, не решая системы уравнений. Ясно также, что если рассчитаны линейные регрессии х(у) и у(х), то произведение коэффициентов d_x и b_y, равно r²:

(7)[1]

наименьший квадрат регрессионный анализ

⇐ Предыдущая 17 18 19 20 212223 24 25 26 Следующая ⇒

Date: 2015-06-11; view: 790; Нарушение авторских прав

mydocx.ru - 2015-2024 year. (0.009 sec.) Все материалы представленные на сайте исключительно с целью ознакомления читателями и не преследуют коммерческих целей или нарушение авторских прав - Пожаловаться на публикацию