Определить лучшее уравнение регрессии на основе средней ошибки аппроксимации - Ремонт и установка крупной бытовой техники

Оценим качество уравнений с помощью средней ошибки аппроксимации

Средняя ошибка аппроксимации — среднее
отклонение расчетных (теоретических)
значений зависимой переменной y
от фактических (эмпирических) значений

Допустимый предел значений

не
более 10-12 %.

А. Для линейной регрессии Б. Для
степенной регрессии

В. Для экспоненциальной регрессии
Г. Для полулогарифмической регрессии

Е. Для гиперболической регрессии

Вывод: для каждой из построенных
моделей ошибка аппроксимации превышает
допустимые пределы, что говорит о плохом
качестве моделей регрессии.

Наименьшей (хотя и недопустимой) она
является для уравнения полулогарифмической
регрессии

Оценим статистическую надежность результатов регрессионного моделирования с помощью f-критерия Фишера.

Н₀ — гипотеза о статистической
незначимости показателя детерминации
R²
(F_факт= 0) и уравнения
регрессии.

n – общее число наблюдений
(n=16); m –
число параметров при переменной x
(m=1)/

По таблице значений F-критерия
Фишера при условии значимости 
= 0,05 и число степеней свободы k₁= m = 1, k₂= n – m
– 1 = 16-1-1= 14 находим F_кр — максимально возможное значение
критерия под влиянием случайных факторов
при данных степенях свободы и уровне
значимости : F_кр= 4,60.

А. Для линейной регрессии

(
)

Так как

то гипотеза Н₀ отвергается,
т.е. R²
статистически значим, как и уравнение
линейной регрессии.

Б. Для степенной регрессии

(
)

Так как

то гипотеза Н₀ отвергается,
т.е. R²
статистически значим, как и уравнение
степенной регрессии.

В. Для экспоненциальной регрессии

(
)

Так как

то гипотеза Н₀ отвергается,
т.е. R²
статистически значим, как и уравнение
полулогарифмической регрессии.

Д. Для гиперболической регрессии

(
)

Так как

то гипотеза Н₀ отвергается,
т.е. R²
статистически значим, как и уравнение
гиперболической регрессии.

Вывод: F-критерия
Фишера показывает, во сколько раз
уравнение регрессии предсказывает
результаты наблюдений лучше, чем прямая

.

Статистически значимыми являются
уравнения линейной, степенной,
экспоненциальной, гиперболической
регрессии, из них всех лучше предсказывает
результаты наблюдений уравнение
степенной регрессии (
)

По значениям характеристик, рассчитанных в пп. 4,6,7 выберем лучшее уравнение регрессии и дадим его обоснование.

П.4. Наибольшее значение коэффициента
эластичности имеет уравнение
степенной регрессии (
.

П.6. Наименьшую ошибку аппроксимации
(хотя и не допустимую) имеет уравнение
полулогарифмической регрессии

.
Уравнение степенной регрессии
отличается на небольшую величину:

П.7. Согласно F-критерию
Фишера лучше всех предсказывает
результаты наблюдений уравнение
степенной регрессии (
)

Вывод: Лучше всех описывает данные
наблюдений (зависимость между средней
заработанной платой и выплатами
социального характера x
и потребительскими расходами на душу
населения y) уравнение
степенной регрессии

Качество модели плохое, так как

>10%,
возможно из-за небольшого числа наблюдений
(n=16).

По линейному уравнению регрессии
рассчитаем прогнозное значение
результата (y), если
прогнозное значение фактора (x)
увеличивается на 7% от его среднего
уровня:

Уравнение линейной регрессии y=a
+ b*x (
).

n – общее число
наблюдений (n=16); m
– число параметров при переменной x
(m=1);

t_кр= 2,1448

Прогнозное значение фактора (x):

x_пр=

тыс.
руб.;

x_пр—

= 44,25 – 885 = -840,75; (x_пр—

= (-840,75)² = 706860,5625.

Прогнозное значение фактора (y):

y_пр= a
+ b* x_пр=
160,48 + 0,39*44,25 = 177,74 тыс. руб.

Стандартная ошибка прогноза:

Предельная ошибка прогноза, которая
в 95% случаев не будет превышена, составит:

Доверительный интервал прогноза для
уровня значимости 
=0,05:

(min

max

или

(

=
(177,74 – 186,79; 177,74 + 186,79) = (-9,05; 364,53)

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]

Источник

Средняя ошибка аппроксимации

По семи территориям Уральского района за 199Х г. известны значения двух признаков.

Район	Расходы на покупку продовольственных товаров в общих расходах, %, у	Среднедневная заработная плата одного работающего, руб., х
Удмуртская респ.	68,8	45,1
Свердловская обл.	61,2	59,0
Башкортостан	59,9	57,2
Челябинская обл.	56,7	61,8
Пермская обл.	55,0	58,8
Курганская обл.	54,3	47,2
Оренбургская обл.	49,3	55,2

Требуется:
1. Для характеристики зависимости у от х рассчитать параметры следующих функций:
а) линейной;
б) степенной;
в) показательной;
г) равносторонней гиперболы (так же нужно придумать как предварительно линеаризовать данную модель).
2. Оценить каждую модель через среднюю ошибку аппроксимации А_ср и F-критерий Фишера.

Решение проводим при помощь онлайн калькулятора Линейное уравнение регрессии.
а) линейное уравнение регрессии;
Использование графического метода.
Этот метод применяют для наглядного изображения формы связи между изучаемыми экономическими показателями. Для этого в прямоугольной системе координат строят график, по оси ординат откладывают индивидуальные значения результативного признака Y, а по оси абсцисс — индивидуальные значения факторного признака X.
Совокупность точек результативного и факторного признаков называется полем корреляции.

Для наших данных система уравнений имеет вид

Из первого уравнения выражаем а и подставим во второе уравнение
Получаем b = -0.35, a = 76.88
Уравнение регрессии: y = -0.35 x + 76.88

x	y	x 2	y 2	x • y	y(x)	(y i -y cp ) 2	(y-y(x)) 2	\|y — y x \|:y
45,1	68,8	2034,01	4733,44	3102,88	61,28	119,12	56,61	0,1094
59	61,2	3481	3745,44	3610,8	56,47	10,98	22,4	0,0773
57,2	59,9	3271,84	3588,01	3426,28	57,09	4,06	7,9	0,0469
61,8	56,7	3819,24	3214,89	3504,06	55,5	1,41	1,44	0,0212
58,8	55	3457,44	3025	3234	56,54	8,33	2,36	0,0279
47,2	54,3	2227,84	2948,49	2562,96	60,55	12,86	39,05	0,1151
55,2	49,3	3047,04	2430,49	2721,36	57,78	73,71	71,94	0,172
384,3	405,2	21338,41	23685,76	22162,34	405,2	230,47	201,71	0,5699

Примечание: значения y(x) находятся из полученного уравнения регрессии:
y(45.1) = -0.35*45.1 + 76.88 = 61.28
y(59) = -0.35*59 + 76.88 = 56.47
. . .

Ошибка аппроксимации
Оценим качество уравнения регрессии с помощью ошибки абсолютной аппроксимации. Средняя ошибка аппроксимации — среднее отклонение расчетных значений от фактических:

F-статистики. Критерий Фишера.
Проверка значимости модели регрессии проводится с использованием F-критерия Фишера, расчетное значение которого находится как отношение дисперсии исходного ряда наблюдений изучаемого показателя и несмещенной оценки дисперсии остаточной последовательности для данной модели.
Если расчетное значение с k1=(m) и k2=(n-m-1) степенями свободы больше табличного при заданном уровне значимости, то модель считается значимой.

где m – число факторов в модели.
Оценка статистической значимости парной линейной регрессии производится по следующему алгоритму:
1. Выдвигается нулевая гипотеза о том, что уравнение в целом статистически незначимо: H₀: R 2 =0 на уровне значимости α.
2. Далее определяют фактическое значение F-критерия:

где m=1 для парной регрессии.
3. Табличное значение определяется по таблицам распределения Фишера для заданного уровня значимости, принимая во внимание, что число степеней свободы для общей суммы квадратов (большей дисперсии) равно 1 и число степеней свободы остаточной суммы квадратов (меньшей дисперсии) при линейной регрессии равно n-2.
4. Если фактическое значение F-критерия меньше табличного, то говорят, что нет основания отклонять нулевую гипотезу.
В противном случае, нулевая гипотеза отклоняется и с вероятностью (1-α) принимается альтернативная гипотеза о статистической значимости уравнения в целом.
Табличное значение критерия со степенями свободы k1=1 и k2=5, Fkp = 6.61
Поскольку фактическое значение F b
в) показательная регрессия;
г) модель равносторонней гиперболы.
Система нормальных уравнений.

Для наших данных система уравнений имеет вид
7a + 0.1291b = 405.2
0.1291a + 0.0024b = 7.51
Из первого уравнения выражаем а и подставим во второе уравнение
Получаем b = 1054.67, a = 38.44
Уравнение регрессии:
y = 1054.67 / x + 38.44
Ошибка аппроксимации.
Оценим качество уравнения регрессии с помощью ошибки абсолютной аппроксимации.

Задача №3. Расчёт параметров регрессии и корреляции с помощью Excel

По территориям региона приводятся данные за 200Х г.

Номер региона	Среднедушевой прожиточный минимум в день одного трудоспособного, руб., х	Среднедневная заработная плата, руб., у
1	78	133
2	82	148
3	87	134
4	79	154
5	89	162
6	106	195
7	67	139
8	88	158
9	73	152
10	87	162
11	76	159
12	115	173

Задание:

1. Постройте поле корреляции и сформулируйте гипотезу о форме связи.

2. Рассчитайте параметры уравнения линейной регрессии

3. Оцените тесноту связи с помощью показателей корреляции и детерминации.

4. Дайте с помощью среднего (общего) коэффициента эластичности сравнительную оценку силы связи фактора с результатом.

5. Оцените с помощью средней ошибки аппроксимации качество уравнений.

6. Оцените с помощью F-критерия Фишера статистическую надёжность результатов регрессионного моделирования.

7. Рассчитайте прогнозное значение результата, если прогнозное значение фактора увеличится на 10% от его среднего уровня. Определите доверительный интервал прогноза для уровня значимости .

8. Оцените полученные результаты, выводы оформите в аналитической записке.

Решение:

Решим данную задачу с помощью Excel.

1. Сопоставив имеющиеся данные х и у, например, ранжировав их в порядке возрастания фактора х, можно наблюдать наличие прямой зависимости между признаками, когда увеличение среднедушевого прожиточного минимума увеличивает среднедневную заработную плату. Исходя из этого, можно сделать предположение, что связь между признаками прямая и её можно описать уравнением прямой. Этот же вывод подтверждается и на основе графического анализа.

Чтобы построить поле корреляции можно воспользоваться ППП Excel. Введите исходные данные в последовательности: сначала х, затем у.

Выделите область ячеек, содержащую данные.

Затем выберете: Вставка / Точечная диаграмма / Точечная с маркерами как показано на рисунке 1.

Рисунок 1 Построение поля корреляции

Анализ поля корреляции показывает наличие близкой к прямолинейной зависимости, так как точки расположены практически по прямой линии.

2. Для расчёта параметров уравнения линейной регрессии
воспользуемся встроенной статистической функцией ЛИНЕЙН.

1) Откройте существующий файл, содержащий анализируемые данные;
2) Выделите область пустых ячеек 5×2 (5 строк, 2 столбца) для вывода результатов регрессионной статистики.
3) Активизируйте Мастер функций: в главном меню выберете Формулы / Вставить функцию.
4) В окне Категория выберете Статистические, в окне функция – ЛИНЕЙН. Щёлкните по кнопке ОК как показано на Рисунке 2;

Рисунок 2 Диалоговое окно «Мастер функций»

5) Заполните аргументы функции:

Известные значения у – диапазон, содержащий данные результативного признака;

Известные значения х – диапазон, содержащий данные факторного признака;

Константа – логическое значение, которое указывает на наличие или на отсутствие свободного члена в уравнении; если Константа = 1, то свободный член рассчитывается обычным образом, если Константа = 0, то свободный член равен 0;

Статистика – логическое значение, которое указывает, выводить дополнительную информацию по регрессионному анализу или нет. Если Статистика = 1, то дополнительная информация выводится, если Статистика = 0, то выводятся только оценки параметров уравнения.

Щёлкните по кнопке ОК;

Рисунок 3 Диалоговое окно аргументов функции ЛИНЕЙН

6) В левой верхней ячейке выделенной области появится первый элемент итоговой таблицы. Чтобы раскрыть всю таблицу, нажмите на клавишу , а затем на комбинацию клавиш + + .

Дополнительная регрессионная статистика будет выводиться в порядке, указанном в следующей схеме:

Значение коэффициента b	Значение коэффициента a
Стандартная ошибка b	Стандартная ошибка a
Коэффициент детерминации R 2	Стандартная ошибка y
F-статистика	Число степеней свободы df
Регрессионная сумма квадратов

Остаточная сумма квадратов

Рисунок 4 Результат вычисления функции ЛИНЕЙН

Получили уровнение регрессии:

Делаем вывод: С увеличением среднедушевого прожиточного минимума на 1 руб. среднедневная заработная плата возрастает в среднем на 0,92 руб.

3. Коэффициент детерминации означает, что 52% вариации заработной платы (у) объясняется вариацией фактора х – среднедушевого прожиточного минимума, а 48% — действием других факторов, не включённых в модель.

По вычисленному коэффициенту детерминации можно рассчитать коэффициент корреляции: .

Связь оценивается как тесная.

4. С помощью среднего (общего) коэффициента эластичности определим силу влияния фактора на результат.

Для уравнения прямой средний (общий) коэффициент эластичности определим по формуле:

Средние значения найдём, выделив область ячеек со значениями х, и выберем Формулы / Автосумма / Среднее, и то же самое произведём со значениями у.

Рисунок 5 Расчёт средних значений функции и аргумент

Таким образом, при изменении среднедушевого прожиточного минимума на 1% от своего среднего значения среднедневная заработная плата изменится в среднем на 0,51%.

С помощью инструмента анализа данных Регрессия можно получить:
— результаты регрессионной статистики,
— результаты дисперсионного анализа,
— результаты доверительных интервалов,
— остатки и графики подбора линии регрессии,
— остатки и нормальную вероятность.

Порядок действий следующий:

1) проверьте доступ к Пакету анализа. В главном меню последовательно выберите: Файл/Параметры/Надстройки.

2) В раскрывающемся списке Управление выберите пункт Надстройки Excel и нажмите кнопку Перейти.

3) В окне Надстройки установите флажок Пакет анализа, а затем нажмите кнопку ОК.

• Если Пакет анализа отсутствует в списке поля Доступные надстройки, нажмите кнопку Обзор, чтобы выполнить поиск.

• Если выводится сообщение о том, что пакет анализа не установлен на компьютере, нажмите кнопку Да, чтобы установить его.

4) В главном меню последовательно выберите: Данные / Анализ данных / Инструменты анализа / Регрессия, а затем нажмите кнопку ОК.

5) Заполните диалоговое окно ввода данных и параметров вывода:

Входной интервал Y – диапазон, содержащий данные результативного признака;

Входной интервал X – диапазон, содержащий данные факторного признака;

Метки – флажок, который указывает, содержит ли первая строка названия столбцов или нет;

Константа – ноль – флажок, указывающий на наличие или отсутствие свободного члена в уравнении;

Выходной интервал – достаточно указать левую верхнюю ячейку будущего диапазона;

6) Новый рабочий лист – можно задать произвольное имя нового листа.

Затем нажмите кнопку ОК.

Рисунок 6 Диалоговое окно ввода параметров инструмента Регрессия

Результаты регрессионного анализа для данных задачи представлены на рисунке 7.

Рисунок 7 Результат применения инструмента регрессия

5. Оценим с помощью средней ошибки аппроксимации качество уравнений. Воспользуемся результатами регрессионного анализа представленного на Рисунке 8.

Рисунок 8 Результат применения инструмента регрессия «Вывод остатка»

Составим новую таблицу как показано на рисунке 9. В графе С рассчитаем относительную ошибку аппроксимации по формуле:

Рисунок 9 Расчёт средней ошибки аппроксимации

Средняя ошибка аппроксимации рассчитывается по формуле:

Качество построенной модели оценивается как хорошее, так как не превышает 8 – 10%.

6. Из таблицы с регрессионной статистикой (Рисунок 4) выпишем фактическое значение F-критерия Фишера:

Поскольку при 5%-ном уровне значимости, то можно сделать вывод о значимости уравнения регрессии (связь доказана).

8. Оценку статистической значимости параметров регрессии проведём с помощью t-статистики Стьюдента и путём расчёта доверительного интервала каждого из показателей.

Выдвигаем гипотезу Н₀ о статистически незначимом отличии показателей от нуля:

для числа степеней свободы

На рисунке 7 имеются фактические значения t-статистики:

t-критерий для коэффициента корреляции можно рассчитать двумя способами:

I способ:

где – случайная ошибка коэффициента корреляции.

Данные для расчёта возьмём из таблицы на Рисунке 7.

II способ:

Фактические значения t-статистики превосходят табличные значения:

Поэтому гипотеза Н₀ отклоняется, то есть параметры регрессии и коэффициент корреляции не случайно отличаются от нуля, а статистически значимы.

Доверительный интервал для параметра a определяется как

Для параметра a 95%-ные границы как показано на рисунке 7 составили:

Доверительный интервал для коэффициента регрессии определяется как

Для коэффициента регрессии b 95%-ные границы как показано на рисунке 7 составили:

Анализ верхней и нижней границ доверительных интервалов приводит к выводу о том, что с вероятностью параметры a и b, находясь в указанных границах, не принимают нулевых значений, т.е. не являются статистически незначимыми и существенно отличны от нуля.

7. Полученные оценки уравнения регрессии позволяют использовать его для прогноза. Если прогнозное значение прожиточного минимума составит:

Тогда прогнозное значение прожиточного минимума составит:

Ошибку прогноза рассчитаем по формуле:

где

Дисперсию посчитаем также с помощью ППП Excel. Для этого:

1) Активизируйте Мастер функций: в главном меню выберете Формулы / Вставить функцию.

2) В окне Категория выберете Статистические, в окне функция – ДИСП.Г. Щёлкните по кнопке ОК.

3) Заполните диапазон, содержащий числовые данные факторного признака. Нажмите ОК.

Рисунок 10 Расчёт дисперсии

Получили значение дисперсии

Для подсчёта остаточной дисперсии на одну степень свободы воспользуемся результатами дисперсионного анализа как показано на Рисунке 7.

Доверительные интервалы прогноза индивидуальных значений у при с вероятностью 0,95 определяются выражением:

Интервал достаточно широк, прежде всего, за счёт малого объёма наблюдений. В целом выполненный прогноз среднемесячной заработной платы оказался надёжным.

Условие задачи взято из: Практикум по эконометрике: Учеб. пособие / И.И. Елисеева, С.В. Курышева, Н.М. Гордеенко и др.; Под ред. И.И. Елисеевой. – М.: Финансы и статистика, 2003. – 192 с.: ил.

Методика проведения парного корреляционно-регрессионного анализа средствами MS Excel

По статистическим данным, описывающим зависимость удельного веса бракованной продукции от удельного веса рабочих со специальной подготовкой на предприятиях, построить уравнение парной регрессии и оценить его качество и статистическую значимость.

Удельный вес рабочих со специальной подготовкой, %,х

Удельный вес бракованной продукции, %, у

Оценка качества уравнения регрессии. Средняя относительная ошибка аппроксимации

1. Построим диаграмму рассеяния для определения наличия зависимости между признаками и типа этой зависимости.

Диаграмма рассеяния, или корреляционное поле, показывает наличие линейной обратной связи.

2. Определим линейный коэффициент корреляции по формуле г = ———-.

Для этого построим вспомогательную таблицу:

Удельный вес рабочих со специальной подготовкой,

Линейный коэффициент корреляции будет равен:

С помощью встроенной функции MS Excel =КОРРЕЛ получаем такое же значение линейного коэффициента корреляции. Для этого в ячейку необходимо ввести = КОРРЕЛ (массив у; массив х), причем не имеет значения последовательность ввода массивов.

Таким образом, делаем вывод о сильной обратной линейной зависимости между изучаемыми признаками.

3. Построим уравнение парной линейной регрессии вида у(х) = а + Ьх. Оценим параметры уравнения регрессии а и b с помощью метода наименьших квадратов. Для этого построим вспомогательную таблицу.

Система нормальных уравнений для нахождения параметров парной линейной регрессии имеет вид:

Подставим необходимые данные и получим:

Решив систему, получим:

С помощью встроенной функции MS Excel = ЛИНЕЙН получаем такие же значения параметров уравнения регрессии. Для этого необходимо выделить две ячейки в одной строке, выбрать в главном меню Вставка/Функция, далее выбрать из категории Статистические функцию ЛИНЕЙН. В образовавшемся окне заполнить поля:

• известные значения у — диапазон, содержащий данные результативного признака;
• известные значения х — диапазон, содержащий данные факторного признака;
• константа — логическое значение, которое указывает на наличие или отсутствие параметра а в уравнении регрессии, может принимать значение О или 1. Указываем 1;
• статистика — логическое значение, которое указывает, выводить дополнительную информацию по регрессионному анализу или нет. Если указать О, будут выведены только значения параметров уравнения регрессии а и b в двух выделенных ячейках.

Далее необходимо нажать ОК, одновременно удерживая клавиши Ctrl и Shift. В первой ячейке будет указано значение коэффициента при х, во второй — значение свободного члена уравнения регрессии.

Чтобы вывести всю статистику по уравнению регрессии, изначально необходимо выделить диапазон из пяти строк и двух столбцов и задать логическое значение 1 в аргументе функции = ЛИНЕЙН Статистика. Дополнительная регрессионная статистика будет выводиться в порядке, указанном в следующей схеме:

Значение коэффициента b

Значение коэффициента а

Среднеквадратическое отклонение b (стандартная ошибка параметра Ь)

Среднеквадратическое отклонение а (стандартная ошибка параметра а)

Коэффициент детерминации R 2

Среднеквадратическое отклонение у

F-статистика (F-критерий Фишера)

Число степеней свободы

Регрессионная сумма квадратов ^(у. — у) 2

Остаточная сумма квадратов У’е?

Для разбираемого примера таблица будет выглядеть следующим образом:

Таким образом, уравнение регрессии будет иметь вид: у = 19,41-0,24х. f-критерий Стьюдента для параметра а будет равен t_pac4 =-^- =

Табличное значение t-критерия Стьюдента составляет 2,57. Поскольку расчетное значение больше табличного, параметр а признается статистически значимым.

^-критерий Стьюдента для параметра b будет равен

t_pac4b =7Г = 777^ = -8 ’ 6 — Поскольк У 1расчь> 1 _табл> параметр Ъ признается стати-

Так как коэффициент детерминации г 2 =0,936275, коэффициент корреляции равен г = 4? = 0,96761 и будет иметь отрицательное значение, поскольку связь обратная, на что указывает отрицательный коэффициент при х в уравнении регрессии.

Расчетное значение F-критерия Фишера равно 73,46, а табличное — 6,61. Поскольку расчетное значение F-критерия больше табличного или критического, уравнение парной линейной регрессии в целом признается статистически значимым с вероятностью 95 %.

^-критерий Стьюдента для линейного коэффициента корреляции определяется по формуле: t_pacli = r_yx I ₂— = J

F = 8,6, что больше табличного значения,

поэтому линейный коэффициент корреляции признается статистически значимым.

4. Рассчитаем теоретические значения результативного признака, остатки и среднюю ошибку аппроксимации:

источники:

http://ecson.ru/economics/econometrics/zadacha-3.raschyot-parametrov-regressii-i-korrelyatsii-s-pomoschju-excel.html

http://bstudy.net/830435/ekonomika/metodika_provedeniya_parnogo_korrelyatsionno_regressionnogo_analiza_sredstvami_excel

Имеются следующие данные разных стран об индексе розничных цен на продукты питания (х) и об индексе промышленного производства (у).

	Индекс розничных цен на продукты питания (х)	Индекс промышленного производства (у)
1	100	70
2	105	79
3	108	85
4	113	84
5	118	85
6	118	85
7	110	96
8	115	99
9	119	100
10	118	98
11	120	99
12	124	102
13	129	105
14	132	112

Требуется:

1. Для характеристики зависимости у от х рассчитать параметры следующих функций:

А) линейной;

Б) степенной;

В) равносторонней гиперболы.

2. Для каждой модели рассчитать показатели: тесноты связи и среднюю ошибку аппроксимации.

3. Оценить статистическую значимость параметров регрессии и корреляции.

4. Выполнить прогноз значения индекса промышленного производства у при прогнозном значении индекса розничных цен на продукты питания х=138.

Решение:

1. Для расчёта параметров линейной регрессии

Линейное уравнение регрессии

Решаем систему нормальных уравнений относительно a и b:

Расчёт параметров линейной регрессии

Построим таблицу расчётных данных, как показано в таблице 1.

Таблица 1 Расчетные данные для оценки линейной регрессии

№ п/п	х	у	ху	x²	y²
1	100	70	7000	10000	4900	74,26340	0,060906
2	105	79	8295	11025	6241	79,92527	0,011712
3	108	85	9180	11664	7225	83,32238	0,019737
4	113	84	9492	12769	7056	88,98425	0,059336
5	118	85	10030	13924	7225	94,64611	0,113484
6	118	85	10030	13924	7225	94,64611	0,113484
7	110	96	10560	12100	9216	85,58713	0,108467
8	115	99	11385	13225	9801	91,24900	0,078293
9	119	100	11900	14161	10000	95,77849	0,042215
10	118	98	11564	13924	9604	94,64611	0,034223
11	120	99	11880	14400	9801	96,91086	0,021102
12	124	102	12648	15376	10404	101,4404	0,005487
13	129	105	13545	16641	11025	107,1022	0,020021
14	132	112	14784	17424	12544	110,4993	0,013399
Итого:	1629	1299	152293	190557	122267	1299,001	0,701866
Среднее значение:	116,3571	92,78571	10878,07	13611,21	8733,357	х	х
	8,4988	11,1431	х	х	х	х	х
	72,23	124,17	х	х	х	х	х

Среднее значение определим по формуле:

Формула среднего значения х

Cреднее квадратическое отклонение рассчитаем по формуле:

Формула сренего квадратического отклонения

и занесём полученный результат в таблицу 1.

Возведя в квадрат полученное значение получим дисперсию:

Формула дисперсии

Параметры уравнения можно определить также и по формулам:

Формула и расчёт параметра регрессии b

Формула и расчёт параметра а

Таким образом, уравнение регрессии:

Линейное уравнение регрессии

Следовательно, с увеличением индекса розничных цен на продукты питания на 1, индекс промышленного производства увеличивается в среднем на 1,13.

Рассчитаем линейный коэффициент парной корреляции:

Формула и расчёт коэффициента корреляции

Связь прямая, достаточно тесная.

Определим коэффициент детерминации:

Расчёт коэффициента детерминации

Вариация результата на 74,59% объясняется вариацией фактора х.

Подставляя в уравнение регрессии фактические значения х, определим теоретические (расчётные) значения Зависимая переменная .

Так как

Равенство фактических и расчтных значений ,

следовательно, параметры уравнения определены правильно.

Рассчитаем среднюю ошибку аппроксимации – среднее отклонение расчётных значений от фактических:

Формула и расчёт средней ошибки аппроксимации

В среднем расчётные значения отклоняются от фактических на 5,01%.

Оценку качества уравнения регрессии проведём с помощью F-теста.

F-тест состоит в проверке гипотезы Н₀ о статистической незначимости уравнения регрессии и показателя тесноты связи. Для этого выполняется сравнение фактического F_факти критического (табличного) F_табл значений F-критерия Фишера.

F_фактопределяется по формуле:

Формула F-критерия

где n – число единиц совокупности;

m – число параметров при переменных х.

Расчёт F-критерия

Сравнение табличного и фактического F-критерия

Таким образом, Н₀ – гипотеза о случайной природе оцениваемых характеристик отклоняется и признаётся их статистическая значимость и надёжность.

Полученные оценки уравнения регрессии позволяют использовать его для прогноза.

Если прогнозное значение индекса розничных цен на продукты питания х = 138, тогда прогнозное значение индекса промышленного производства составит:

Расчёт прогнозного значения

2. Степенная регрессия имеет вид:

Степенная модель

Для определения параметров производят логарифмирование степенной функции:

Логарифмирование степенной модели

Для определения параметров логарифмической функции строят систему нормальных уравнений по способу наименьших квадратов:

Система уравнений для расчёта параметров степенной модели

Построим таблицу расчётных данных, как показано в таблице 2.

Таблица 2 Расчетные данные для оценки степенной регрессии

№п/п	х	у	lg x	lg y	lg x*lg y	(lg x)²	(lg y)²
1	100	70	2,000000	1,845098	3,690196	4,000000	3,404387
2	105	79	2,021189	1,897627	3,835464	4,085206	3,600989
3	108	85	2,033424	1,929419	3,923326	4,134812	3,722657
4	113	84	2,053078	1,924279	3,950696	4,215131	3,702851
5	118	85	2,071882	1,929419	3,997528	4,292695	3,722657
6	118	85	2,071882	1,929419	3,997528	4,292695	3,722657
7	110	96	2,041393	1,982271	4,046594	4,167284	3,929399
8	115	99	2,060698	1,995635	4,112401	4,246476	3,982560
9	119	100	2,075547	2,000000	4,151094	4,307895	4,000000
10	118	98	2,071882	1,991226	4,125585	4,292695	3,964981
11	120	99	2,079181	1,995635	4,149287	4,322995	3,982560
12	124	102	2,093422	2,008600	4,204847	4,382414	4,034475
13	129	105	2,110590	2,021189	4,265901	4,454589	4,085206
14	132	112	2,120574	2,049218	4,345518	4,496834	4,199295
Итого	1629	1299	28,90474	27,49904	56,79597	59,69172	54,05467
Среднее значение	116,3571	92,78571	2,064624	1,964217	4,056855	4,263694	3,861048
	8,4988	11,1431	0,031945	0,053853	х	х	х
	72,23	124,17	0,001021	0,0029	х	х	х

Продолжение таблицы 2 Расчетные данные для оценки степенной регрессии

№п/п	х	у
1	100	70	74,16448	17,34292	0,059493	519,1886
2	105	79	79,62057	0,385112	0,007855	190,0458
3	108	85	82,95180	4,195133	0,024096	60,61728
4	113	84	88,59768	21,13866	0,054734	77,1887
5	118	85	94,35840	87,57961	0,110099	60,61728
6	118	85	94,35840	87,57961	0,110099	60,61728
7	110	96	85,19619	116,7223	0,11254	10,33166
8	115	99	90,88834	65,79901	0,081936	38,6174
9	119	100	95,52408	20,03384	0,044759	52,04598
10	118	98	94,35840	13,26127	0,037159	27,18882
11	120	99	96,69423	5,316563	0,023291	38,6174
12	124	102	101,4191	0,337467	0,005695	84,90314
13	129	105	107,4232	5,872099	0,023078	149,1889
14	132	112	111,0772	0,85163	0,00824	369,1889
Итого	1629	1299	1296,632	446,4152	0,703074	1738,357
Среднее значение	116,3571	92,78571	х	х	х	х
	8,4988	11,1431	х	х	х	х
	72,23	124,17	х	х	х	х

Решая систему нормальных уравнений, определяем параметры логарифмической функции.

Формула и расчёт коэффициента регрессии

Формула и расчёт параметра lg а

Получим линейное уравнение:

Линейное уравнение

Выполнив его потенцирование, получим:

Потенцирование линейного уравнения

Подставляя в данное уравнение фактические значения х, получаем теоретические значения результата Теоретическое значение у . По ним рассчитаем показатели: тесноты связи – индекс корреляции и среднюю ошибку аппроксимации.

Формула и расчёт индекса корреляции

Связь достаточно тесная.

Формула и расчёт средней ошибки аппроксимации

В среднем расчётные значения отклоняются от фактических на 5,02%.

Формула и расчёт F-критерия

Сравнение табличного и фактического F-критерия

Полученные оценки уравнения регрессии позволяют использовать его для прогноза. Если прогнозное значение индекса розничных цен на продукты питания х = 138, тогда прогнозное значение индекса промышленного производства составит:

Прогнозное значение у

3. Уравнение равносторонней гиперболы

Уравнение равносторонней гиперболы

Для определения параметров этого уравнения используется система нормальных уравнений:

Система уравнений для нахождения параметров регрессии

Произведем замену переменных

Замена переменной

и получим следующую систему нормальных уравнений:

Система уравнений после замены

Решая систему нормальных уравнений, определяем параметры гиперболы.

Составим таблицу расчётных данных, как показано в таблице 3.

Таблица 3 Расчетные данные для оценки гиперболической зависимости

№п/п	х	у	z	yz
1	100	70	0,010000000	0,700000	0,0001000	4900
2	105	79	0,009523810	0,752381	0,0000907	6241
3	108	85	0,009259259	0,787037	0,0000857	7225
4	113	84	0,008849558	0,743363	0,0000783	7056
5	118	85	0,008474576	0,720339	0,0000718	7225
6	118	85	0,008474576	0,720339	0,0000718	7225
7	110	96	0,009090909	0,872727	0,0000826	9216
8	115	99	0,008695652	0,860870	0,0000756	9801
9	119	100	0,008403361	0,840336	0,0000706	10000
10	118	98	0,008474576	0,830508	0,0000718	9604
11	120	99	0,008333333	0,825000	0,0000694	9801
12	124	102	0,008064516	0,822581	0,0000650	10404
13	129	105	0,007751938	0,813953	0,0000601	11025
14	132	112	0,007575758	0,848485	0,0000574	12544
Итого:	1629	1299	0,120971823	11,13792	0,0010510	122267
Среднее значение:	116,3571	92,78571	0,008640844	0,795566	0,0000751	8733,357
	8,4988	11,1431	0,000640820	х	х	х
	72,23	124,17	0,000000411	х	х	х

Продолжение таблицы 3 Расчетные данные для оценки гиперболической зависимости

№п/п	х	у
1	100	70	72,3262	0,033231	5,411206	519,1886
2	105	79	79,49405	0,006254	0,244083	190,0458
3	108	85	83,47619	0,017927	2,322012	60,61728
4	113	84	89,64321	0,067181	31,84585	77,1887
5	118	85	95,28761	0,121031	105,8349	60,61728
6	118	85	95,28761	0,121031	105,8349	60,61728
7	110	96	86,01027	0,10406	99,79465	10,33166
8	115	99	91,95987	0,071112	49,56344	38,6174
9	119	100	96,35957	0,036404	13,25272	52,04598
10	118	98	95,28761	0,027677	7,357059	27,18882
11	120	99	97,41367	0,016024	2,516453	38,6174
12	124	102	101,46	0,005294	0,291565	84,90314
13	129	105	106,1651	0,011096	1,357478	149,1889
14	132	112	108,8171	0,028419	10,1311	369,1889
Итого:	1629	1299	1298,988	0,666742	435,7575	1738,357
Среднее значение:	116,3571	92,78571	х	х	х	х
	8,4988	11,1431	х	х	х	х
	72,23	124,17	х	х	х	х

Значения параметров регрессии a и b составили:

Формула и расчёт коэффициента регрессии

Формула и расчёт параметра а

Получено уравнение:

Уравнение регрессии

Индекс корреляции:

Формула и расчёт индекса корреляции

Связь достаточно тесная.

Формула и расчёт средней ошибки аппроксимации

В среднем расчётные значения отклоняются от фактических на 4,76%.

Формула и расчёт F-критерия

Сравнение табличного и фактического F-критерия

Прогнозное значение

По уравнению равносторонней гиперболы получена наибольшая оценка тесноты связи по сравнению с линейной и степенной регрессиями. Средняя ошибка аппроксимации остаётся на допустимом уровне.

Источник

Средняя ошибка аппроксимации

По семи территориям Уральского района за 199Х г. известны значения двух признаков.

Район	Расходы на покупку продовольственных товаров в общих расходах, %, у	Среднедневная заработная плата одного работающего, руб., х
Удмуртская респ.	68,8	45,1
Свердловская обл.	61,2	59,0
Башкортостан	59,9	57,2
Челябинская обл.	56,7	61,8
Пермская обл.	55,0	58,8
Курганская обл.	54,3	47,2
Оренбургская обл.	49,3	55,2

Для наших данных система уравнений имеет вид

x	y	x 2	y 2	x • y	y(x)	(y i -y cp ) 2	(y-y(x)) 2	\|y — y x \|:y
45,1	68,8	2034,01	4733,44	3102,88	61,28	119,12	56,61	0,1094
59	61,2	3481	3745,44	3610,8	56,47	10,98	22,4	0,0773
57,2	59,9	3271,84	3588,01	3426,28	57,09	4,06	7,9	0,0469
61,8	56,7	3819,24	3214,89	3504,06	55,5	1,41	1,44	0,0212
58,8	55	3457,44	3025	3234	56,54	8,33	2,36	0,0279
47,2	54,3	2227,84	2948,49	2562,96	60,55	12,86	39,05	0,1151
55,2	49,3	3047,04	2430,49	2721,36	57,78	73,71	71,94	0,172
384,3	405,2	21338,41	23685,76	22162,34	405,2	230,47	201,71	0,5699

Задача №3. Расчёт параметров регрессии и корреляции с помощью Excel

По территориям региона приводятся данные за 200Х г.

Номер региона	Среднедушевой прожиточный минимум в день одного трудоспособного, руб., х	Среднедневная заработная плата, руб., у
1	78	133
2	82	148
3	87	134
4	79	154
5	89	162
6	106	195
7	67	139
8	88	158
9	73	152
10	87	162
11	76	159
12	115	173

Задание:

1. Постройте поле корреляции и сформулируйте гипотезу о форме связи.

2. Рассчитайте параметры уравнения линейной регрессии

3. Оцените тесноту связи с помощью показателей корреляции и детерминации.

5. Оцените с помощью средней ошибки аппроксимации качество уравнений.

6. Оцените с помощью F-критерия Фишера статистическую надёжность результатов регрессионного моделирования.

8. Оцените полученные результаты, выводы оформите в аналитической записке.

Решение:

Решим данную задачу с помощью Excel.

Выделите область ячеек, содержащую данные.

Затем выберете: Вставка / Точечная диаграмма / Точечная с маркерами как показано на рисунке 1.

Рисунок 1 Построение поля корреляции

Рисунок 2 Диалоговое окно «Мастер функций»

5) Заполните аргументы функции:

Известные значения у – диапазон, содержащий данные результативного признака;

Известные значения х – диапазон, содержащий данные факторного признака;

Щёлкните по кнопке ОК;

Рисунок 3 Диалоговое окно аргументов функции ЛИНЕЙН

Дополнительная регрессионная статистика будет выводиться в порядке, указанном в следующей схеме:

Значение коэффициента b	Значение коэффициента a
Стандартная ошибка b	Стандартная ошибка a
Коэффициент детерминации R 2	Стандартная ошибка y
F-статистика	Число степеней свободы df
Регрессионная сумма квадратов