Оценка значимости коэффициентов регрессии осуществляется на основе. Оценка значимости уравнения регрессии и особенности применения коэффициента детерминации. Корреляционно-регрессионный анализ в Excel

Эмпирическое корреляционное отношение

Теснота или сила связи между двумя признаками может быть измерена показателем, называемым эмпирическим корреляционным отношением. Этот показатель назван эмпирическим, поскольку он может быть рассчитан на основе обычной группировки по факторному и результативному признаку, то есть на основе корреляционной таблицы. Эмпирическое корреляционное отношение получается из правила сложения дисперсий, согласно которому , где - общая дисперсия; - межгрупповая дисперсия; - внутригрупповая (средняя из частных) дисперсия. Межгрупповая дисперсия является мерой колеблемости, обусловленной факторным признаком. Средняя из частных дисперсий является мерой колеблемости, обусловленной всеми остальными(кроме факторного) признаками. Тогда отношение выражает долю колеблемости, возникающей за счет факторного признака, в общей колеблемости. Квадратный корень из этого отношения и называется эмпирическим корреляционным отношением: .

Отсюда следует правило, что чем больше межгрупповая дисперсия, тем сильнее факторный признак влияет на вариации результативного признака. Составляющие отношения дисперсий вычисляются по данным корреляционной таблицы по следующим формулам:

; ,

где - частные средние; - общая средняя; - итоги по признаку ; - итоги по признаку ; - число наблюдений. То же соотношение сохраняется и для условных значений , полученных числовым преобразованием .

Само отношение дисперсий (подкоренное выражение) называется коэффициентом детерминации (оно равно также квадрату эмпирического корреляционного отношения). Эмпирическое корреляционное отношение изменяется в широких пределах (от 0 до 1). Если оно равно нулю, значит факторный признак на корреляционный не влияет. Если =1, значит, результативный признак полностью зависит от факторного. Если же эмпирическое корреляционное отношение представляет дробь, близкую единице, то говорят о тесной связи между факторным и результативным признаками. Если эта дробь мала (близка нулю), то говорят о слабой связи между ними.

Эмпирическое корреляционное отношение измеряет, какую часть общей колеблемости результативного признака вызывает изучаемый фактор. Эмпирическое корреляционное среднее варьирует от 0 до 1.

Находят эмпирическое корреляционное отношение обычно в следующих типах задач:

  • 1) когда по двум рядам данным X и Y необходимо произвести аналитическую группировку
  • 2) группировка уже произведена, необходимо проверить правило сложения дисперсий
  • 3) по двум рядам данным X и Y необходимо найти уравнение регрессии и оценить его значимость

Формула дисперсии альтернативного признака

Исходя из изложенного выше, можно вывести формулу нахождения дисперсии альтернативного признака, если нам известна процентная доля такого признака в общем объеме выборки.

Изначально мы предполагаем, что признак принимает только два значения.

Таким образом, сумма доли элементов, в которых элементы статистического ряда имеют значение признака "нет" и элементов ряда, которые имеют значение признака "да" - равно единице.

Для нахождения среднего значения ряда, подставим значения альтернативных признаков (0 и 1) в формулу нахождения среднего взвешенного значения статистического ряда. Откуда, совершенно очевидно, в знаменателе будет единица, а в числителе - процентное значение элементов "1". То есть ровно процентное значение элементов с признаком "1". (Формула 2)

Формула дисперсии - это средневзвешенное значение квадратов отклонений каждого значения ряда данных. (Формула 3)

Поскольку в нашем ряду данные имеют только два типа значений - "0" и "1", то формула нахождения дисперсии для ряда, имеющего альтернативный признак сводится к Формуле 4. Пояснение. поскольку мы только что вывели, что среднее значение выборки равно р (Формула 2), то значение квадрата разности значения (0/1) и среднего значения, согласно Формулы 1, будет в первом случае (1-p)2 , а во втором случае (1-q)2 , теперь, применив следствие из первой формулы: q = 1 - p, p = 1- q . Получим p2 и q2 . Соответственно, доля значений "0" и "1" равна p и q, в результате в числителе и получается q2 p и p2 q. Сумма долей признаков значений "0" и "1" согласно Формуле 1 равна 1. В итоге Формула 4 и принимает значение pq, которое и будет равно значению дисперсии альтернативного признака. Исходя из найденного значения величины дисперсии альтернативного признака, найдем среднеквадратичное отклонение (Формула 5). Поставив значение из Формулы 1 в Формулу 5, получим формулу среднеквадратичного отклонения для дисперсии ряда с альтернативным признаком.

Корреляционный анализ предполагает измерение тесноты связи с помощью коэффициента корреляции и корреляционного отношения. При линейной форме зависимости силу связи оценивает коэффициент корреляции Пирсона :

Коэффициент корреляции изменяется в пределах от (– 1) до (+ 1), (– 1 r 1).

Отрицательный знак показателя свидетельствует об обратной связи, положительный – о прямой связи. Чем ближе значение показателя к единице, по модулю, тем связь сильнее, чем ближе к нулю, тем связь слабее.

Для измерения силы связи при любой форме зависимости, как линейной, так и нелинейной, а также для оценки множественной связи применяют теоретическое корреляционное отношение (индекс корреляции). В основе его расчета лежит правило сложения дисперсии:

где общая дисперсия – отражает вариацию результативного признака за счет всех действующих на него факторов;

или

факторная дисперсия , отражает вариацию результативного признака за счет фактора (х) .

остаточная дисперсия , отражает вариацию результативного признака за счет всех факторов, кроме фактора (х) ;

Теоретическое корреляционное отношение – это корень квадратный из отношения факторной дисперсии к общей дисперсии:

Подкоренное выражение – коэффициент детерминации :

показывает долю вариации результативного признака, обусловленную влиянием факторного признака, в общей вариации. Чем эта доля выше, тем связь между признаками сильнее.

Теоретическое корреляционное отношение изменяется от 0 до 1 (0 R 1) .Чем значение показателя ближе к единице, тем связь сильнее.

Для оценки тесноты связи можно воспользоваться шкалой Чеддока :

Основная тенденция развития и методы ее выявления

Каждый ряд динамики имеет свою тенденцию развития, т.е. общее направление к росту, снижению или стабилизации уровня явления с течением времени. Степень выраженности этой тенденции зависит от влияния постоянных, периодических (сезонных) и случайных факторов на уровни ряда динамики. Поэтому следует говорить не просто о тенденции развития, а об основной тенденции.

Основной тенденцией развития (трендом) называется плавное и устойчивое изменение уровня явления во времени, свободное от периодических и случайных колебаний .

Для выявления тренда ряды динамики подвергаются обработке методами укрупнения интервалов, скользящей средней, аналитического выравнивания.

Метод укрупнения интервалов основан на укрупнении периодов времени, к которым относятся уровни ряда динамики. Для этого исходные данные объединяются, т.е. суммируются или усредняются за более продолжительные интервалы времени, пока общая тенденция развития не станет достаточно отчетливой. Например, дневные данные о производстве продукции объединяются в декадные, месячные в квартальные, годовые в многолетние. Достоинство метода в его простоте. Недостаток в том, что сглаженный ряд существенно короче исходного.

Метод скользящей средней состоит в том, что на основе исходных данных рассчитываются подвижные средние из определенного числа сначала первых по счету уровней ряда, затем из такого же числа уровней, начиная со второго, с третьего и т.д. Средняя величина как бы скользит по динамическому ряду, передвигаясь на один интервал. В скользящих средних сглаживаются случайные колебания.

Схема расчета 3-х уровневой скользящей средней величины

Интервал времени

(номер по порядку)

Фактические уровни ряда динамики

у i

Скользящие средние

у ск

у 1

у 2

у 3

у 4

у ск3

у 5

у ск4

у 6

Сглаженный ряд динамики короче исходного на величину (l – 1) , если укрупнение производится по нечетному числу уровней, где l – длина периода укрупнения. Например, если l = 3, то выровненный ряд на 2 уровня короче. Таким образом сглаженный ряд не на много короче исходного.

Метод аналитического выравнивания заключается в замене фактических уровней ряда динамики их теоретическими значениями, вычисленными на основе уравнения тренда:

Расчет параметров уравнения производится методом наименьших квадратов:

где у – фактические уровни;у ti – соответствующие им во времени выровненные (расчетные) уровни.

Если развитие осуществляется в арифметической прогрессии (с равными цепными абсолютными приростами), то для выравнивания используют линейную функцию :

Если наблюдается динамика в геометрической прогрессии, (с равными цепными темпами роста), то необходимо использовать показательную функцию :

у t = а 0 а 1 t .

Если развитие происходит с равными темпами прироста, используется степенная функция , например второго порядка (парабола):

у t = а 0 + а 1 t + а 2 t 2 .

Критерием правильности выбора уравнения тренда служит ошибка аппроксимации . Она представляет собой среднее квадратическое отклонение фактических уровней ряда динамики от теоретических:

Оптимальным считается уравнение с наименьшей ошибкой аппроксимации.

Рассмотрим «технику» выравнивания ряда динамики по линейной функции :


где а 0 , а 1 – параметры уравнения прямой; t – показатели времени (как правило, порядковый номер периода или момента времени).

Параметры прямой а 0 и а 1 , удовлетворяющие методу наименьших квадратов, находят решением следующей системы нормальных уравнений:

где n – число уровней ряда динамики; параметр а 1 соответствует среднему абсолютному приросту.

Для упрощения расчета показателям времени
можно придать такие значения, при которых
, тогда

Для этого в рядах с нечетным числом уровней за начало отсчета времени принимают центральный интервал, где t приравнивают к нулю. По обе стороны от нуля располагают соответственно ряды отрицательных и положительных натуральных чисел, например:

Интервал времени

(номер по порядку)

t i

При четном числе уровней отсчет ведется от двух центральных интервалов, в которых t приравнено к (-1) и (+1) соответственно, а по обе стороны располагаются ряды отрицательных и положительных нечетных чисел, например:

Интервал времени

(номер по порядку)

t i

Схема расчета параметров линейного уравнения

Интервалы времени

Уровни ряда динамики

у i

t i

i t 2

у i t i

у ti

На основе исчисленного уравнения тренда можно производить экстраполяцию – нахождение вероятностных (прогнозируемых) уровней за пределами исходного ряда динамики.

Для проверки значимости анализируется отношение коэффициента регрессии и его среднеквадратичного отклонения. Это отношение является распределением Стьюдента, то есть для определения значимости используем t – критерий:

- СКО от остаточной дисперсии;

- сумма отклонений от среднего значения

Если t рас. >t таб. , то коэффициент b i является значимым.

Доверительный интервал определяется по формуле:

ПОРЯДОК ВЫПОЛНЕНИЯ РАБОТЫ

    Взять исходные данные согласно варианту работы (по номеру студента в журнале). Задан статический объект управления с двумя входами X 1 , X 2 и одним выходом Y . На объекте проведен пассивный эксперимент и получена выборка объемом 30 точек, содержащая значения Х 1 , Х 2 и Y для каждого эксперимента.

    Открыть новый файл в Excel 2007. Ввести исходную информацию в столбцы исходной таблицы - значения входных переменных X 1 , Х 2 и выходной переменной Y .

    Подготовить дополнительно два столбца для ввода расчетных значений Y и остатков.

    Вызвать программу «Регрессия»: Данные/ Анализ данных/ Регрессия.

Рис. 1. Диалоговое окно «Анализ данных».

    Ввести в диалоговое окно «Регрессия» адреса исходных данных:

    входной интервал Y, входной интервал X (2 столбца),

    установить уровень надежности 95%,

    в опции «Выходной интервал, указать левую верхнюю ячейку места вывода данных регрессионного анализа (первую ячейку на 2-странице рабочего листа),

    включить опции «Остатки» и «График остатков»,

    нажать кнопку ОК для запуска регрессионного анализа.

Рис. 2. Диалоговое окно «Регрессия».

    Excel выведет 4 таблицы и 2 графика зависимости остатков от переменных Х1 и Х2 .

    Отформатировать таблицу «Вывод итогов» - расширить столбец с наименованиями выходных данных, сделать во втором столбце 3 значащие цифры после запятой.

    Отформатировать таблицу «Дисперсионный анализ»- сделать удобным для чтения и понимания количество значащих цифр после запятых, сократить наименование переменных и настроить ширину столбцов.

    Отформатировать таблицу коэффициентов уравнения - сократить наименование переменных и скорректировать при необходимости ширину столбцов, сделать удобным для чтения и понимания количество значащих цифр, удалить 2 последних столбца (значения и разметку таблицы).

    Данные из таблицы «Вывод остатка» перенести в подготовленные столбцы исходной таблицы, затем таблицу «Вывод остатка» удалить (опция «специальная вставка»).

    Ввести полученные оценки коэффициентов в исходную таблицу.

    Подтянуть таблицы результатов по максимуму вверх страницы.

    Построить под таблицами диаграммы Y эксп , Y расч и ошибки прогноза (остатка).

    Отформатировать диаграммы остатков. По полученным графикам оценить правильность модели по входам Х1, Х2 .

    Распечатать результаты регрессионного анализа.

    Разобраться с результатами регрессионного анализа.

    Подготовить отчет по работе.

ПРИМЕР ВЫПОЛНЕНИЯ РАБОТЫ

Прием выполнения регрессионного анализа в пакете EXCEL представлен на рисунках 3-5.

Рис. 3. Пример регрессионного анализа в пакете EXCEL.


Рис.4 . Графики остатков переменных Х1, Х2

Рис. 5. Графики Y эксп ,Y расч и ошибки прогноза (остатка).

По данным регрессионного анализа можно сказать:

1. Уравнение регрессии полученное с помощью Excel, имеет вид:

    Коэффициент детерминации:

Вариация результата на 46,5% объясняется вариацией факторов.

    Общий F-критерий проверяет гипотезу о статистической значимости уравнения регрессии. Анализ выполняется при сравнении фактического и табличного значения F-критерия Фишера.

Так как фактическое значение превышает табличное
, то делаем вывод, что полученной уравнение регрессии статистически значимо.

    Коэффициент множественной корреляции:

    b 0 :

t таб. (29, 0.975)=2.05

b 0 :

Доверительный интервал:

    Определяем доверительный интервал для коэффициента b 1 :

Проверка значимости коэффициента b 1 :

t рас. >t таб. , коэффициент b 1 является значимым

Доверительный интервал:

    Определяем доверительный интервал для коэффициентаb 2 :

Проверка значимости для коэффициентаb 2 :

Определяем доверительный интервал:

ВАРИАНТЫ ЗАДАНИЙ

Таблица 2. Варианты заданий

№ варианта

Результативный признак Y i

Y 1

Y 1

Y 1

Y 1

Y 1

Y 1

Y 1

Y 1

Y 1

Y 1

Y 2

Y 2

Y 2

Y 2

Y 2

№ фактора X i

№ фактора X i

Продолжение таблицы 1

№ варианта

Результативный признак Y i

Y 2

Y 2

Y 2

Y 2

Y 2

Y 3

Y 3

Y 3

Y 3

Y 3

Y 3

Y 3

Y 3

Y 3

Y 3

№ фактора X i

№ фактора X i

Таблица 3. Исходные данные

Y 1

Y 2

Y 3

X 1

X 2

X 3

X 4

X 5

ВОПРОСЫ ДЛЯ САМОКОНТРОЛЯ

    Задачи регрессионного анализа.

    Предпосылки регрессионного анализа.

    Основное уравнение дисперсионного анализа.

    Что показывает F- отношение Фишера?

    Как определяется табличное значение критерия Фишера?

    Что показывает коэффициент детерминации?

    Как определить значимость коэффициентов регрессии?

    Как определить доверительный интервал коэффициентов регрессии?

    Как определить расчетные значение t-критерия?

    Как определить табличное значение t-критерия?

    Сформулируйте основную идею дисперсионного анализа, для решения каких задач он наиболее эффективен?

    Каковы основные теоретические предпосылки дисперсионный анализ?

    Произведите разложение общей суммы квадратов отклонений на составляющие в дисперсионном анализе.

    Как получить оценки дисперсий из сумм квадратов отклонений?

    Как получаются необходимые числа степеней свободы?

    Как определяется стандартная ошибка?

    Поясните схему двухфакторного дисперсионного анализа.

    Чем отличается перекрестная классификация от иерархической классификации?

    Чем отличаются сбалансированные данные?

Отчет оформляется в текстовом редакторе Word на бумаге формата А4 ГОСТ 6656-76 (210х297 мм) и содержит:

    Название лабораторной работы.

    Цель работы.

  1. Результаты вычисления.

ВРЕМЯ, ОТВЕДЕННОЕ НА ВЫПОЛНЕНИЕ

ЛАБОРАТОРНОЙ РАБОТЫ

Подготовка к работе – 0,5 акад. часа.

Выполнение работы – 0,5 акад. часа.

Расчеты на ЭВМ – 0,5 акад. часа.

Оформление работы – 0,5 акад. часа.

ЛитЕратура

    Идентификация объектов управления. / А. Д. Семенов, Д. В. Артамонов, А. В. Брюхачев. Учебное пособие. - Пенза: ПГУ, 2003. - 211 с.

    Основы статистического анализа. Практикум по статистическим методам и исследованию операций с использованием пакетов STATISTIC и EXCEL. / Вуколов Э.А. Учебное пособие. - М.: ФОРУМ, 2008. - 464 с.

    Основы теории идентификации объектов управления. / А.А. Игнатьев, С.А. Игнатьев. Учебное пособие. - Саратов: СГТУ, 2008. - 44 с.

    Теория вероятности и математическая статистика в примерах и задачах с применением EXCEL. / Г.В. Горелова, И.А. Кацко. - Ростов н/Д: Феникс, 2006.- 475 с.

    Цель работы 2

    Основные понятия 2

    Порядок выполнения работы 6

    Пример выполнения работы 9

    Вопросы для самоконтроля 13

    Время, отведенное на выполнение работы 14