Если стоит задача построения модели регрессии, включающей результативную бинарную переменную, то прогнозные значения
Решением данной задачи будет являться кривая, удовлетворяющая следующим трём свойствам:
Данным трём свойствам удовлетворяет функция распределения вероятности.
Модель парной регрессии с результативной бинарной переменной с помощью функции распределения вероятности можно представить в следующем виде:
где
В этом случае прогнозные значения
Модель бинарного выбора может быть представлена с помощью скрытой или латентной переменной следующим образом:
Векторная форма модели бинарного выбора с латентной переменной:
В данном случае результативная бинарная переменная
Модель бинарного выбора называется пробит-моделью или пробит-регрессией
(probit regression), если она удовлетворяет двум условиям:1) остатки модели бинарного выбора
2) функция распределения вероятностей является нормальной вероятностной функцией.
Пробит-регрессия может быть представлена с помощью выражения:
где
Модель бинарного выбора называется логит-моделью или логит-регрессией
(logit regression), если случайные остаткиЛогит-регрессия может быть представлена с помощью выражения:
Данная модель логит-регрессии характеризуется тем, что при любых значениях факторных переменных и коэффициентов регрессии, значения результативной переменной
Обобщённый вид модели логит-регрессии:
Достоинством данной модели является то, что результативная переменная
Логит-регрессия относится к классу функций, которые можно привести к линейному виду. Это осуществляется с помощью преобразования, носящего название логистического или логит преобразования, которое можно проиллюстрировать на примере преобразования обычной вероятности
Качество построенной логит-регрессии или пробит-регрессии характеризуется с помощью псевдо коэффициента детерминации, который рассчитывается по формуле:
Если значение данного коэффициента близко к единице, то модель регрессии считается адекватной реальным данным.
56. Метод максимума правдоподобия
Метод максимума правдоподобия (maximum likelihood function) применяется для определения неизвестных коэффициентов модели регрессии и является альтернативой методу наименьших квадратов. Суть данного метода состоит в максимизации функции правдоподобия или её логарифма.
Общий вид функции правдоподобия:
где
– это геометрическая сумма, означающая перемножение вероятностей по всем возможным случаям внутри скобок.
Предположим, что на основании полученных данных была построена модель регрессии бинарного выбора, где результативная переменная представлена с помощью латентной переменной:
Следовательно, вероятность события, что результативная переменная
Вероятность события, что результативная переменная
В связи с тем, что для вероятностей считается справедливым равенство вида:
функция правдоподобия может быть записана как геометрическая сумма вероятностей наблюдений:
Для логит-регрессии и пробит-регрессии функция правдоподобия строится через сумму натуральных логарифмов правдоподобия следующим образом:
Оценки неизвестных параметров логит-регрессии и пробит-регрессии определяются с помощью максимизации функции правдоподобия:
Для определения максимума функции
С помощью преобразований данной системы уравнений переходим к системе нормальных уравнений, решениями которой и будут оценки максимального правдоподобия