Почему одно число теряет важную информацию

Точечный прогноз финансовой величины – например, будущей доходности, волатильности или убытка портфеля – обычно воспринимается как «наиболее вероятное будущее». Но с точки зрения теории прогнозов это неверно. Полный прогноз величины (Y_{T+h}) при известном информационном множестве (\mathcal F_T) – это условное распределение (p(Y_{T+h}\mid\mathcal F_T)). Одно число является лишь функционалом этого распределения: средним, медианой, квантилем или другой сводкой. Это не делает точечную оценку бесполезной: для выбора действия, минимизирующего ожидаемые потери, иногда достаточно одного функционала распределения. Но для решений, чувствительных к вероятности и масштабу отклонений, хвостовым потерям или нескольким сценариям, точечный прогноз обычно недостаточен.

Здесь важно отделить выбор прогноза от оценки его риска. При конечной дисперсии для числового прогноза (a) выполняется

[ E[(Y-a)^2\mid\mathcal F_T]=\operatorname{Var}(Y\mid\mathcal F_T)+(E[Y\mid\mathcal F_T]-a)^2. ]

Следовательно, условного среднего достаточно, чтобы выбрать оптимальный (a) при квадратичной ошибке. Но для оценки ожидаемого размера этой ошибки нужна также условная дисперсия. В этой статье (\mathcal F_T) обозначает информацию на момент прогноза, а (F) с индексами – функцию распределения.

Какой именно функционал оптимален, зависит от функции потерь. При квадратичной ошибке оптимальна условная средняя, при абсолютной ошибке – условная медиана, при асимметричной кусочно-линейной функции потерь (quantile/pinball loss) – соответствующий квантиль (Forecasting: principles and practice; Regression Quantiles; Working Paper 11188). Поэтому два прогноза с одинаковым точечным значением могут означать совершенно разные риски: одно распределение может быть узким и почти симметричным, другое – широким, асимметричным и тяжёлохвостым. Для финансового решения это различие часто важнее, чем различие центральных оценок.

Одно среднее, два распределения и разные решения

Зададим воспроизводимый учебный пример, не привязанный к реальному активу. Пусть (Y=100\log(P_1/P_0)) – однопериодная лог-доходность в процентном масштабе. Сравним два условных прогноза: A – нормальное распределение со средним 0 и стандартным отклонением 1; B – нормальное распределение со средним 0 и стандартным отклонением 2. Оба имеют нулевую медиану. Они отличаются только масштабом: это пример более высокого хвостового риска при фиксированном пороге, а не пример математически тяжёлых хвостов.

Обозначим стандартную нормальную функцию распределения через (\Phi), а её квантиль через (\Phi^{-1}). Для масштаба (s\in{1,2}) центральный интервал с покрытием (c) равен ([-s\Phi^{-1}((1+c)/2);s\Phi^{-1}((1+c)/2)]), а вероятность (Y\le-3) равна (\Phi(-3/s)). Этого достаточно, чтобы воспроизвести таблицу; значения округлены.

Показатель A: стандартное отклонение 1 B: стандартное отклонение 2
Среднее и медиана лог-доходности 0 0
Центральный 80%-й интервал для (Y) ([-1{,}282;1{,}282]) ([-2{,}563;2{,}563])
Центральный 95%-й интервал для (Y) ([-1{,}960;1{,}960]) ([-3{,}920;3{,}920])
Вероятность (Y\le-3) 0,135% 6,681%
95%-й квантиль логарифмической меры потерь (-Y) 1,645 3,290

Теперь зададим именно решение: по условному учебному правилу сценарий проходит риск-фильтр, если модельная вероятность (Y\le-3) не превышает 1%. A проходит этот фильтр, B – нет. Порог 1% выбран исключительно для примера, не является нормативом и не даёт рекомендации по позиции. Два одинаковых точечных прогноза 0 приводят к разным результатам одного и того же правила, потому что правило использует вероятность отклонения.

Логарифмическая мера (-Y) не равна денежному убытку. Для длинной позиции начальной стоимости (V), без промежуточных выплат, комиссий и изменения позиции, денежный убыток равен (V(1-e^{Y/100})). Поэтому (Y=-3) соответствует потере примерно 2,955% начальной стоимости, а не ровно 3%. В дальнейшем количественные показатели нужно вычислять для того объекта потерь, который действительно используется в решении.

Какую неопределённость описывает интервал

В примере среднее известно по определению распределений. Тем не менее будущее наблюдение случайно: даже совершенно известное среднее не заменяет прогнозный интервал. В прикладной модели среднее и другие параметры ещё приходится оценивать по данным, и появляется дополнительный источник неопределённости.

Доверительный интервал для параметра или условного среднего описывает точность его оценки. Прогнозный интервал относится к будущему наблюдению и учитывает также его собственную случайность. Это разные объекты, а не два названия одного диапазона (NIST: неопределённость прогноза).

В частотной постановке уровень покрытия характеризует процедуру на повторяющихся выборках и прогнозах при выполнении её допущений. В байесовской постановке интервал из апостериорного прогнозного распределения выражает условную вероятность будущего исхода внутри выбранной модели. Ни одна интерпретация не делает неверную модель правильной: номинальные 95% могут отличаться от фактической доли покрытий.

Интервал на одном горизонте не описывает всю будущую траекторию. Например, вопрос «какова цена через месяц?» отличается от вопроса «пересечёт ли цена барьер хотя бы раз за месяц?». Для второго нужна совместная динамика: набор отдельных 95%-х интервалов по дням не является 95%-й областью для всей траектории. Поэтому сначала определяют событие, от которого зависит решение, и лишь затем выбирают вид прогноза.

Откуда берётся неопределённость

У прогноза есть как минимум четыре разных источника неопределённости: будущие случайные возмущения; оценка параметров по конечной выборке; выбор структуры модели; возможная смена режима. Первое присутствует даже при известных параметрах. Второе можно частично учитывать через процедуру оценивания. Третье требует сравнения содержательно разных спецификаций. Четвёртое нельзя автоматически устранить более точной оценкой параметров прежнего режима.

Эти различия важны практически. Если прогнозный интервал получен подстановкой единственной оценки параметров, он может не отражать неопределённость их оценки. Если сравниваются несколько почти одинаковых моделей, их согласие ещё не означает, что учтена неопределённость структуры. Наконец, широкий интервал старой модели не обязательно описывает последствия события, которого её механизм вообще не предусматривает.

Случайность будущего при заданной модели часто называют алеаторической неопределённостью, а незнание параметров и структуры – эпистемической. Граница между ними зависит от постановки. Для отчёта полезнее перечислить, что именно включено в расчёт интервала, чем ограничиться этими двумя ярлыками.

Финансовая специфика: волатильность, тяжёлые хвосты и асимметрия

Финансовые доходности часто демонстрируют свойства, которые делают симметричный нормальный интервал вида (\hat y \pm 1{,}96\sigma) рискованным упрощением.

Во-первых, волатильность обычно непостоянна: периоды больших движений часто следуют за большими движениями, а спокойные периоды – за спокойными. Это называют кластеризацией волатильности. Модели класса ARCH и GARCH позволяют условной дисперсии зависеть от недавних ошибок и прошлых значений дисперсии, поэтому прогнозный интервал может расширяться после периодов высокой волатильности и сужаться в спокойные периоды (Engle, 1982; Bollerslev, 1986).

Во-вторых, распределения доходностей часто имеют тяжёлые хвосты. Экстремальные движения происходят чаще, чем предсказывает нормальное распределение с той же дисперсией. Тяжёлые хвосты нередко сохраняются даже после фильтрации волатильности GARCH-моделью, поэтому выбор распределения инноваций требует эмпирической проверки (Cont, 2001).

В-третьих, может присутствовать асимметрия, но её нельзя считать универсальным свойством любого актива, периода и частоты данных. Асимметрию следует проверять отдельно для конкретного объекта и модели.

Важно также фиксировать, что именно прогнозируется: цена, лог-доходность, волатильность, денежный поток или убыток портфеля. Интервалы и функции потерь для этих объектов различаются. Например, трансформация прогноза лог-доходности обратно в уровень цены может создавать асимметрию и смещение; нельзя без пояснения просто экспоненцировать точечную среднюю лог-доходность.

Как построить прогноз: один маршрут и его расширения

Начнём с однопериодной модели (Y_{T+1}=\mu_T+\sigma_T Z_{T+1}), где (\mu_T) – условный центр, (\sigma_T>0) – условный масштаб, а распределение стандартизированного возмущения (Z_{T+1}) задано моделью. При фиксированных оценках центра и масштаба квантиль равен (\mu_T+\sigma_T q_p(Z)), а вероятность события (Y_{T+1}\le b) – (F_Z((b-\mu_T)/\sigma_T)).

Таблица A/B – частный случай с (\mu_T=0), стандартным нормальным (Z) и двумя значениями масштаба. В рабочем прогнозе центр и масштаб оцениваются только по доступной на момент (T) информации. Затем из выбранного распределения получают нужную вероятность или квантиль, сохраняют прогноз до наступления исхода и сравнивают его с наблюдением. Именно этот цикл, а не сама формула интервала, позволяет проверить пригодность модели.

Нормальное распределение здесь удобно для расчёта, но не обязано подходить данным. Распределение стандартизированных остатков проверяют отдельно: после учёта меняющейся волатильности в них ещё могут оставаться асимметрия, тяжёлые хвосты или зависимость. Замена распределения инноваций меняет квантили и вероятности даже при том же центре и масштабе.

Дальнейший метод зависит от того, какая часть прогноза нужна и каких допущений недостаточно:

  • Квантильная модель непосредственно оценивает нужный условный квантиль. Один квантиль не определяет полное распределение и не даёт произвольные вероятности событий.
  • Симуляция распространяет заданные возмущения через модель. На нескольких горизонтах она может давать совместные траектории, если воспроизведена их зависимость; независимые выборки из отдельных маргинальных распределений этого не заменяют.
  • Bootstrap использует повторные выборки, схема которых должна сохранять релевантную зависимость. Простое перемешивание сырых остатков с меняющейся дисперсией может разрушить нужную структуру; переоценка параметров на повторных выборках позволяет включить часть неопределённости оценивания (Bootstrapping and bagging).
  • Байесовский подход усредняет прогноз по апостериорному распределению параметров, а не подставляет единственную оценку:

[ p(Y_{T+h}\mid\mathcal F_T,M)=\int p(Y_{T+h}\mid\theta,\mathcal F_T,M),p(\theta\mid\mathcal F_T,M),d\theta. ]

Здесь (M) – фиксированная модель, (\theta) – её параметры. Усреднение учитывает их неопределённость внутри (M), но не доказывает правильность самой структуры (Posterior Predictive Checks).

Сравнение или комбинация нескольких моделей помогает исследовать чувствительность к спецификации. Однако разброс их точечных прогнозов нельзя без дополнительного обоснования выдавать за прогнозный интервал: он может не включать случайность будущего исхода. Для непредусмотренных режимов отдельно рассматривают стресс-сценарии и не приписывают им точно измеренную вероятность без основания.

От распределения к финансовому решению

Пример A/B уже показал переход от модели к правилу решения. Его можно продолжить в денежных единицах: при начальной стоимости позиции 100 денежных единиц 95%-й квантиль денежного убытка равен (100(1-e^{-s\Phi^{-1}(0{,}95)/100})). Для A это примерно 1,631, для B – 3,236 денежной единицы. Формула использует монотонное преобразование лог-доходности, а не приближение «убыток равен минус доходности».

Учебное решение выше использовало вероятность пересечения порога. Если решение вместо этого ограничивает размер потерь, требуется квантиль или средний размер хвостовой потери. Обозначим через (L) выбранный объект потерь: например, денежный убыток позиции, а не автоматически (-Y). Тогда

[ \operatorname{VaR}{\alpha,t}(L)=F^{-1}{L_{t+h}\mid\mathcal F_t}(\alpha), ]

где (F^{-1}) – квантиль условного распределения убытка, а (\alpha) – уровень квантиля; доля верхнего хвоста составляет (1-\alpha). Для непрерывного (L_{t+h}) это означает

[ P\bigl(L_{t+h}\le \operatorname{VaR}_{\alpha,t}(L)\mid\mathcal F_t\bigr)=\alpha. ]

Реализованное покрытие на исторических прогнозах лишь приближает этот номинальный уровень и само по себе его не доказывает. VaR – порог убытка, который по модели не превышается с вероятностью (\alpha). Он не говорит, насколько велики потери, если порог всё же превышен.

Для непрерывных распределений Expected Shortfall уровня (\alpha) можно записать как среднее квантилей хвоста:

[ \operatorname{ES}{\alpha,t}(L)=\frac{1}{1-\alpha}\int{\alpha}^{1}\operatorname{VaR}_{u,t}(L),du. ]

При непрерывности это совпадает с условным математическим ожиданием потерь выше порога VaR:

[ \operatorname{ES}{\alpha,t}(L)=E\bigl[L{t+h}\mid L_{t+h}\ge \operatorname{VaR}_{\alpha,t}(L),\mathcal F_t\bigr]. ]

При наличии скачков, атомов вероятности или в дискретном случае интегральное определение по квантилям задаёт более аккуратную tail-average-конвенцию. ES дополнительно описывает средний размер потерь в хвосте и полезен, когда решение чувствительно к тяжести экстремальных убытков, а не только к факту пересечения порога (Acerbi and Tasche, On the coherence of Expected Shortfall). В стандарте внутренних моделей рыночного риска используется односторонний Expected Shortfall уровня 97,5%; это пример практической потребности учитывать хвост, а не универсальное определение меры риска (Basel Framework, MAR33).

Если вместо убытка используется доходность или P&L, нужно явно указать знаковое соглашение и преобразование в убыток. Иначе легко перепутать направление хвоста: для положительной величины убытка риск описывается правым хвостом распределения потерь, а не левым.

Помимо VaR и ES, из прогнозного распределения можно получить:

  • вероятность превышения порога убытка;
  • вероятности сценарных событий;
  • интервалы для нескольких уровней доверия;
  • многопериодные сценарные траектории или simultaneous prediction regions с отдельно заданным уровнем, если решение зависит от пути, а не только от одного горизонта; набор маргинальных интервалов на каждом горизонте для этого недостаточен.

Как проверять вероятностные прогнозы

Качество прогнозного распределения нельзя оценить одной метрикой точечной ошибки. Проверка должна быть вневыборочной и последовательной.

Rolling forecasting origin

Прогнозы следует строить на последовательных вневыборочных окнах: каждый прогноз формируется только по данным, известным на момент прогноза (Time series cross-validation). Это имитирует реальное использование модели и помогает избежать завышенной оценки качества из-за подгонки под всю выборку. При каждом forecast origin нужно воспроизводить эксплуатационный протокол: если в реальной системе параметры переоцениваются ежедневно или при каждом новом окне, это должно происходить и в backtest; если модель переоценивается реже, backtest должен сохранить этот график. Окно может расширяться или иметь фиксированную длину, и выбор окна и график переоценки нужно фиксировать в спецификации проверки.

Покрытие интервалов

Для интервальных прогнозов оценивают долю попаданий фактических значений в прогнозные интервалы. Но одной доли недостаточно. Проверяют как общую частоту попаданий (безусловное покрытие), так и зависимость нарушений во времени. Условное покрытие требует совместного выполнения обоих свойств: корректной безусловной вероятности покрытия и отсутствия зависимости в последовательности пробитий в рамках выбранной спецификации теста (Evaluating Interval Forecasts). Классический тест может проверять, например, конкретную first-order Markov-зависимость, а не любую зависимость от всей доступной информации. Это лишь операциональная проверка относительно выбранного информационного множества и теста; отсутствие очевидных кластеров само по себе не доказывает корректность. Формально правильная средняя частота попаданий может скрывать систематическое занижение риска в периоды высокой волатильности, если нарушения зависимы.

Калибровка и острота (calibration и sharpness)

Качество вероятностного прогноза имеет две стороны (Probabilistic Forecasts, Calibration and Sharpness).

Калибровка (calibration) – статистическое соответствие прогнозов наблюдаемым исходам; точное определение зависит от типа прогноза. Для бинарного события интуитивный пример таков: среди случаев, которым присвоена вероятность около 20%, событие должно происходить примерно в 20% случаев. Общая доля попаданий и поведение в отдельных режимах отвечают на разные вопросы: правильное среднее покрытие может сочетаться с систематическими ошибками в периоды высокой волатильности.

Острота, или концентрация (sharpness) – концентрация прогнозного распределения. Узкие интервалы и концентрированные распределения более информативны, но только при сохранении калибровки.

Цель состоит в максимальной sharpness при условии calibration. Поэтому более широкий интервал не является автоматически честнее, а более узкий – лучше. Сравнение допустимо только с учётом фактической калибровки и подходящих правил оценки.

Probability integral transform

Для полного прогнозного распределения стандартная диагностика использует probability integral transform (Evaluating Density Forecasts). Для непрерывной predictive CDF при корректно специфицированной истинной conditional CDF однопериодное значение PIT можно записать как (U_{t+1}=F_{t+1\mid t}(Y_{t+1}\mid\mathcal F_t)); тогда оно должно иметь распределение (\operatorname{Uniform}(0,1)), а последовательность при стандартных условиях – быть независимой. При оценённой CDF равномерность и независимость проверяются лишь приближённо и зависят от оценки модели и информационного множества. Неравномерность может указывать на ошибку положения, масштаба или формы распределения, но конечная выборка и оценивание тоже влияют на картину; по одной гистограмме нельзя однозначно установить причину. Для многогоризонтных перекрывающихся прогнозов равномерность по-прежнему является целевым свойством при верной модели, но независимость обычно нарушается: нужны тесты и стандартные ошибки, учитывающие зависимость, а не автоматический вывод о пропущенной динамике. Для дискретных или смешанных распределений PIT требует рандомизации или другой специальной модификации.

Метрики: точечный прогноз против вероятностного

RMSE и MAE оценивают только выбранный точечный функционал. Они полезны, но не позволяют сравнивать качество всего прогнозного распределения. Две модели могут иметь одинаковый RMSE точечного прогноза, но существенно различаться по калибровке интервалов и хвостовому риску.

Для вероятностных прогнозов используют proper scoring rules – правила оценки, побуждающие сообщать истинное прогнозное распределение (Strictly Proper Scoring Rules). Для всего распределения подходят:

  • log score – логарифм прогнозной плотности в реализовавшемся значении для непрерывного исхода (для дискретного исхода – логарифм назначенной ему вероятности). При таком соглашении большее значение лучше; для отрицательного log score как функции потерь – меньшее;
  • CRPS – continuous ranked probability score, сравнивающий прогнозную функцию распределения с фактическим исходом: [\operatorname{CRPS}(F,y)=\int_{-\infty}^{\infty}\left(F(x)-\mathbf{1}{y\le x}\right)^2dx.] Здесь CRPS рассматривается как loss: меньшее значение лучше. В литературе встречаются и соглашения о знаке score, ориентированные на максимизацию, поэтому направление «лучше» нужно указывать явно;

Для отдельных характеристик распределения используют другие согласованные критерии:

  • quantile loss, или pinball loss, для оценки отдельных квантилей;
  • interval score, который совместно учитывает покрытие и ширину интервала.

Интервалы нельзя оценивать только по ширине или только по покрытию. Узкий интервал с плохим покрытием плох; широкий интервал с хорошим покрытием может быть неинформативен. Нужен совместный критерий. При сравнении средних scores также следует учитывать sampling uncertainty и временную зависимость ошибок: небольшая разница средних значений сама по себе не доказывает превосходство одной модели.

Ограничения и типичные ошибки

Все вероятности и интервалы условны относительно данных, модели, способа оценки и предположения о будущем режиме. Они не являются безусловной гарантией результата.

Несколько важных ограничений:

  • 95%-й прогнозный интервал не означает, что конкретный реализовавшийся интервал «обязан» содержать будущее с объективной вероятностью 95%. Это номинальное модельное покрытие, которое проверяется на повторяющихся прогнозах.
  • Исторический backtest с небольшим числом кризисных наблюдений даёт особенно неопределённые оценки покрытия 99%-х интервалов, VaR и Expected Shortfall.
  • ARCH/GARCH-модели не гарантируют точного описания хвостов и могут не выдерживать структурных разрывов.
  • «Стилизованные факты» финансовых доходностей – повторяющиеся эмпирические закономерности, а не законы, одинаково действующие для любого актива, периода и частоты данных.
  • Нормальность, стационарность, независимость остатков и неизменность режима – не факты, а проверяемые рабочие предположения.
  • Неопределённость часто растёт с горизонтом, но конкретная динамика зависит от модели и объекта прогнозирования. В стационарных или mean-reverting процессах дисперсия прогноза может стабилизироваться.
  • Непредусмотренный структурный разрыв трудно представить в рамках прогнозного распределения фиксированной модели. Известные механизмы смены режима можно моделировать вероятностно через regime-switching или change-point модели, но это не устраняет неопределённость относительно появления принципиально нового режима.

Практический шаблон отчёта о прогнозе

Если решение зависит от вероятности и масштаба отклонений, центральную оценку нужно дополнить соответствующими характеристиками неопределённости. Разумный отчёт о вероятностном прогнозе может включать следующие элементы.

  1. Объект прогноза. Ясно указать, что прогнозируется: цена, лог-доходность, волатильность, денежный поток или положительная величина убытка.
  2. Центральная оценка. Указать, какой функционал используется: средняя, медиана или другой квантиль, и почему он соответствует функции потерь.
  3. Несколько квантилей или интервалов. Например, 50%, 80% и 95% интервалы, либо набор квантилей, показывающих форму распределения.
  4. Хвостовые показатели. VaR и Expected Shortfall, если задача связана с риском потерь, с явным указанием уровня и знаковой конвенции.
  5. Допущения модели. Какая модель использована, какие распределения и предположения о режиме приняты.
  6. Backtest калибровки. Результаты вневыборочной проверки: покрытие интервалов, независимость нарушений, PIT-диагностика или другие подходящие проверки.
  7. Метрики качества. Не только RMSE или MAE, но и proper scoring rules, если оценивается распределение.
  8. Стресс-сценарии. Отдельные сценарии для событий, которые плохо описываются исторической моделью или имеют мало наблюдений в хвостах.

Вывод

В примере A и B средний прогноз лог-доходности одинаков, но вероятность пересечения одного порога различается, поэтому одно правило даёт разные решения. Это и есть причина переходить от точки к распределению: не ради большего количества показателей, а ради информации, которую использует конкретное решение.

Практическая последовательность такова: определить объект и правило решения, построить нужные вероятности или квантили, явно назвать допущения и проверить прогнозы на следующих наблюдениях. Среднее может быть достаточным для выбора точечного прогноза при квадратичной ошибке; оно не описывает риск этого прогноза. Интервал, VaR или ES добавляют нужную информацию, но её качество остаётся свойством проверяемой модели, а не гарантией будущего результата.