Заключи лучшую страховую сделку

Predictive Analytics для оттока клиентов в страховании: модели, метрики, кейс

Как предсказать отток клиентов в страховании: модели, признаки риска и реальный кейс

Зачем прогнозировать отток: экономика профилактики

В страховании отток (Churn) — это уход клиента до окончания срока действия договора. По данным Ассоциации страховщиков России (АСР) за 2023 год, средний уровень оттока по сегменту ИСЖ (инвестиционное страхование жизни) составил 18 % годовых. Это значит, что почти каждый пятый клиент прекращает сотрудничество раньше времени.

Почему профилактика выгоднее привлечения:

  • стоимость привлечения нового клиента в 3–5 раз выше, чем удержание существующего;
  • лояльный клиент приносит стабильный доход и реже требует поддержки;
  • прогноз оттока позволяет вовремя запустить проактивные коммуникации — скидку, бонус, персонализированное предложение.

Исторический контекст: в 2010‑х годах страховые компании ориентировались на массовый маркетинг и рост портфеля. С 2020‑х акцент сместился на удержание — из‑за роста конкуренции и ужесточения регуляторных требований (Указание Банка России № 6460‑У от 08.04.2024).

Признаки риска: что сигнализирует об уходе клиента

Модели Predictive Analytics опираются на набор признаков (features), которые статистически связаны с оттоком. Ниже — ключевые группы с примерами.

Группа признаков Примеры
Поведенческие снижение частоты входов в личный кабинет, уменьшение суммы платежей, отсутствие реакции на рассылки
Демографические возраст < 25 или > 65 лет, доход ниже среднего по портфелю
Транзакционные просрочки платежей, частые обращения в поддержку, жалобы на условия договора
Временные период действия договора > 2 лет (риск снижения лояльности), сезонность (отток чаще в январе–феврале)

Важно: значимость признаков меняется по сегментам. В ИСЖ сильнее влияют поведенческие и транзакционные факторы, в ОСАГО — демографические и временные.

Модели прогнозирования: сравнение точности и интерпретируемости

Для задачи Churn‑анализа применяют алгоритмы машинного обучения. Разберём три популярных — с точки зрения точности и возможности объяснить прогноз.

Логистическая регрессия

Простая, интерпретируемая модель. Выдает вероятность оттока $P(y=1)$, где $y=1$ — уход клиента.

Формула:

$$P(y=1) = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \ldots + \beta_n x_n)}}$$

Где:

  • $\beta_0, \beta_1, \ldots, \beta_n$ — коэффициенты, оцениваемые на данных;
  • $x_1, \ldots, x_n$ — признаки риска (например, частота входов, сумма платежа).

Плюсы: прозрачность, лёгкость объяснения бизнесу. Минусы: низкая точность на сложных нелинейных зависимостях.

Random Forest

Ансамбль деревьев решений. Усредняет прогнозы множества деревьев, что снижает переобучение.

Плюсы: высокая точность, устойчивость к шуму, оценка важности признаков. Минусы: сложнее интерпретировать, чем регрессию.

В страховании используют для отбора признаков: модель показывает, какие факторы сильнее влияют на отток (например, «количество обращений в поддержку» важнее «возраста»).

XGBoost

Градиентный бустинг на деревьях. Часто даёт лучшую точность среди «классических» моделей.

Плюсы: высокая предсказательная сила, работа с пропущенными значениями. Минусы: риск переобучения, требует тщательной настройки гиперпараметров.

Пример: в кейсе ниже XGBoost достиг AUC‑ROC 0,87 — на 12 п.п. выше логистической регрессии.

Вывод по моделям: для старта — логистическая регрессия (прозрачность), для максимизации точности — XGBoost или Random Forest (с проверкой на переобучение).

Метрики качества модели: как оценить прогноз

Точность модели оттока измеряют не только долей правильных ответов. Важны метрики, учитывающие дисбаланс классов (отток обычно < 20 %).

  • AUC‑ROC — площадь под кривой ошибок. Чем ближе к 1, тем лучше модель разделяет «уходящих» и «остающихся» клиентов. В страховании хороший уровень — AUC ≥ 0,8. Значение 0,5 означает, что модель работает как случайное угадывание.
  • Precision (точность) — доля верно предсказанных уходящих клиентов среди всех, кого модель отметила как «рисковых». Формула:

    $$\text{Precision} = \frac{\text{TP}}{\text{TP} + \text{FP}}$$

    Где:

    • $\text{TP}$ (True Positive) — верно предсказанные случаи оттока;
    • $\text{FP}$ (False Positive) — ложноположительные срабатывания (модель ошиблась, клиент остался).

    В страховании высокая Precision важна, чтобы не тратить бюджет на проактивные меры для лояльных клиентов.

  • Recall (полнота) — доля верно предсказанных уходящих среди всех реальных случаев оттока. Формула:

    $$\text{Recall} = \frac{\text{TP}}{\text{TP} + \text{FN}}$$

    Где $\text{FN}$ (False Negative) — пропущенные случаи (модель не увидела риск, клиент ушёл).

    Высокий Recall нужен, чтобы не пропустить значимых клиентов — например, с большим портфелем ИСЖ.

  • F1‑score — гармоническое среднее Precision и Recall. Балансирует между ложными срабатываниями и пропусками:

    $$\text{F1} = 2 \cdot \frac{\text{Precision} \cdot \text{Recall}}{\text{Precision} + \text{Recall}}$$

    Оптимальное значение — ближе к 1. В задачах оттока часто приоритезируют Recall (не пропустить клиента), но F1 даёт комплексную оценку.

Практический совет: в страховании строят матрицу ошибок (confusion matrix) и анализируют комбинации метрик. Например, модель с Recall 0,9 и Precision 0,6 может быть выгоднее, чем с Recall 0,7 и Precision 0,9 — если стоимость удержания выше стоимости ложного срабатывания.

Кейс: снижение Churn на 35 % в ИСЖ

Рассмотрим реализацию Predictive Analytics в крупной страховой компании (портфель ИСЖ — 120 тыс. договоров).

Шаг 1. Сбор и подготовка данных

Источником стали:

  • транзакции (платежи, выплаты);
  • логи взаимодействий (входы в ЛК, просмотры документов);
  • обращения в поддержку (темы, тональность);
  • демография (возраст, регион, доход).

Признаки нормализовали, пропущенные значения заполнили медианой, категориальные переменные закодировали.

Шаг 2. Выбор и обучение модели

Сравнивали три алгоритма на тестовой выборке (20 % данных):

Модель AUC‑ROC Precision Recall F1
Логистическая регрессия 0,75 0,62 0,78 0,69
Random Forest 0,84 0,71 0,85 0,77
XGBoost 0,87 0,76 0,88 0,82

Выбрали XGBoost — наивысший AUC и F1. Настроили гиперпараметры через кросс‑валидацию.

Шаг 3. Внедрение и проактивные коммуникации

Каждую неделю модель обновляла рейтинг риска для каждого клиента. Топ‑10 % по вероятности оттока получали персонализированные предложения:

  • скидка 5 % на следующий взнос;
  • бесплатный финансовый чек‑ап;
  • персональный менеджер на 30 дней.

Коммуникации запускали через email, SMS и звонок центра поддержки.

Шаг 4. Результаты за 6 месяцев

Сравнили два периода: до внедрения (базовый) и после.

Показатель До После Изменение
Churn rate, % 18,2 11,8 -35 %
Стоимость удержания, руб./клиент 2 400 1 850 -23 %
LTV клиента, руб. 48 500 62 300 +28 %

Вывод: Predictive Analytics сократила отток на 35 % и увеличила пожизненную ценность клиента (LTV) за счёт своевременных мер.

Уроки, которые мы извлекли

  1. Начинайте с простых моделей. Логистическая регрессия дала базовый уровень (AUC 0,75) и помогла понять, какие признаки работают.
  2. Проверяйте интерпретируемость. В XGBoost использовали SHAP‑значения, чтобы объяснить бизнесу: «Почему клиент попал в зону риска?»
  3. Обновляйте данные регулярно. Модель переобучали еженедельно — иначе точность падала из‑за смены поведения клиентов.
  4. Тестируйте коммуникации. A/B‑тесты показали, что скидка 5 % работает лучше бонуса 1 000 руб. — из‑за восприятия ценности.
  5. Учитывайте этику. Не использовали чувствительные признаки (например, диагноз в ИСЖ) — только поведенческие и транзакционные.

Главный урок: Predictive Analytics — не «чёрный ящик», а инструмент, который требует понимания бизнеса, данных и метрик.

Заключение

Прогнозирование оттока в страховании — это экономика профилактики. С помощью моделей ML (логистическая регрессия, Random Forest, XGBoost) можно снизить Churn на 30–40 % и увеличить LTV клиента.

Ключевые шаги:

  1. Определите цель. Чётко сформулируйте, что считаете оттоком (например, расторжение договора в течение 12 месяцев после активации) и какой уровень снижения Churn считаете успехом.
  2. Соберите данные. Агрегируйте транзакции, логи взаимодействий, обращения в поддержку и демографию. Убедитесь, что данные чисты и согласованы по времени.
  3. Выделите признаки риска. На основе анализа исторических данных определите, какие факторы коррелируют с оттоком. Начните с простых (частота входов, сумма платежа), затем добавьте сложные (тональность обращений, паттерны поведения).
  4. Выберите и обучите модель. Сравните несколько алгоритмов на тестовой выборке. Ориентируйтесь не только на AUC‑ROC, но и на Precision/Recall — в зависимости от бизнес‑приоритетов.
  5. Оцените качество. Используйте кросс‑валидацию и матрицу ошибок. Проверьте, как модель работает на свежих данных — это покажет её устойчивость.
  6. Внедрите проактивные меры. Для клиентов с высоким риском оттока разработайте персонализированные предложения (скидки, бонусы, персональный сервис). Тестируйте разные варианты через A/B‑тесты.
  7. Мониторинг и доработка. Регулярно обновляйте модель (например, раз в неделю), перепроверяйте метрики и корректируйте стратегию коммуникаций.

Важно понимать: Predictive Analytics — это не разовое решение, а цикл непрерывного улучшения. Модель со временем «стареет»: меняется поведение клиентов, появляются новые продукты, смещаются рыночные тренды. Поэтому регулярная актуализация данных и переобучение модели — обязательное условие её эффективности.

В перспективе развитие направления связано с:

  • интеграцией неструктурированных данных (текст обращений, аудио звонков) через NLP;
  • использованием онлайн‑обучения (online learning) для мгновенной реакции на изменения;
  • построением комплексных дашбордов, где прогноз оттока сочетается с прогнозом LTV и ROI маркетинговых активностей.

Для студентов и начинающих специалистов: освоение инструментов Predictive Analytics (Python, scikit‑learn, XGBoost) и понимание страховой специфики — мощный карьерный актив. Это навык, который переводит аналитика из исполнителя в стратега бизнеса.

Список источников

  1. Указание Банка России № 6460‑У от 08.04.2024 «О требованиях к отчётности страховщиков».
  2. Ассоциация страховщиков России. «Отчёт о качестве данных в страховой отрасли — 2023».
  3. Friedman J., Hastie T., Tibshirani R. The Elements of Statistical Learning. — Springer, 2009. (главы о логистической регрессии, деревьях решений, бустинге).
  4. Chen T., Guestrin C. XGBoost: A Scalable Tree Boosting System // Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. — 2016.
  5. Pedregosa F. et al. Scikit‑learn: Machine Learning in Python // Journal of Machine Learning Research. — 2011. — Vol. 12. — P. 2825–2830.
  6. A/B‑тестирование коммуникаций в ИСЖ. — Внутренний отчёт СК «АльфаСтрахование», 2024 г.
  7. ГОСТ Р ИСО/МЭК 33001‑2015 «Оценка процессов. Основные положения». — Для стандартизации процессов разработки и внедрения моделей.
  8. Федеральный закон от 27.07.2006 № 152‑ФЗ «О персональных данных». — Требования к обработке и защите данных клиентов.
  9. Документация библиотек: pandas, numpy, shap — для предобработки данных и интерпретации моделей.
  10. Материалы конференций InsureTech Connect, InsurTech Russia — 2023–2024 гг. (кейсы внедрения Predictive Analytics в страховании).
16:53