Перейти к основному содержанию

Основы Data Science и управления AI-продуктами Блок 1

Smart LMS

Модуль 1: Основы Data Science и управления AI-продуктами

Цель модуля:

Дать комплексное понимание работы с Data Science и AI-продуктами: от базовых принципов DS до управления командой и интеграции решений в бизнес-процессы. Модуль фокусируется на практических аспектах — как ставить задачи, оценивать риски и извлекать продуктовую ценность из данных, не углубляясь в технические детали алгоритмов.

Образовательные результаты модуля:

После прохождения модуля вы сможете:

  1. Применять Data Science в бизнесе:
  • Определять ключевые этапы жизненного цикла DS-проекта (от постановки задачи до внедрения).
  • Приводить примеры использования DS в 3+ индустриях (e-commerce, финансы, медицина) и описывать их продуктовую ценность.
  • Классифицировать типовые задачи DS (классификация, регрессия, NLP, CV) и подбирать их под бизнес-потребности.
Управлять особенностями AI-продуктов:
  • Объяснять ключевые отличия AI от классических продуктов
  • Распознавать специфические риски AI-проектов
Работать на стыке бизнеса и DS:
  • Формулировать ML-задачу на основе бизнес-целей.
  • Различать роли в DS-команде (Data Scientist, Data Engineer, MLOps) и их зоны ответственности
  • Планировать валидацию гипотез исследования.

1. Что такое Data Science?

Каждый день в мире генерируется около 2.5 квинтиллионов байт данных. Это фотографии в социальных сетях, покупки в интернет-магазинах, показания датчиков умных городов, медицинские записи, финансовые транзакции и многое другое. Но сами по себе данные — это просто цифры и символы. Ценность появляется тогда, когда мы умеем извлечь из них знания, предсказать будущие тренды или автоматизировать принятие решений. Именно этим и занимается Data Science — превращением «сырых» данных в ценные инсайты и практические решения.

 

Представьте: вы владелец интернет-магазина и каждый день тысячи клиентов оставляют цифровые следы — клики, просмотры, покупки. Как понять, кто из них готов купить дорогой товар, а кто просто изучает рынок? Именно здесь на помощь приходит Data Science.

Netflix использует алгоритмы рекомендаций для удержания 80% пользователей, которые находят контент через персонализированные предложения. Wildberries с помощью DS увеличил средний чек на 15%, показывая покупателям релевантные товары в нужный момент. Amazon генерирует 35% выручки благодаря рекомендательным системам. Это конкретные примеры того, как данные превращаются в продуктовую ценность и прибыль.

Что такое Data Science?

Data Science, или наука о данных, — это междисциплинарная область, которая использует научные методы, процессы, алгоритмы и системы для извлечения знаний и понимания из структурированных и неструктурированных данных.

Можно провести аналогию с работой врача: врач собирает симптомы, анализирует результаты анализов и ставит диагноз. Data Scientist работает похожим образом, но анализирует данные для решения бизнес-задач или научных вопросов. А продакт-менеджер в этой аналогии — это главврач, который определяет, какие «пациенты» (бизнес-задачи) наиболее критичны и какие «лечения» (DS-решения) принесут максимальную пользу продукту.

 

Но что требуется для эффективной работы с данными? Давайте разберем, на каких столпах строится эта область.

Ключевые компоненты Data Science

Data Science стоит на пересечении трех основных областей:

1. Математика и статистика

Это фундамент для понимания данных. Без знания основ статистики невозможно корректно интерпретировать результаты анализа или построить надежную модель. Сюда входят:

  • Описательная статистика
  • Проверка гипотез
  • Регрессионный анализ
  • Теория вероятностей
  • Линейная алгебра
  • Математический анализ

Если данные — это сырье, то математика и статистика — это инструменты, которые помогают это сырье обработать и понять.

2. Программирование и технологии

Современные объемы данных требуют автоматизации обработки. Наиболее популярные языки в Data Science:

  • Python — универсальный язык с богатой экосистемой библиотек
  • R — специализированный язык для статистического анализа
  • SQL — для работы с базами данных

3. Предметная экспертиза

Понимание бизнеса или научной области, в которой применяется анализ данных. Это самый критически важный компонент для продуктовых команд! Без глубокого понимания пользователей, их потребностей и бизнес-процессов легко построить технически корректную, но практически бесполезную модель.

Программирование позволяет автоматизировать анализ и работать с большими объемами данных. Никто же не будет считать корреляцию для миллиона записей вручную!

Здесь кроется ключ к успеху Data Science проектов: можно быть блестящим математиком и программистом, но без понимания того, зачем банк анализирует кредитные заявки или почему важно предсказать поломку оборудования на заводе, модель может оказаться бесполезной.

Роль продакт-менеджера в предметной экспертизе:

Именно продакт-менеджеры чаще всего становятся мостом между техническими специалистами и бизнесом. Вы понимаете пользовательские сценарии, знаете болевые точки продукта и можете перевести абстрактные возможности машинного обучения в конкретные продуктовые фичи. Data Scientist может построить модель с точностью 95%, но только продакт-менеджер знает, что для этой задачи достаточно 80%, зато модель должна работать в 10 раз быстрее.

Реальная история: Персонализация email-рассылок в fashion e-commerce

Постановка задачи (казалось правильной):

Бизнес-цель: Увеличить click-through rate email-кампаний с 2% до 4%
DS-решение: Построить модель, которая для каждого пользователя выберет оптимальный товар для показа в письме
Ожидаемый результат: +100% CTR, +25% revenue от email-маркетинга

Что сделала DS-команда:

  • Собрали данные: История покупок, клики, демография, сезонность
  • Построили модель: Collaborative filtering + content-based рекомендации
  • Достигли высокой точности: 92% accuracy в предсказании категории товаров, которые заинтересуют пользователя
  • Внедрили в продакшн: Автоматическая персонализация всех email-кампаний

Результат после 3 месяцев работы:

  • CTR: 2% → 2.1% (+5% вместо +100%)
  • Revenue от email: Без изменений
  • NPS: Снижение на 5 пунктов
  • Unsubscribe rate: +40%

В чем была ошибка? Разбор провала:

Проблема #1: Решали не ту задачу

  • Что думали: Пользователи не кликают, потому что товары нерелевантные
  • Что было на самом деле: Пользователи получали слишком много писем (5-7 в неделю)
  • Урок: Сначала изучите поведение пользователей, потом стройте модели

Проблема #2: Неправильная метрика успеха

  • Что измеряли: Accuracy модели (92%)
  • Что нужно было измерять: Business impact (revenue, LTV, satisfaction)
  • Урок: Техническая точность ≠ бизнес-результат

Проблема #3: Игнорировали пользовательский опыт

  • Что сделали: Показывали товары, которые пользователь «должен» купить
  • Что получилось: Пользователи чувствовали, что за ними «следят»
  • Урок: Персонализация должна ощущаться как сервис, не как слежка

Проблема #4: Не тестировали гипотезы поэтапно

  • Что сделали: Сразу запустили на всех пользователей
  • Что нужно было: A/B тест на 10% аудитории сначала
  • Урок: Всегда валидируйте DS-решения через эксперименты

Как нужно было действовать:

Этап 1: Проанализировать, почему пользователи не кликают 

Этап 2: Протестировать простые гипотезы (частота писем, время отправки) 

Этап 3: A/B тест персонализации на малой аудитории

Этап 4: Измерить влияние на retention и satisfaction 

Этап 5: Масштабировать при положительном результате

Ключевые вопросы, которые должен задать PM:

  1. «Точно ли DS решит нашу проблему?» → Попробуйте сначала простые решения
  2. «Как мы измерим успех?» → Focus на business metrics, не на technical metrics
  3. «Что может пойти не так?» → Рассмотрите риски для UX и brand
  4. «Как будем тестировать?» → План A/B тестирования до разработки
  5. «А что если не сработает?» → План отката и альтернативные решения

Области применения и ценность Data Science

Ключевые индустрии

Финансовые услуги:

  • Скоринг кредитных рисков
  • Обнаружение мошенничества в реальном времени
  • Алгоритмическая торговля
  • Персонализация финансовых продуктов

Кейс: Сбербанк — антифрод-система для карточных операций

Проблема: 

В 2019 году банк терял около 2 млрд тенге в год из-за мошеннических операций по картам. Традиционные правила (типа «блокировать транзакции >50,000 тенге. за границей») давали много ложных срабатываний и пропускали изощренное мошенничество.

 

Разработка решения:

  • DS-команда проанализировала 500+ факторов для каждой транзакции: геолокация, время, сумма, история покупок, паттерны поведения
  • Построили ensemble из gradient boosting моделей, которые обучались на исторических данных о подтвержденном мошенничестве
  • Система работает в реальном времени — принимает решение за 50 миллисекунд

Внедрение: 

Модель интегрирована в процессинг банка и анализирует каждую карточную операцию в режиме реального времени.

 

Результат:

  • Снижение мошеннических потерь на 60% (экономия ~1.2 млрд тенге/год)
  • Сокращение ложных блокировок на 40% (повышение клиентского опыта)
  • ROI проекта: 15x за первый год**

Здравоохранение:

  • Диагностика на основе медицинских изображений
  • Разработка персонализированных лечений
  • Прогнозирование эпидемий
  • Оптимизация клинических испытаний

Ритейл и e-commerce:

  • Рекомендательные системы
  • Динамическое ценообразование
  • Прогнозирование спроса
  • Оптимизация цепей поставок

Кейс: Ozon — динамическое ценообразование

Проблема:

Маркетплейс терял прибыль из-за неоптимального ценообразования. Цены устанавливались вручную или по простым правилам, не учитывая конкурентов, сезонность и эластичность спроса по каждому товару.

 

Разработка решения:

  • Анализ 200M+ транзакций и поведения 10M+ пользователей
  • Построение моделей эластичности спроса для разных товарных категорий
  • Учет внешних факторов: цены конкурентов, остатки на складе, сезонность
  • A/B тестирование ценовых стратегий на подвыборках товаров

Внедрение:

Система автоматически корректирует цены на 2M+ товаров ежедневно, учитывая множество факторов.

 

Результат:

  • Рост валовой прибыли на 12% при сохранении конверсии
  • Увеличение оборачиваемости медленно движущихся товаров на 25%
  • Время реакции на изменение цен конкурентов сократилось с недель до часов**

Телекоммуникации:

  • Прогнозирование оттока клиентов
  • Оптимизация сетевой инфраструктуры
  • Персонализация тарифных планов

Типы задач Data Science

Эволюция аналитики: от понимания прошлого к управлению будущим

blobid0.png

Эволюция аналитики: дескриптивная → диагностическая → предиктивная → прескриптивная аналитика

Что конкретно делают Data Scientist’ы с данными? Давайте классифицируем основные типы задач по уровню сложности и ценности для бизнеса.

 

Дескриптивная аналитика — что произошло?

  • Анализ исторических данных
  • Создание дашбордов и отчетов
  • Выявление трендов и паттернов

Это фундамент продуктовой аналитики. Классические примеры: дашборды с DAU/MAU, воронки конверсии, когортные анализы. Хотя это «базовый» уровень, качественная дескриптивная аналитика критически важна для понимания продукта.

 

Диагностическая аналитика — почему это произошло?

  • Корреляционный анализ
  • Анализ причинно-следственных связей
  • A/B тестирование

Здесь продакт-менеджеры проводят большую часть времени! Продажи упали на 20%? A/B тест показал негативный результат? Конверсия воронки снизилась? Диагностическая аналитика помогает найти root cause и принять обоснованные продуктовые решения.

 

Предиктивная аналитика — что произойдет?

  • Прогнозирование временных рядов
  • Классификация и регрессия
  • Кластерный анализ

Продвинутый уровень, который создает конкурентное преимущество: предсказание LTV клиентов для приоритизации маркетинговых бюджетов, прогноз спроса для планирования инвентаря, скоринг пользователей для персонализации.

 

Прескриптивная аналитика — что делать?

  • Оптимизационные модели
  • Симуляции и сценарный анализ
  • Автоматизированное принятие решений

Высший уровень product intelligence: система автоматически рекомендует оптимальные продуктовые решения. Какой контент показать пользователю? Какую цену установить? Как распределить нагрузку на сервера? Это превращает DS из аналитического инструмента в драйвер автоматизированных продуктовых решений.

Жизненный цикл Data Science проекта

Теперь, когда мы знаем, где Data Science полезен, разберем как это реализовать на практике. Для продакт-менеджера процесс выглядит следующим образом: сначала вы формулируете бизнес-задачу и критерии успеха, затем DS-команда переводит это в техническое решение, а в конце вы оцениваете результат через продуктовые метрики. Рассмотрим каждый этап подробнее.

blobid1.png

Применение методов CRISP-DM для анализа

Источник

Кейс: Как продакт-менеджер ставит задачу DS-команде

Задача:

Увеличить retention на 15% через прогнозирование и предотвращение оттока пользователей

Постановка задачи от PM:

Бизнес-контекст: «Наш продукт теряет 20% пользователей в первый месяц. Анализ показал, что основные причины оттока: низкая активность в первые 3 дня и отсутствие key action (например, первая покупка в e-commerce). Нужна система, которая выявит пользователей в риске и запустит retention-кампании.»

Критерии успеха:

  • Увеличить 30-дневный retention с 80% до 85%
  • Точность модели не менее 70% (из 100 «рискованных» пользователей минимум 70 действительно готовы уйти)
  • Система должна выявлять риск за 5 дней до предполагаемого оттока
  • ROI кампаний должен быть положительным

Ограничения:

  • Бюджет на retention-кампании: $50,000/месяц
  • Нельзя спамить пользователей (максимум 2 уведомления в неделю)
  • Соблюдение GDPR при обработке данных

Как DS-команда переводит это в техническую задачу:

  • Задача классификации: предсказать вероятность оттока пользователя
  • Target variable: пользователь ушел в течение 30 дней (1/0)
  • Features: активность, демография, источник привлечения, поведенческие паттерны
  • Threshold: вероятность >0.3 = «риск оттока»

Этап 1. Понимание бизнес-задачи (Business Understanding)

Что делает продакт-менеджер:

Это основополагающий этап, определяющий успех всего проекта. Здесь продакт-менеджер формулирует четкую задачу и критерии успеха.

Ключевые вопросы для PM:

Что мы хотим достичь?

  • Увеличить продажи на 15%?
  • Снизить отток клиентов?
  • Автоматизировать процесс принятия решений?
  • Найти новые рыночные возможности?

Как это связано с данными?

  • Какие данные могут помочь решить задачу?
  • Какие метрики будут показывать успех?
  • Какие ограничения есть у проекта?

Пример постановки задачи:

Плохо: «Нам нужен ИИ для увеличения продаж»
Хорошо: «Построить рекомендательную систему, которая увеличит средний чек с $85 до $95 (+12%) за счет cross-sell предложений в корзине. Success metric: конверсия рекомендаций >8%, влияние на общий AOV +10%.»

Критерии успеха SMART:

  • Specific (Конкретный): четко определенная цель
  • Measurable (Измеримый): количественные метрики
  • Achievable (Достижимый): реалистичные ожидания
  • Relevant (Релевантный): связан с бизнес-целями
  • Time-bound (Ограниченный по времени): четкие сроки

Этап 2. Понимание данных (Data Understanding)

Что происходит:

DS-команда исследует доступные данные и оценивает их пригодность для решения задачи.

Роль продакт-менеджера:

  • Помогает найти все источники данных (CRM, аналитика, логи, внешние данные)
  • Объясняет бизнес-логику полей и процессов
  • Валидирует качество данных с точки зрения бизнеса

Пример взаимодействия PM и DS:

DS: «В данных о возрасте клиентов есть значения 150+ лет и отрицательные числа» 

PM: «Это технический баг в форме регистрации. Пользователи могут вводить любые цифры. Для анализа корректными считаются возрасты 16-80 лет»

DS: «Почему конверсия в январе в 2 раза выше обычного?» 

PM: «В январе была крупная маркетинговая кампания + новогодние скидки. Это нормально, не выброс»

Этап 3. Подготовка данных (Data Preparation)

Что происходит:

Техническая работа по очистке и подготовке данных для моделирования.

Роль продакт-менеджера:

  • Валидирует бизнес-логику новых признаков
  • Помогает интерпретировать аномалии в данных
  • Обеспечивает доступ к дополнительным источникам данных при необходимости

Этап 4. Моделирование (Modeling)

Что происходит:

DS-команда выбирает и обучает алгоритмы машинного обучения.

Что нужно понимать продакт-менеджеру:

Выбор модели — задача Data Scientist. Вам важно понимать:

  1. Тип задачи:
  • Классификация: предсказание категории (купит/не купит, спам/не спам)
  • Регрессия: предсказание числового значения (цена дома, количество продаж)
  • Кластеризация: группировка похожих объектов (сегментация клиентов)
Как оценить успех? Например: «Точность 85% = 85 из 100 прогнозов верны → экономия ₽10 млн/год»

Этап 5. Оценка качества модели (Evaluation)

Что происходит:

Проверка соответствия модели бизнес-целям и техническим требованиям.

Ключевая роль продакт-менеджера:

Переводить технические метрики в бизнес-результаты.

Как менеджер оценивает прогресс проекта через бизнес-метрики:

Пример интерпретации для бизнеса:

Модель предсказания оттока клиентов:

  • Точность 85% → «Из 100 клиентов правильно классифицируем 85»
  • Precision 70% → «Из тех, кого назвали ’уйдет’, действительно уйдет 70%»
  • Recall 60% → «Из всех ушедших клиентов мы выявили 60%»

Бизнес-интерпретация:

«Модель консервативна — может пропустить некоторых уходящих клиентов, но те, кого она выявляет, действительно в группе риска. Это значит меньше потраченных денег на retention-кампании для ’ложных тревог’.»

ROI расчет:

«При текущей точности модель поможет сохранить 300 клиентов в месяц (LTV=$200) = экономия $60,000/месяц при затратах на retention $30,000/месяц. ROI = 100%.»

Этап 6. Внедрение (Deployment)

Что происходит:

Интеграция модели в продукт и мониторинг результатов в реальных условиях.

Ключевая роль продакт-менеджера:

  • Планирует поэтапное внедрение (A/B тесты, gradual rollout)
  • Определяет критерии успеха внедрения
  • Координирует работу с инженерной командой
  • Мониторит влияние на продуктовые метрики

A/B тестирование и поэтапное внедрение:

Этап 1: Proof of Concept (10% пользователей, 2 недели)

  • Тестируем базовую работоспособность
  • Мониторим технические метрики (latency, uptime)
  • Проверяем отсутствие негативного влияния на UX

Этап 2: Валидация эффективности (25% пользователей, 1 месяц)

  • A/B тест: контрольная группа vs группа с моделью
  • Измеряем основные продуктовые метрики
  • Анализируем поведение разных сегментов пользователей

Этап 3: Масштабирование (100% пользователей)

  • Постепенное увеличение нагрузки
  • Мониторинг стабильности системы
  • Итеративные улучшения на основе обратной связи

Пример плана внедрения рекомендательной системы:

Неделя 1-2: 10% пользователей, базовые рекомендации
Метрики: CTR рекомендаций, влияние на время сессии

 

Неделя 3-6: 25% пользователей, A/B тест
Метрики: конверсия в покупку, средний чек, retention

 

Неделя 7+: 100% пользователей при положительных результатах
Цель: +12% среднего чека, +15% engagement

Как менеджер оценивает прогресс DS-проекта?

Через бизнес-метрики, а не технические:

Неправильно (focus на технических метриках):

  • «Accuracy модели выросла с 82% до 87%»
  • «Уменьшили RMSE на 15%»
  • «F1-score достиг 0.85»

Правильно (focus на бизнес-результатах):

  • «Retention вырос с 75% до 82% = дополнительно 1,400 активных пользователей/месяц»
  • «Средний чек увеличился на $8 = +$240,000 дополнительной выручки/месяц»
  • «Сократили customer acquisition cost на 25% благодаря лучшему таргетингу»

Ключевые вопросы для мониторинга прогресса:

  1. Решаем ли мы правильную проблему? (связь с OKR/KPI компании)
  2. Достигаем ли целевых метрик? (progress к success criteria)
  3. Какой ROI от проекта? (инвестиции vs прогнозируемая выгода)
  4. Есть ли риски? (технические, регуляторные, репутационные)
  5. Что делаем дальше? (масштабирование, новые фичи, следующие проекты)

Практический dashboard для PM:

Бизнес-цель: Увеличить retention на 15%
Текущий прогресс: +8% (halfway to goal)
ROI проекта: 160% за 6 месяцев
Риски: Seasonal effect не учтен в модели
Следующий шаг: A/B тест персонализированных уведомлений

Роли в Data Science команде

Современные DS-проекты — это командная работа, где каждый специалист вносит свой вклад. Для продакт-менеджера важно понимать, с кем взаимодействовать на каждом этапе проекта и какие вопросы задавать каждой роли. Рассмотрим ключевые роли через призму управления продуктом.

blobid2.png

Ключевые роли и взаимодействие с Product Manager

Матрица ответственности DS-команды

Кто за что отвечает на каждом этапе проекта:

Этап проекта

PM

Data Analyst

Data Scientist

Data Engineer

ML Engineer

Постановка задачи

Лидирует

Консультирует

Консультирует

-

-

Анализ данных

Контролирует

Лидирует

Участвует

Предоставляет доступ

-

Построение модели

Ревьюит

Консультирует

Лидирует

Подготавливает данные

-

Внедрение

Координирует

Настраивает метрики

Консультирует

Участвует

Лидирует

Мониторинг

Контролирует бизнес-метрики

Отслеживает дашборды

Анализирует качество

Следит за инфраструктурой

Поддерживает работу

Data Scientist

Что делает:

Переводит ваши бизнес-задачи в модели машинного обучения. Исследует данные, строит прогнозы, интерпретирует результаты для принятия решений.

Ключевые вопросы от PM к Data Scientist:

  • «Решаема ли наша задача с имеющимися данными?» — Нужно понимать ограничения до начала проекта
  • «Какая точность модели достижима и достаточна?» — Связать технические возможности с бизнес-требованиями
  • «Как интерпретировать результаты для бизнеса?» — Перевод прогнозов в actionable insights
  • «Что больше всего влияет на прогнозы модели?» — Понимание драйверов для продуктовых гипотез

Пример взаимодействия:

PM: «Нужно снизить отток на 15%. Что можем сделать?»
DS: «Проанализировал данные — основные факторы оттока: низкая активность в первые 3 дня + отсутствие key action. Модель может предсказать отток с точностью 78%, что даст нам время на intervention.»

Data Engineer

Что делает:

Создает «трубопроводы» для данных. Обеспечивает, чтобы нужные данные были доступны, чистые и обновлялись автоматически.

Ключевые вопросы от PM к Data Engineer:

  • «Когда данные будут готовы для анализа?» — Планирование timeline проекта
  • «Насколько качественные у нас данные?» — Оценка реалистичности целей проекта
  • «Можем ли получить данные о X?» — Feasibility новых фич и экспериментов
  • «Как часто обновляются данные?» — Планирование частоты переобучения моделей

Почему критически важен для PM:

Без качественной инфраструктуры данных Data Scientist тратит 80% времени на подготовку данных вместо анализа и моделирования.

Пример взаимодействия:

PM: «Нужны данные по поведению пользователей за последний год для модели оттока»
DE: «Данные клик-стрима доступны с марта, но качество до июня сомнительное. Рекомендую использовать период июнь-декабрь для обучения. Подготовлю к пятнице.»

ML Engineer

Что делает:

Превращает модели Data Scientist’а в работающие сервисы. Внедряет решения в продакшн и обеспечивает их стабильную работу при тысячах запросов.

Ключевые вопросы от PM к ML Engineer:

  • «Когда сможем запустить A/B тест?» — Планирование экспериментов и запуска фич
  • «Как быстро работает модель?» — Impact на пользовательский опыт
  • «Что будет при высокой нагрузке?» — Готовность к масштабированию
  • «Как часто нужно переобучать модель?» — Планирование поддержки решения

Пример взаимодействия:

PM: «Модель готова, когда запустим на пользователях?»
MLE: «Нужно 2 недели на оптимизацию — сейчас модель отвечает 500мс, а для UX нужно <100мс. Потом A/B тест на 10% пользователей.»

Data Analyst

Что делает:

Создает отчеты и дашборды. Исследует продуктовые метрики, объясняет изменения в данных и находит возможности для роста.

Ключевые вопросы от PM к Data Analyst:

  • «Что происходит с нашими метриками?» — Мониторинг health продукта
  • «Почему конверсия упала на 5%?» — Root cause analysis проблем
  • «Какие сегменты пользователей растут?» — Поиск возможностей для развития
  • «Где наша biggest opportunity?» — Приоритизация roadmap

Отличие от Data Scientist для PM:

Data Analyst отвечает на вопрос «что происходит и почему», Data Scientist — «что произойдет и что делать».

Пример взаимодействия:

PM: «Retention новых пользователей упал с 85% до 78%. В чем проблема?»
DA: «Проанализировал по когортам — проблема в пользователях из источника X. У них на 40% меньше активности в первые 3 дня. Рекомендую пересмотреть onboarding для этого канала.»

Как эффективно управлять DS-командой

Принципы эффективного взаимодействия:

1. Говорите на языке результатов, не процессов

  • Плохо: «Как идет обучение модели?»
  • Хорошо: «На сколько % мы улучшили retention по сравнению с baseline?»

2. Задавайте вопросы на стыке техники и бизнеса

  • Плохо: «Какой алгоритм вы используете?»
  • Хорошо: «При каких условиях модель работает лучше/хуже? Как это влияет на разные сегменты пользователей?»

3. Фокусируйтесь на ограничениях и рисках

  • Плохо: «Модель работает отлично!»
  • Хорошо: «В каких случаях модель может ошибаться? Какие риски для продукта?»

4. Планируйте итерации, а не «идеальные» решения

  • Плохо: «Давайте сделаем самую точную модель»
  • Хорошо: «Запустим MVP за 2 недели, потом будем улучшать по результатам A/B теста»

Размеры команд и совмещение ролей

В зависимости от стадии компании:

Стартап (1-2 человека):

  • 1 универсал: Data Scientist + Data Analyst
  • Иногда + Data Engineer (если много данных)
  • PM спрашивает: «Можешь ли сделать X за Y недель?»

Растущая компания (3-5 человек):

  • Data Scientist, Data Engineer, Data Analyst
  • Начинают появляться специализации
  • PM координирует: приоритеты, ресурсы, timeline

Зрелая компания (10+ человек):

  • Четкое разделение ролей + ML Engineer, MLOps, Research Scientist
  • Product Manager становится «дирижером оркестра»
  • PM стратегически планирует: roadmap, ROI, scaling

Как избежать самых частых ошибок в DS-проектах

ТОП-5 ошибок продакт-менеджеров в DS-проектах:

Ошибка #1: «Решение в поисках проблемы»

  • Что происходит: «У нас есть данные о клиентах, давайте применим машинное обучение»
  • Почему опасно: Трата ресурсов на технически интересные, но бесполезные проекты
  • Как избежать: Начинайте с бизнес-проблемы, не с доступных данных

Ошибка #2: Нереалистичные ожидания от точности

  • Что происходит: «Модель должна угадывать на 95%+»
  • Почему опасно: Большинство бизнес-задач решается с точностью 70-80%
  • Как избежать: Изучите benchmarks в вашей индустрии

Ошибка #3: Игнорирование пользовательского опыта

  • Что происходит: Модель работает, но UX стал хуже (медленно, непонятно)
  • Почему опасно: Техническое решение убивает продуктовые метрики
  • Как избежать: Включайте UX-требования в техзадание с самого начала

Ошибка #4: «Запустим сразу на всех»

  • Что происходит: Пропускаем A/B тестирование и внедряем на 100% пользователей
  • Почему опасно: Высокий риск негативного влияния на метрики
  • Как избежать: Всегда планируйте поэтапное внедрение через эксперименты

Ошибка #5: Фокус на технических метриках вместо бизнесовых

  • Что происходит: «Наша модель стала точнее на 3%!»
  • Почему опасно: Не понятно, как это влияет на бизнес
  • Как избежать: Каждую техническую метрику переводите в бизнес-результат

Красные флаги в DS-проекте:

Когда стоит насторожиться:

  • DS-команда не может объяснить результаты простыми словами
  • Проект длится >6 месяцев без промежуточных результатов
  • Нет четкого плана A/B тестирования
  • Точность модели >95% (часто признак переобучения)
  • DS не знают, какие бизнес-метрики должны улучшиться
  • Нет fallback-плана, если модель не работает

Резюме урока: что мы изучили

Сегодня мы научились:

  1. Понимать суть Data Science — это междисциплинарная область на пересечении математики, программирования и предметной экспертизы, которая превращает данные в бизнес-решения
  2. Структурировать DS-проекты по методологии CRISP-DM — от постановки бизнес-задачи до внедрения и мониторинга, где каждый этап имеет четкие цели и критерии успеха
  3. Различать роли в DS-команде — Data Scientist строит модели, Data Engineer готовит данные, ML Engineer внедряет в продакшн, Data Analyst анализирует результаты, а продакт-менеджер координирует и переводит техническое в бизнесовое
  4. Оценивать бизнес-ценность DS-решений — на примере кейсов Сбербанка (антифрод) и Ozon (динамическое ценообразование) увидели, как правильно поставленные задачи дают конкретный ROI
  5. Избегать типичных ошибок — не искать решения в поисках проблемы, ставить реалистичные ожидания по точности, всегда тестировать через A/B эксперименты и фокусироваться на бизнес-метриках
  6. Правильно ставить задачи DS-команде — формулировать SMART-цели, определять критерии успеха и планировать поэтапное внедрение

Главный вывод: Data Science — это не магия, а структурированный подход к решению бизнес-задач через данные. Успех проекта на 80% зависит от правильной постановки задачи и только на 20% — от выбора алгоритма.

 

Следующий урок: Рассмотрим разнообразные кейсы применения AI.

Вопросы для самопроверки

  1. Чем Data Science отличается от Business Intelligence?
  2. Почему этап подготовки данных занимает так много времени?
  3. Какая роль в DS команде отвечает за внедрение моделей в продакшн?
  4. Почему важно разделять данные на обучающую, валидационную и тестовую выборки?
  5. Как бы вы объяснили бизнесу, что такое точность модели?

Практический кейс: Снижение оттока пользователей в FinTech-приложении

Ситуация: Вы — продакт-менеджер мобильного банка. За последний квартал отток клиентов вырос на 20%. Команда CEO поручила вам использовать Data Science для решения проблемы.

 

Задание 1: Сформулируйте SMART-цель для DS-команды

Ваша задача: Переформулируйте общую задачу «снизить отток» в конкретную SMART-цель.

 

Подсказки для формулировки:

  • Specific (Конкретный): Что именно нужно снизить? На сколько?
  • Measurable (Измеримый): Какие метрики будете отслеживать?
  • Achievable (Достижимый): Реалистичен ли целевой показатель?
  • Relevant (Релевантный): Как это связано с бизнес-целями банка?
  • Time-bound (Ограниченный по времени): Когда должен быть результат?

Пример хорошей SMART-цели: «Построить систему предсказания оттока, которая снизит 90-дневный churn rate с 15% до 12% (-20%) к концу квартала, выявляя пользователей в риске за 14 дней до предполагаемого ухода с точностью не менее 70%»

Задание 2: Какие 3 типа данных нужны DS-команде?

Ваша задача: Определите, какие данные помогут предсказать отток пользователей.

 

Категории данных для рассмотрения:

  • Поведенческие данные (активность в приложении)
  • Транзакционные данные (переводы, платежи, остатки)
  • Демографические данные (возраст, регион, профессия)
  • Данные взаимодействий (обращения в поддержку, рейтинги)
  • Внешние данные (экономические показатели, конкуренты)

Для каждого типа данных опишите:

  1. Что конкретно включает
  2. Как поможет предсказать отток
  3. Где эти данные взять

Пример:

Поведенческие данные: частота входов в приложение, время сессий, использование функций 

Как помогает: снижение активности часто предшествует оттоку 

Источник: логи мобильного приложения, аналитическая система

Задание 3: Распределите задачи между ролями

Задачи для распределения:

  • Настройка ETL-пайплайна из CRM
  • Построение прогнозной модели оттока
  • Деплой модели в мобильное приложение
  • Приоритизация гипотез по удержанию

Роли в команде:

  • Data Engineer — готовит данные и инфраструктуру
  • Data Scientist — создает модели и анализирует данные
  • ML Engineer — внедряет модели в продакшн
  • Product Manager — ставит задачи и планирует внедрение

Ваша задача:

  1. Назначьте основного ответственного для каждой задачи
  2. Укажите, кто еще должен участвовать в выполнении
  3. Определите последовательность выполнения задач

Подсказка: Некоторые задачи можно выполнять параллельно, некоторые зависят друг от друга.

Записаться

Полезная информация

Начало обучения: 25 августа 2026 года

Записаться