Skip to content

Repository files navigation

Анализ результатов A/B-тестирования и оптимизации выручки (Продуктовая аналитика на SQL & Python)

В этом репозитории содержится практический проект по продуктовой аналитике, посвященный оценке эффективности изменений в продукте на основе данных двух параллельных A/B-тестов. Целью работы было определить влияние новых механик на метрику ARPU и медианный доход пользователей, а также статистически обосновать целесообразность внедрения изменений для бизнеса.

Исходные данные:

  • 8. Анализ АБ тестов.ipynb, 18. АБ тест агрегированный.ipynb — анализ данных АБ тестов.
  • Вопросы 1-7,9-10.sql — SQL-скрипты для решения задач.
  • Тестовое задание.docx — файл с вопросами, на которые требовалось дать ответы.
  • Данные для тестового задания.xlsx, abtests.csv, audience.csv, listers.csv — исходные данные.
  • Вспомогательный (вопросы 9-10).ipynb — дополнительная проверка распределения данных.

Какие задачи были решены:

  1. Экстракция и сегментация данных (SQL): Сформированы запросы для фильтрации и выгрузки сырых данных из СУБД (PostgreSQL/MySQL). Реализована когортная группировка пользователей по номерам экспериментов и тестовым/контрольным группам (test / control).
  2. Исследовательский анализ данных (EDA) и расчет метрик: На Python выполнен расчет ключевых продуктовых и финансовых KPI (размеры выборок, средний ARPU, медиана выручки). Построены интерактивные гистограммы распределения доходов пользователей с помощью sns.histplot. Выявлена сильная правосторонняя скошенность данных и высокая концентрация пользователей в нулевой зоне (неплатящие пользователи).
  3. Проверка статистических гипотез:
    • Сформулированы нулевые ($H_0$) и альтернативные ($H_1$) гипотезы о равенстве средних доходов в группах.
    • Обоснован выбор t-теста Уэлча для сравнения средних на больших выборках ($>400$ наблюдений) на основе Центральной предельной теоремы (ЦПТ).
    • В ходе Эксперимента №1 получено значение $p\text{-value} = 0.69$. Так как оно значительно превысило критический уровень значимости $\alpha = 0.05$, статистические основания для отклонения нулевой гипотезы не были найдены.
  4. Формирование аналитических выводов и рекомендаций: На основе проведенных тестов подготовлено финальное заключение для продуктовой команды. Зафиксированные колебания ARPU признаны случайными, а изменения в продукте — не приносящими значимого экономического эффекта. Дана рекомендация отклонить внедрение новой механики из Эксперимента №1.

🛠️ Какие навыки и инструменты использовались:

  • Python-стек: pandas (обработка, фильтрация, агрегация данных), scipy.stats (проведение статистических тестов, расчет p-value), matplotlib и seaborn (визуализация плотности распределения доходов).
  • SQL: Написание эффективных запросов без избыточных объединений, использование функций фильтрации, сегментации и подготовки аналитических срезов.
  • Математическая статистика: Формулирование гипотез, проверка условий применимости параметрических тестов, работа с непрерывными сильно скошенными распределениями, использование Центральной предельной теоремы.

About

Final assignment focused on product metrics computation and statistical hypothesis testing. Features user retention and conversion analysis using complex SQL queries alongside parallel A/B test evaluation in Python (Scipy/Pandas) using Welch's t-test and Z-test to deliver data-driven recommendations for product management.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages