Posts

Showing posts with the label IV

Продуктовая аналитика: влияние продуктовых фич на ретеншн

Image
Предыдущих три поста были в сущности о том, как можно было бы разделить наши продуктовые фичи на несколько групп: core , power и casual . И делали мы это разными способами: (1) сравнивали популярность фичей с их ежедневной повторяемостью (2) сравнивали дневную интенсивность фичей с их ежедневной повторяемостью (3) применили кластеризацию к интенсивности. Давайте остановимся на минутку и спросим себя - а зачем нам вообще разделять продуктовые фичи? На самом деле, мы не случайно делили их по популярности и особенно по интенсивности. Мы хотели понять, какие фичи создают привычку повторного использования. С одной стороны, если мы посмотрим на популярность фичи (например, % MAU) мы легко можем разбить этот показатель на "новых" и "вернувшихся". Если доля вернувшихся будет условно большая и не будет падать со временем, значит можно сделать вывод, что клиенты регулярно возвращаются за этой фичей. С другой стороны, дневная интенсивность и особенно ежедневная повторяемос...

Как построить профили клиента?

Image
Итак, сегодня мы разберем две простые техники, объединив которые вы можете создавать профайлы клиентов. Обычно, когда вы работаете с клиентами, вы сохраняете в Базу Данных их характеристики. Для примера я взял датасет, в котором по каждому клиенту есть такие характеристики: Age Income Subscribe С характеристиками Age и Income все понятно. Это возраст и сумма дохода. Есть также третья, целевая характеристика - Subscribe - есть ли у клиента платная подписка. Так вот, будучи маркетологами, наша с вами задача состоит в том, что понять какие профайлы клиентов в клиентской базе у нас есть. Для этого мы воспользуемся двумя простыми подходами: Information Value (IV) Logistic Regression (glm) Первый подход (IV) позволит проанализировать отдельно каждую из характеристик и выделить группы в которых доля платных подписок будет преобладать над долей тех, кто не подписался.  Второй подход (glm) позволит изучить датасет и спрогнозировать вероятность платной подписки. Так вот, объединив об...

A-ha моменты в продукте: системный подход к поиску

Image
Два года назад, пройдя курс по retention на Reforge , я решил написать пост , где показал как можно расчитать a-ha момент используя Venn-диаграммы. Хотя сам способ Venn-диаграмм простой и понятный, мне он не сильно нравился из-за своей громоздкости: нужны были данные на уровне отдельного клиента нужны были данные по тем, кто Не сделал целевое действие, но был удержан Справедливости ради стоит отметить, что у аналитика, как правило, всегда есть доступ к сырым данным и п.2 не вызывает особых проблем. В прошлом посте я рассказывал про IV / WOE как способ первичного знакомства с данными и сигналами в них. Этот способ позволяет не только быстро отранжировать сигналы (отобрать самые сильные), но также позволяет узнать как именно каждый сигнал влияет на результат. Сегодня я бегло покажу как можно было бы использовать IV / WOE для поиска и расчета a-ha моментов в продукте.  В блоге Mode Analytics я нашел статью с синтетическим примером данных для расчетов a-ha моментов. Это как...

IV/WOE - хороший способ понять какой информацией вы обладаете

Image
На мой взгляд, маркетологи чаще других решают задачи бинарной классификации : купит/не купит клиент, вернется на сайт или нет, высокодоходный ли это клиент и т.д.  Заранее никто из нас не знает какие сигналы из тех, что оставляет нам клиент, помогут нам предсказать к какой группе он относится. А потому маркетологи часто либо (1) сами собирают разные сигналы из систем аналитики (визиты, просмотры страниц, время на сайте и т.д.) либо (2) идут к разработчикам и просят их выгрузить информацию из баз данных о том, что известно о клиентах в продуктивных системах (дата регистрации, дата первой покупки и т.д.). Сигналов (фичей) становится достаточно много и понять, что из этого важно, а что шум - не так уж и просто. Хочется верить, что наш опыт и интуиция сработают, но есть ли какие-то альтернативы понадежнее? В целом, существует два подхода к прогнозированию.  Первый подход заключается в том, что современные вычислительные возможности компьютеров таковы, что можно не разбираться в т...