<?xml version="1.0" encoding="utf-8"?> 
<rss version="2.0">

<channel>

<title>Книга «Графики, которые убеждают всех», заметки с тегом: данные</title>
<link>http://visualthink.ru/book/tags/dannye/</link>
<description></description>
<generator>E2 (v3254; Aegea)</generator>

<item>
<title>Процесс анализа. Создание новых данных и новых групп</title>
<guid isPermaLink="false">15</guid>
<link>http://visualthink.ru/book/all/process-analiza-sozdanie-novyh-dannyh-i-novyh-grupp/</link>
<comments>http://visualthink.ru/book/all/process-analiza-sozdanie-novyh-dannyh-i-novyh-grupp/</comments>
<description>&lt;p&gt;Чаще всего, чтобы найти что-то действительно важное и значимое в датасете, вам придется создавать сводные таблицы или новые данные внутри набора.&lt;/p&gt;
&lt;p&gt;Уровень аггрегированности («обобщенности») данных может быть разным. Скажем, в таблице с зарплатами тренеров данные представлены в неаггрегированной форме, для каждого тренера — отдельная строка с уровнем годовой зарплаты в абсолютных числах. Как вы помните, инструмент Гугл Таблиц для анализа самостоятельно догадался провести аггрегацию по результату команд, и посчитал среднюю для команд, не вышедших из группы и прошедших до соответствующей стадии турнира на выбывание.&lt;/p&gt;
&lt;p&gt;Иногда же таблицы к вам поступают (например, от аналитиков) уже аггрегированными. Это удобно, так как вам не нужно проводить эту работу, но в зависимости от самих исходных данных, их аггрегация может приводить к существенному искажению понимания того, что на самом деле содержится в данных.&lt;/p&gt;
&lt;p&gt;Возьмем таблицу со статистикой посещаемости первого сезона программы «Вдудь»&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030500_table@2a.png" width="592" height="875" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Сначала проведем статистический анализ, а затем приступим к визуальному, в ходе которого будем создавать &lt;b&gt;поисковые визуализации данных&lt;/b&gt;. Для них оформление не имеет существенного значения, как для финальных графиков, которые готовятся к размещению в презентации или для публикации, так что мы просто оставим стандартные настройки нашей программы для визуального анализа (в данном случае работа проведена в Tableau).&lt;/p&gt;
&lt;p&gt;Прежде всего получим ключевые числа, описывающие датасет. Общее количество просмотров всех роликов: чуть более 124 млн, всего роликов за период — 34, среднее количество просмотров каждого ролика — 3,64 млн, минимальное (режиссер Хлебников) — 1,6 млн, максимальное (Слава КПСС) — 6,6 млн. Первый ролик вышел 7 февраля, последний — 18 октября 2017 года.&lt;/p&gt;
&lt;p&gt;#Создание новых данных внутри датасета&lt;br /&gt;
Первым делом посмотрим динамику просмотров по датам:&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030501_dud'linechart@2a.png" width="1630" height="795" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Очень удачная визуализация, которая дает представление о взлетах и падениях в популярности выпусков, позволяет увидеть наиболее и наименее популярные ролики. Для того, чтобы нагляднее увидеть распределение выпусков по датам и обнаружить значительный по времени перерыв, заменим в этой визуализации линейный график на столбиковую диаграмму.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030502_dud'barchart@2a.png" width="1621" height="798" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Становится интересно, в какие дни чаще всего выходили интервью, смотрим.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030503_dud'_weeks@2a.png" width="1593" height="813" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Выпусков в среду было меньше, чем во вторник, но медианное количество просмотров у них больше.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030504_dud'_weeks_med@2a.png" width="1606" height="818" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Чтобы понять почему, посмотрим, какие именно интервью пришлись на среду. Это БэдКомедиан, Гнойный, Фейс и Познер.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030505_dud'_weeks_med_days@2a.png" width="1616" height="876" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Однако, разумеется, вторничные просмотры принесли гораздо больше трафика, чем какие-либо другие.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030505_dud'_weeks_med_days@2a_1.png" width="1632" height="782" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Самое время более наглядно изучить, какие ролики самые популярные, а какие наоборот.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030506_dud'_top@2a.png" width="1589" height="945" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Сделаем сноску и укажем, что по-хорошему, конечно, надо было вводить поправки — на то, насколько долго ролик находится «в ротации» и на количество подписчиков в момент выхода программы (особенно это актуально для последних роликов, так ролик Познера добавлен ровно в день составления датасета и он, конечно, не совсем репрезентативен) — но для упрощения сейчас эти моменты опустим.&lt;/p&gt;
&lt;p&gt;Что еще может нас заинтересовать, это распределение роликов по месяцам и количеству просмотров.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;div class="fotorama" data-width="1610" data-ratio="1.7424242424242"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030507_dud'_hyst@2a.png" width="1610" height="924" alt="" /&gt;
&lt;img src="http://visualthink.ru/book/pictures/030508_dud'_month@2a.png" width="1598" height="937" alt="" /&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;Мы, разумеется, не охватили и половины того, что могли бы проанализировать. Однако, в процессе даже этого, беглого анализа, мы уже аггрегировали и создавали новые данные в наборе! Мы аггрегировали, когда считали распределение количества роликов по дням недели и месяцам, распределение по просмотрам. Мы создавали новые данные, когда считали процент просмотров, пришедшихся на разные дни недели.&lt;/p&gt;
&lt;p&gt;Новые данные в набор мы можем добавить и из других датасетов (скажем, даты рождения участников) или определить самостоятельно. Давайте, например, добавим новую колонку — в которой укажем основную область деятельности участников интервью.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030509_table_cat@2a.png" width="767" height="886" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Теперь мы можем не только посчитать, кого Дудь зовет чаще всего, но и узнать, персонажи из каких сфер людям интересны больше.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030510_cat_count@2a.png" width="1277" height="454" alt="" /&gt;
&lt;/div&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030511_cat_avg@2a.png" width="1312" height="430" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Или даже посмотреть, когда именно и как часто гости из разных областей приходили к Дудю и сколько людей посмотрело ролики с их участием.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030512_date_cat@2a.png" width="1797" height="942" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Как видите, чтобы находить в датасетах интересное, вам наверняка придется аггрегировать данные, и создавать новые данные (количественные и качественные).&lt;/p&gt;
&lt;p&gt;И вы можете, например, обнаружить следующее:&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/030513_date_cat@2a.png" width="1422" height="541" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;##&lt;/p&gt;
&lt;p&gt;Я планирую закончить эту книгу к июлю-августу 2019 года, публикуя по главе или ее части в 1-2 недели. Обо всех обновлениях в книге вы можете узнавать в моем канале, посвященном визуализации данных — &lt;a href="http://t.me/chartomojka"&gt; «Чартомойка»&lt;/a&gt; (если ссылка не открывается, попробуйте просто в поиске Телеграма набрать «Чартомойка»)&lt;/p&gt;
&lt;p&gt;##&lt;/p&gt;
&lt;p&gt;&lt;a href="http://visualthink.ru/book/all/grafiki-kotorye-ubezhdayut-vseh/"&gt;Оглавление&lt;/a&gt;&lt;/p&gt;
</description>
<pubDate>Sat, 20 Apr 2019 01:00:55 +0300</pubDate>
</item>

<item>
<title>Качество данных</title>
<guid isPermaLink="false">11</guid>
<link>http://visualthink.ru/book/all/kachestvo-dannyh/</link>
<comments>http://visualthink.ru/book/all/kachestvo-dannyh/</comments>
<description>&lt;p&gt;К данным, к тому как они собраны, как они организованы и подготовлены, предъявляются определенные требования. В конечном итоге, визуализация данных — это уже следующий за их подготовкой и анализом этапом. И если на подготовительном этапе возникли были ошибки, то их представление, как бы грамотно сделано не было, будет не многого стоить.&lt;/p&gt;
&lt;p&gt;Данные должны быть по возможности:&lt;br /&gt;
— максимально свежими&lt;br /&gt;
— целостными, полными, консистентными&lt;br /&gt;
— сравнимыми (собранными по одной методологии на сопоставимых выборках)&lt;br /&gt;
— из вызывающих доверие источников&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/0301_terror@2x.png" width="610" height="416.5" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Например, этот график, построенный на &lt;a href="https://www.start.umd.edu/gtd/"&gt;базе данных террористических актов&lt;/a&gt; Мэрилендского университета который показывает количество терактов, совершенных в мире с 1970 по 2014 год. На графике сразу видно, что датасет не полон — данных за 1993 год нет.&lt;/p&gt;
&lt;p&gt;Данные нужно готовить таким образом, чтобы в каждой колонке данные находились в одном формате (даты, значит только даты), все значения (и количественные и качественные) были в одном единообразном формате, т. е. если в колонке есть ошибки в написании слов Массква, Москва, г. Москва, все должно быть приведено к одному значению. Какие-то колонки при необходимости нужно разбить, какие-то, напротив, свести в одну.&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/0301_table_gks.png" width="1513" height="775" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Скажем, таблицы, представленные на сайте &lt;a href="http://gks.ru"&gt;Росстата &lt;/a&gt; непригодны для автоматизированной работы с ними. Они не консистентны, то есть строки могут содержать значения разного уровня вложенности: «итого», «в том числе», «из них от». Такую таблицу можно только изучать взглядом, но не проводить по ней анализ и строить графики. Ту же таблицу про причины смертности можно было бы переделать, например, так:&lt;/p&gt;
&lt;div class="e2-text-picture"&gt;
&lt;img src="http://visualthink.ru/book/pictures/0301_table_gks01.png" width="1448" height="725" alt="" /&gt;
&lt;/div&gt;
&lt;p&gt;Мы оставили только данные одного уровня вложенности, категории перенесли в отдельную колонку, для под категорий сделали еще одну.&lt;/p&gt;
&lt;p&gt;Подготовительная работа крайне важна. От нее зависит не только насколько удобно вам будет работать в аналитической программе или программе для визуализации данных, но и то, насколько корректными будут ваши выводы и графики в итоге.&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Иногда, подготовительная работа (поиск, сбор, подготовка, очистка данных) занимает до 80-90% от всего времени работы над проектом. И это нормально.&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;##&lt;/p&gt;
&lt;p&gt;Я планирую закончить эту книгу к июлю-августу 2019 года, публикуя по главе или ее части в 1-2 недели. Обо всех обновлениях в книге вы можете узнавать в моем канале, посвященном визуализации данных — &lt;a href="http://t.me/chartomojka"&gt; «Чартомойка»&lt;/a&gt; (если ссылка не открывается, попробуйте просто в поиске Телеграма набрать «Чартомойка»)&lt;/p&gt;
&lt;p&gt;##&lt;/p&gt;
&lt;p&gt;&lt;a href="http://visualthink.ru/book/all/grafiki-kotorye-ubezhdayut-vseh/"&gt;Оглавление&lt;/a&gt;&lt;/p&gt;
</description>
<pubDate>Fri, 29 Mar 2019 12:54:25 +0300</pubDate>
</item>


</channel>
</rss>