Читаем Аналитическая культура. От сбора данных до бизнес-результатов полностью

Специалистам-аналитикам нужны правильные данные, собранные правильным образом и в правильной форме, в правильном месте, в правильное время. (Они просят совсем не много.) Если какое-то из этих требований не выполнено или выполнено недостаточно хорошо, у аналитиков сужается круг вопросов, на которые они способны дать ответ, а также снижается качество выводов, которые они могут сделать на основании данных.

Эта и следующая главы посвящены обширной теме качества данных. Во-первых, мы обсудим, как обеспечить правильность процесса сбора данных. С этой точки зрения качество данных выражается в их точности, своевременности, взаимосвязанности и так далее. Затем, в следующей главе, мы поговорим о том, как убедиться, что мы собираем правильные данные. С этой точки зрения качество выражается в выборе оптимальных источников данных, чтобы обеспечить максимально эффективные выводы. Иными словами, мы начнем с того, как правильно собирать данные, и перейдем к тому, как собирать правильные данные.

В этой главе мы сосредоточимся на способах определения достоверности данных и рассмотрим случаи, когда данные могут оказаться ненадежными. Для начала разберем критерии качества – все характеристики чистых данных. Затем рассмотрим самые разные факторы, влияющие на ухудшение качества. Этой теме мы уделим особое внимание по ряду причин. Во-первых, подобных факторов может быть великое множество, и они носят практический, а не теоретический характер. Если вам доводилось работать с данными, то, скорее всего, вы сталкивались с большинством из них. Они неотъемлемая часть нашей реальности и возникают гораздо чаще, чем нам бы того хотелось. Именно поэтому у большинства специалистов по работе с данными подавляющая часть рабочего времени уходит на очистку. Более того, вероятность возникновения этих факторов повышается с увеличением объема данных. Мой бывший коллега Самер Масри однажды заметил: «При работе с большими масштабами данных всегда помните, что вещи, которые случаются “один раз на миллион”, могут произойти в каждую секунду!» Во-вторых (и, возможно, это даже важнее), активная проверка и сохранение качества данных – совместная обязанность всех сотрудников. Каждый участник аналитической цепочки ценности должен следить за качеством данных. Таким образом, каждому участнику будет полезно на более глубоком уровне разбираться в этом вопросе.

Итак, учитывая все сказанное, давайте рассмотрим, что означает качество данных.

Аспекты качества данных

Качество данных невозможно свести к одной цифре. Качество – это не 5 или 32. Причина в том, что это понятие охватывает целый ряд аспектов, или направлений. Соответственно, начинают выделять уровни качества, при которых одни аспекты оказываются более серьезными, чем другие. Важность этих аспектов зависит от контекста анализа, который должен быть выполнен с этими данными. Например, если в базе данных с адресами клиентов везде указаны коды штатов, но иногда пропущены почтовые индексы, то отсутствие данных по почтовым индексам может стать серьезной проблемой, если вы планировали построить анализ на основе показателя почтового индекса, но никак не повлияет на анализ, если вы решили проводить его на уровне показателя по штатам.


Итак, качество данных определяется несколькими аспектами. Данные должны отвечать ряду требований.


Доступность

У аналитика должен быть доступ к данным. Это предполагает не только разрешение на их получение, но также наличие соответствующих инструментов, обеспечивающих возможность их использовать и анализировать. Например, в файле дампа памяти SQL (Structured Query Language – языка структурированных запросов при работе с базой данных) содержится информация, которая может потребоваться аналитику, но не в той форме, в которой он сможет ее использовать. Для работы с этими данными они должны быть представлены в работающей базе данных или в инструментах бизнес-аналитики (подключенных к этой базе данных).


Точность

Данные должны отражать истинные значения или положение дел. Например, показания неправильно настроенного термометра, ошибка в дате рождения или устаревший адрес – это все примеры неточных данных.


Взаимосвязанность

Должна быть возможность точно связать одни данные с другими. Например, заказ клиента должен быть связан с информацией о нем самом, с товаром или товарами из заказа, с платежной информацией и информацией об адресе доставки. Этот набор данных обеспечивает полную картину заказа клиента. Взаимосвязь обеспечивается набором идентификационных кодов или ключей, связывающих воедино информацию из разных частей базы данных.


Полнота

Под неполными данными может подразумеваться как отсутствие части информации (например, в сведениях о клиенте не указано его имя), так и полное отсутствие единицы информации (например, в результате ошибки при сохранении в базу данных потерялась вся информация о клиенте).


Непротиворечивость

Перейти на страницу:

Похожие книги

Кодекс состоятельных. Живи, как 1% населения в мире
Кодекс состоятельных. Живи, как 1% населения в мире

Колумнист The New York Times Пол Салливан на протяжении целого десятилетия изучал привычки богатых людей и пытался сформулировать основополагающие принципы их успеха. Чем отличается мировоззрение супербогачей от философии жизни простых людей? Благодаря чему они являются теми, кто они есть? И возможно ли, следуя их правилам, проложить путь на вершину олимпа?Из книги вы узнаете:– Какие ценности являются лучшей инвестицией?– Как извлечь пользу из поражений?– Как тратить много, но не разоряться?Эта книга – квинтэссенция правил жизни успешных людей, после прочтения которых вы осознаете: не важно, в каком городе или семье вы родились, какое образование получили, все зависит только от вас, получите вы все что хотите или останетесь на задворках жизни.

Пол Салливан

Деловая литература / О бизнесе популярно / Финансы и бизнес
77 секретов копирайтинга. Тексты, которые продают
77 секретов копирайтинга. Тексты, которые продают

Эта книга неслучайно называется «77 секретов копирайтинга». В ней вы действительно найдете эффективные инструменты и полезные сведения, о которых прежде не слышали, даже если посещали тренинги или слушали вебинары по копирайтингу. Вы познакомитесь с «фишками», которые помогут вам стать еще успешнее и писать яркие, запоминающиеся, мощно заряженные мотивацией тексты. С этого момента, когда вы начали читать эту книгу, я сочувствую вашим конкурентам, особенно если они отдавали копирайтинг на аутсорсинг. Скажем так, те недалекие люди, которые считают себя выше изучения копирайтинга, не понимают, насколько это важный навык – умение самостоятельно писать продающие тексты. Это часть вашей жизни, и доверять ее другим – все равно что доверять другим свидание с женщиной или кормление ребенка грудью. Удобный формат позволит вам держать книгу всегда под рукой и применять авторские советы в работе.

Андрей Алексеевич Парабеллум , Андрей Парабеллум

Карьера, кадры / Маркетинг, PR, реклама / О бизнесе популярно / Финансы и бизнес