Почему большие данные — это непросто
Алёна Игнатьева, редактор-фрилансер, специально для блога Нетологии написала колонку о том, почему большие данные — все еще загадка для бизнеса.
У начинающих аналитиков и ученых, работающих с большими данными, часто возникает вопрос: «У меня есть набор данных. Как его расшифровать?». Если нужно решить конкретную и хорошо поставленную задачу, то, как правило, это не вызывает трудностей. Но что если конкретной задачи не стоит, и ваша цель — изучить данные и найти что-то интересное?
Что такое большие данные
Большие данные — термин, который описывает большие объемы информации, структурированной и неструктурированной.
Большие данные в бизнесе могут использоваться для анализа, разработки стратегий и принятия правильных решений.
Объем данных, которые созданы и хранятся на мировом уровне, продолжает расти с каждым днем. Ежедневно создается 2,5 эксабайта (1 эксабайт = миллиард гигабайт): таким образом, 90% всех данных создано в последние 2 года. Используя их, компании смогут значительно ускорить развитие. Проблема в том, что лишь малая часть этих данных подвергается анализу.
Не так важно количество данных, как то, как вы их используете.
Можно получать данные из любого источника и анализировать их, чтобы найти ответы, которые позволят сократить затраты или разработать новые продукты и приложения, понять своих покупателей.
О чем могут рассказать большие данные
Так как же найти в данных именно то, что поможет принять верное решение? Это сложный вопрос, и на него, к сожалению, нет однозначного ответа. Ученые решают эту проблему с помощью такого метода:
- создать прогноз работы системы на основании уже имеющихся знаний (теории);
- изучить данные и проверить, соответствуют ли они прогнозу;
- если нет, то глубже изучить предмет и найти новую теорию;
- сделать новый прогноз на основе этой теории;
- повторить цикл.
Аналитики и специалисты по работе с большими данными могут действовать иначе.
- До того как изучать данные, составьте список того, что ты ожидаете обнаружить: распределение переменных, отношения между ними и т. д.
- Затем проанализируйте данные. Нарисуйте графики, схемы — всё, что необходимо, чтобы проверить, насколько данные соответствуют ожиданиям.
- Проверьте, есть ли что-то, что кажется странным или бессмысленным.
- Сфокусируйтесь на этом моменте и попробуйте понять, что именно вызывает такое расхождение с прогнозом. Этот шаг является ключевым. Благодаря ему вы получите действительно ценные находки.
Например, у вас есть данные о покупках в магазине. Известно, сколько людей совершило покупки, и сколько денег каждый из них потратил. Мы предполагаем какую-то среднюю величину чека, около которой колеблется большинство значений. Также будут значения, которые сильно отклоняются в большую или меньшую степень. В таком случае график этого распределения выглядит примерно так:
.png)
Но когда мы проанализировали данные, то увидели следующую картину:
.png)
Откуда же взялся этот непонятный пик справа?
Предположим, что это крупный магазин детских игрушек в Москве, где типичные покупатели — мамы с детьми, и данные о покупках были предоставлены за один месяц — ноябрь. Таким образом наш подозрительный пик может иллюстрировать, что именно перед новым годом в этот магазин приехали владельцы магазинов поменьше из регионов, чтобы потом перепродать эти игрушки в своих магазинах. Это означает, что данные покупатели не имеют отношения к постоянным клиентам магазина, и в другие месяцы такого скачка может не наблюдаться.
Можно анализировать эти данные и увидеть, какие конкретно игрушки пользовались наибольшим спросом, какие акции можно провести, чтобы привлечь больше таких клиентов. Это всё можно выяснить, основываясь на простом графике.
С какими проблемами сталкивается бизнес при работе с большими данными
В интернете можно найти множество историй успеха, когда компании с помощью больших данных увеличили прибыль или решили различные проблемы. Вдохновленные этими историями, компании выделяют огромные бюджеты и нанимают специалистов по работе с большими данными. Однако, использование больших данных не всегда может привести к успеху. Рассмотрим, какие проблемы могут встретиться при начале работы с большими данными.
1. Отсутствие бизнес-кейса
Согласно статье, опубликованной на IBM Big Data & Analytics Hub, понимание больших данных сильно затрудняется при отсутствии четко сформулированного бизнес-кейса. Правильно построенный бизнес-кейс показывает, какие проблемы необходимо решить и какие инструменты и параметры должны быть задействованы.
2. Неподготовленные данные
Компании, проигнорировавшие шаг подготовки данных перед началом работы, могут получить искаженные результаты, которые приведут к неправильным решениям.
3. Применение больших данных не по назначению
Например, попытка собрать как можно больше данных для своих исследований не всегда оправдана, так как большие объемы данных могут служить источником возникновения ложных связей.
4. Недостаточные аналитические и технические навыки
Согласно исследованию, примерно половина опрошенных говорят о недостатке аналитических или технических знаний для работы с большими данными. И хотя на рынке сейчас довольно много специалистов по большим данным, всё равно спрос превышает предложение. И в данном случае лучше сфокусироваться на обучении уже существующего персонала, чем открывать новые вакансии.
5. Надежда только на большие данные
Некоторые руководители, увидев первые результаты работы больших данных, начинают обдумывать, как сократить штат и заменить сотрудников на роботов. Но здесь не все так прозрачно.
С помощью больших данных можно обнаружить проблему и найти пути её решения, но именно люди будут решать эту проблему и настраивать работу компании. Важно правильно разделять задачи: машина анализирует, а человек прогнозирует.
Показательный пример Google
Умение задавать правильные вопросы — неотъемлемый навык при работы с большими данными. В 2008 году Google запустил проект Google Flu Trends (GFT), целью которого было предсказание вспышки эпидемии гриппа до того, как об этом объявит Центр по контролю и профилактике заболеваний США (CDC).
Специалисты Google обратили внимание на то, что примерно за две недели до вспышки эпидемии гриппа происходит всплеск поисковых запросов, связанных со здоровьем. Именно это предположение и было положено в основы анализа. Однако позже, при сравнении данных с CDC было обнаружено, что GFT пропустил эпидемию «свиного гриппа» в 2009 году и почти на 50% преувеличил размах эпидемий в 2012 и 2013 годах.
В 2013 году проект Google Flu Trends был приостановлен, так как он не справлялся со своей основной задачей. Некоторые считают, что выборка данных была некорректна, кто-то говорит, что заданный вопрос: «Когда произойдет следующая эпидемия гриппа?» — был некорректен с учетом сбора нетрадиционных данных.
Большие данные не являются заменой традиционных методов, скорее их нужно использовать как вспомогательный инструмент.
В отличие от традиционных данных, большие данные не могут дать точный ответ на традиционно поставленный вопрос. Вместо этого они определяют те сферы, которые требуют более детального изучения для обнаружения проблемы.
Если бы Google Flu Trends отвечал на вопрос: «О чем говорят нам частота и количество поисковых вопросов?» — поле для анализа возможной проблемы было значительно шире.
Заключение
Перед тем как начать работать с большими данными, нужно определиться с целями, которые нужно достичь и в зависимости от этого определиться, какую именно информацию и в каком количестве нужно собрать. Чем глубже вы знаете область, из которой получены данные, тем точнее будет ваш прогноз и тем интереснее будут факты, которые вы найдете.
Недостаточно просто уметь работать с данными, нужно понимать, откуда эти данные происходят. Чем больше вы понимаете в работе бизнеса, тем весомее будет ваш вклад, и тем сильнее вы сможете повлиять на качество работы всей компании.
Мнение автора и редакции может не совпадать. Хотите написать колонку для «Нетологии»? Читайте наши условия публикации.
ОСНОВНЫЕ ПРОБЛЕМЫ ИСПОЛЬЗОВАНИЯ БОЛЬШИХ ДАННЫХ В СОВРЕМЕННЫХ ИНФОРМАЦИОННЫХ СИСТЕМАХ Текст научной статьи по специальности «Компьютерные и информационные науки»
Аннотация научной статьи по компьютерным и информационным наукам, автор научной работы — Менщиков Александр Алексеевич, Перфильев Владислав Эдуардович, Федосенко Максим Юрьевич, Фабзиев Ильшат Равильевич
В статье рассматривается проблематика использования больших данных в современных информационных системах. Представлены хронологические этапы становления термина Big Data, начиная с первого его упоминания главным редактором журнала Nature Клиффордом Линчем в выпуске «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?» и заканчивая становлением учебного и научного направления data science. Указаны крупные корпорации, внедряющие в свои производственные процессы большие данные (IBM, Oracle, Microsoft, Hewlett-Packard, EMC). Классификация больших данных рассмотрена согласно теории “VVV”, включающей в себя объём (volume), скорость (velocity), многообразие (variety) обрабатываемых данных, “4V”, включающей в себя помимо прочего достоверность (veracity), “5V”, включающей в себя помимо прочего жизнеспособность (viability), «7V», рассматривающая также переменчивость (variability) и визуализацию (vizualization). Сами массивы данных, в зависимости от формы их хранения и представления, характеризуются как структурированные, слабоструктурированные, неструктурированные. Отсюда, проблематика Big Data рассматривается исходя из большого объёма, способов хранения и обработки, неструктурированного вида и процесса структуризации, скорости обработки и существующих алгоритмов обработки. Само определение и процесс отнесения набора данных к Big Data в статье рассматривается со стороны количественного показателя скорости обработки NoSQL данных в системе. Для работы и анализа массивом больших данных существуют такие направления как Data Science ( наука о данных ), технологии Machine Learning (машинного обучения), частным случаем которого является Artificial Intelligence (искусственный интеллект)
Похожие темы научных работ по компьютерным и информационным наукам , автор научной работы — Менщиков Александр Алексеевич, Перфильев Владислав Эдуардович, Федосенко Максим Юрьевич, Фабзиев Ильшат Равильевич
THE MAIN PROBLEMS OF USE OF BIG DATA IN MODERN INFORMATION SYSTEMS
The article deals with the problems of using big data in modern information systems. The chronological stages of the formation of the term Big Data are presented, starting from its first mention by the editor-in-chief of the journal Nature Clifford Lynch in the issue “How can technologies that open up opportunities for working with large amounts of data affect the future of science?” and ending with the formation of the educational and scientific direction of data science. Large corporations that implement big data in their production processes (IBM, Oracle, Microsoft, Hewlett-Packard, EMC) are indicated. The classification of big data is considered according to the theory “VVV”, which includes the Volume, Velocity, Variety of processed data, “4V”, which includes Veracity, “5V”, which includes Viability, "7V", also considering Variability and Visualization. The data arrays themselves, depending on the form of their storage and presentation, are characterized as structured, semi-structured, unstructured. Hence, the problems of Big Data are considered based on the large volume, storage and processing methods, unstructured form and structuring process, processing speed and existing processing algorithms. The very definition and process of classifying a data set as Big Data is considered in the article from the side of a quantitative indicator of the speed of NoSQL data processing in the system. To work and analyze an array of big data, there are such areas as Data Science Machine Learning technologies, a special case of which is Artificial Intelligence.
Текст научной работы на тему «ОСНОВНЫЕ ПРОБЛЕМЫ ИСПОЛЬЗОВАНИЯ БОЛЬШИХ ДАННЫХ В СОВРЕМЕННЫХ ИНФОРМАЦИОННЫХ СИСТЕМАХ»
Научная статья Original article УДК 004.043 + 004.622
ОСНОВНЫЕ ПРОБЛЕМЫ ИСПОЛЬЗОВАНИЯ БОЛЬШИХ ДАННЫХ В СОВРЕМЕННЫХ ИНФОРМАЦИОННЫХ СИСТЕМАХ
THE MAIN PROBLEMS OF USE OF BIG DATA IN MODERN INFORMATION
Менщиков Александр Алексеевич, кандидат технических наук, доцент, ординарный доцент факультета Безопасности информационных технологий, ФГАОУ ВО «Национальный исследовательский университет ИТМО» (197101 Россия, г. Санкт-Петербург, Кронверкский проспект, д.49, лит. А.), тел. 8 (812) 458-43-08, ORCID: 0000-0002-2287-4310, menshikov@itmo.ru Перфильев Владислав Эдуардович, аспирант, инженер факультета Безопасности информационных технологий, ФГАОУ ВО «Национальный исследовательский университет ИТМО» (197101 Россия, г. Санкт-Петербург, Кронверкский проспект, д.49, лит. А.), тел. 8 (812) 458-43-08, ORCID: 0000-00017338-4939, vladik.perfilev@gmail. com
Федосенко Максим Юрьевич, магистрант, инженер факультета Безопасности информационных технологий, ФГАОУ ВО «Национальный исследовательский университет ИТМО» (197101 Россия, г. Санкт-Петербург, Кронверкский проспект, д.49, лит. А.), тел. 8 (812) 458-43-08, ORCID: 0000-0001-8786-5661,
Фабзиев Ильшат Равильевич, студент факультета Безопасности информационных технологий, ФГАОУ ВО «Национальный исследовательский университет ИТМО» (197101 Россия, г. Санкт-Петербург, Кронверкский проспект, д.49, лит. А.), тел. 8 (812) 458-43-08, ifabzievr@gmail.com
Menshchikov Alexander Alekseevich, candidate of technical sciences, associate professor, ordinary associate professor of the Faculty of Information Technology
Security, ITMO University (49 bldg. A, Kronverksky Pr., St. Petersburg, 197101, Russia), tel. 8 (812) 458-43-08, ORCID: https://orcid.org/0000-0002-2287-4310, menshikov@itmo .ru
Perfiliev Vladislav Eduardovich, post-graduate student, engineer of the Faculty of Information Technology Security, ITMO University (49 bldg. A, Kronverksky Pr., St. Petersburg, 197101, Russia), tel. 8 (812) 458-43-08, ORCID: https://ordd.org/0000-0001-7338-4939, vladik.perfilev@gmail.com
Fedosenko Maksim Yurievich, master student, engineer of the Faculty of Information Technology Security, ITMO University (49 bldg. A, Kronverksky Pr., St. Petersburg, 197101, Russia), tel. 8 (812) 458-43-08, ORCID: https://orcid.org/0000-0001-8786-5661, fedosenkomaksim98@gmail.com
Fabziev Ilshat Ravilevich, student of the Faculty of Information Technology Security ITMO University (49 bldg. A, Kronverksky Pr., St. Petersburg, 197101, Russia), tel. 8 (812) 458-43-08, ifabzievr@gmail.com
Аннотация: В статье рассматривается проблематика использования больших данных в современных информационных системах. Представлены хронологические этапы становления термина Big Data, начиная с первого его упоминания главным редактором журнала Nature Клиффордом Линчем в выпуске «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?» и заканчивая становлением учебного и научного направления data science. Указаны крупные корпорации, внедряющие в свои производственные процессы большие данные (IBM, Oracle, Microsoft, Hewlett-Packard, EMC). Классификация больших данных рассмотрена согласно теории "VVV", включающей в себя объём (volume), скорость (velocity), многообразие (variety) обрабатываемых данных, "4V", включающей в себя помимо прочего достоверность (veracity), "5V", включающей в себя помимо прочего жизнеспособность (viability), «7V», рассматривающая также переменчивость (variability) и визуализацию
(vizualization). Сами массивы данных, в зависимости от формы их хранения и представления, характеризуются как структурированные,
слабоструктурированные, неструктурированные. Отсюда, проблематика Big Data рассматривается исходя из большого объёма, способов хранения и обработки, неструктурированного вида и процесса структуризации, скорости обработки и существующих алгоритмов обработки. Само определение и процесс отнесения набора данных к Big Data в статье рассматривается со стороны количественного показателя скорости обработки NoSQL данных в системе. Для работы и анализа массивом больших данных существуют такие направления как Data Science (наука о данных), технологии Machine Learning (машинного обучения), частным случаем которого является Artificial Intelligence (искусственный интеллект)
Abstract: The article deals with the problems of using big data in modern information systems. The chronological stages of the formation of the term Big Data are presented, starting from its first mention by the editor-in-chief of the journal Nature Clifford Lynch in the issue "How can technologies that open up opportunities for working with large amounts of data affect the future of science?" and ending with the formation of the educational and scientific direction of data science. Large corporations that implement big data in their production processes (IBM, Oracle, Microsoft, Hewlett-Packard, EMC) are indicated. The classification of big data is considered according to the theory "VVV", which includes the Volume, Velocity, Variety of processed data, "4V", which includes Veracity, "5V", which includes Viability, "7V", also considering Variability and Visualization. The data arrays themselves, depending on the form of their storage and presentation, are characterized as structured, semi-structured, unstructured. Hence, the problems of Big Data are considered based on the large volume, storage and processing methods, unstructured form and structuring process, processing speed and existing processing algorithms. The very definition and process of classifying a data set as Big Data is considered in the article from the side of a quantitative indicator of the speed of NoSQL data processing in the system. To work
and analyze an array of big data, there are such areas as Data Science Machine Learning technologies, a special case of which is Artificial Intelligence. Ключевые слова: большие данные, обработка данных, неструктурированные данные, NoSQL системы, технологии хранения данных, наука о данных. Keywords: big data, data processing, unstructured data, NoSQL systems, data storage technologies, data science.
Конец 20-го и начало 21 века характеризуется большим скачком в увеличении объёма использования цифровой информации. Увеличиваются размеры файлов, в жизнь стремительно внедряются информационные технологии: социальные сети, средства связи, электронный документооборот, безналичный расчёт, различные системы по сбору и хранению информации (напр. системы видеонаблюдения). Это в свою очередь увеличивает ресурсозатраты на технологии хранения и обработки данных, вынуждая научного сообщество вести активные исследования и разработки в данном направлении [1].
Увеличение объёма данных приводит к появлению термина Big Data. Big Data (с англ. большие данные) — это структурированные или неструктурированные (в большинстве своём) массивы данных большого объема. Данный термин был предложен редактором журнала Nature Клиффорд Линч в 2008 году, в сентябрьском спецвыпуске «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?». В нём говорилось о феномене взрывного роста объёмов и многообразия обрабатываемых данных в мире, а также об технологических перспективах в решении задачи их обработки [2]. Этапы становления
Уже с 2009 года термин распространился в научных кругах и деловой прессе, а к 2010 году начинают появляться первые продукты и решения,
относящихся непосредственно к обработке больших данных. До 2011 года анализом больших данных занимались только в рамках научных и статистических исследований. Их изучали, тестировали уже имеющиеся подходы, разрабатывали новые алгоритмы для работы с ними. Но уже к началу 2012-го объемы данных выросли до огромных масштабов, в связи с чем возникла потребность в их систематизации для практического применения [3]. С этого момента большинство крупнейших компаний — поставщиков информационных технологий, для организации рабочего процесса начинают использовать понятие о больших данных. Среди них стоит выделить компании IBM, Oracle, Microsoft, Hewlett-Packard, EMC — где аналитики рынка информационных технологий посвящают данной концепции отдельные выделенные исследования. Например, в компании Gartner отметили большие данные как тренд номер два в информационно-технологической инфраструктуре (после виртуализации), а также прогнозировали, что внедрение данной технологии окажет наибольшее влияние на информационные технологии в производстве, торговле, здравоохранении, государственном управлении и других в сферах и отраслях, где регистрируются частые перемещения информационных ресурсов. Другими словами, для данных сфер задача структуризации, обработки, выделения закономерностей и внедрения в производственные процессы большого объёма пользовательской информации наиболее актуальна. По этим же причинам, С 2014 на Big Data обратили внимание ведущие мировые вузы, обучающие не только «науке о данных» (data science), но и различным инженерным и ИТ-специальностям [4]. Проблемы
В сущности, понятие Big Data подразумевает работу с информацией огромного объема и разнообразного состава, которая часто обновляется и может располагаться в различных информационных источниках. Согласно отчету McKinsey Institute «Большие данные: новый рубеж для инноваций, конкуренции и производительности» (дословно Big data: The next frontier for innovation,
competition and productivity), данный термин относится к наборам данных, размер которых превосходит возможности типовых баз данных (БД) по хранению, управлению и анализу. В своей статье (в выпуске сентября 2008 года журнала Nature) Клиффорд Линч отнес к Big Data любые массивы неоднородных данных, превышающие объёмом обработки 150 Гб в сутки. Однако, единого критерия на объём до сих пор не существует в силу различий в особенностях данных из разных источников. Например, набор данных на 100000 записей, состоящей из серий и номеров документов будет в разы меньше по объёму набора данных из такого же количество профессиональных фотографий. И те, и те необходимо структурировать и обрабатывать, однако подходы и применяемые для этого технологии будут различаться [5].
Как было сказано ранее, одной из проблем в изучении вопроса больших данных является классификация. Несмотря на то, что есть способы классифицировать данные и применяемые к ним технологии, свойственный большим данным плюрализм не позволяет создать единые направления и методы для работы с ними. Существуют общие классификации и направления по работе с наборами данных они будут рассмотрены далее, однако каждый набор требует к себе индивидуального подхода в процессе его обработки. Указанная выше проблема вытекает из того, что подавляющее большинство наборов данных не структурированы. Другими словами, имея разный вид, особенности заполнения, поля, источники — данные не имеют единого вида, из-за чего становится сложно анализировать их единым механизмом. Это в свою очередь вызывают неудобства при работе с ним: найти необходимый элемент из кучи, где могут храниться картинки, метаданные, сетевые пакеты, хеш-значения и прочее. Данные хранилища называют нерелятивными NoSQL системами, однако для манипуляций всё же необходимо выявить закономерности и группировку.
Следующей проблемой при работе с Big Data выделяют их объём. Огромные массивы не всегда возможно хранить на одном сервере, что в свою очередь приводит к применению технологий распределённых систем. Под данной
системой прежде всего понимают совокупность взаимосвязанных автономных компьютеров и их вычислительных мощностей. Распределённое хранение также вызывает сложности при выборки данных и составлении алгоритмов их обработки. Большой объём в свою очередь требует от системы огромных вычислительных мощностей, что является дорогостоящей технологией [6]. Также, от объёма хранилища данных зависит и скорость их обработки. Если скорость обработки низкая, то данные могут устареть, прежде чем принесут практическую пользу. При небольшой скорости также увеличивается процесс выборки нужной информации их большого объёма, что приводит к несвоевременному получению необходимых составляющих. Отсутствия структурированного вида усугубляет данную проблемы.
Обобщая вышесказанное, у Big Data существую следующие проблемы, расположенные в порядке уменьшения их актуальности:
• Большой объём данных, требующий дорогостоящий технологий для их хранения и обработки
• Хранение данных, обеспечивающие их целостность (чтобы ничего не упустить и не «потерять»), доступность (возможность получить необходимую информацию по мере необходимости), конфиденциальность (очень часто датасеты содержат в себе персональные данные и не подлежат разглашению третьим лицам)
• Неструктурированный вид, где данные разного формата представления хранятся «в куче», а состав конкретного элемента не имеет однообразный вид
• Сложность структуризации, сортировки, распределения при составлении выборок и поиске конкретного элемента из общей системы
• Низкая скорость обработки (в сравнении с объёмом данных), способная привести к большому времени ожидания ответа при поиске определённой позиции, а также их устареванию уже в процессе обработки
• Отсутствие эффективных алгоритмов обработки, учитывающих объём хранилища данных, структуру и методы поиска необходимого элемента (ячейки памяти)
• Большое количество шумов и процесс их учёта при работе с датасетами [7].
Последнюю проблему стоит осветить чуть подробнее, поскольку она вытекает из всех остальных и имеет в себе противоречия. Дело в том, что в структурированных наборах данных, представляющих собой релятивные SQL системы, отклонения от общей структуры (по форме данных, их содержанию) считаются выбросами, и зачастую не учитываются (отбрасываются) при составлении общих выборок. Однако в случае с Big Data выбросы и отклонения зачастую содержат в себе наиболее важную информацию, а сам большой объём данных формируется с целью выявить эти самые отклонения. Небольшая по размеру их выборка (по сравнению с большим объёмом общего хранилище) имеет наибольшую ценность в практической и исследовательской деятельности. И очень важно при обработке датасета их не пропустить и не отбросить. Это первостепенное противоречие, связанная с проблемой наличия шумов. Затем уже идёт задача верно выявить выбросы, структурировать, классифицировать, проанализировать, сделать из них выводы и найти им применение. Эта задача, в свою очередь задействует упомянутые ранее проблемы, связанные с объёмом, скоростью обработки, структуризацией и алгоритмическими подходами при их обработке. Классификация
Одна из важных проблем при работе с Big Data является классификация. Однозначно классифицировать данные порой бывает сложно в силу их неоднородности, в связи с чем также различаются подходы к их обработке. Однако, общие закономерности всё-таки выделяются, с целью направить практическое применение массивов данных в нужное русло, дать некие рекомендации для работы с ними. Рассмотрим имеющиеся способы классификации общего понятия Больших данных без привязки к какому-то конкретному набору. Энциклопедии и имеющиеся научные труды в качестве определяющих характеристик для больших данных традиционно выделяют теорию «VVV», которая содержит в себе следующие характеристики:
• Объём (от англ. Volume) — представляет собой величину физического объёма данных
• Скорость (от англ. Velocity) — подразумевает под собой как скорость прироста информации, так и необходимость высокоскоростной обработки и получения результатов,
• Многообразие (от англ. Variety) — возможность одинаковой и одновременной обработки различных типов данных: структурированных и полуструктурированных, неструктрированных.
Также, с данные характеристики уместно добавить следующие:
• Достоверность (от английского veracity) — представляет собой набор истинной информации, учёт которой при обработке массивов данных является наиболее важным.
• Жизнеспособность (от англ. Viability) — характеризует данные в зависимости от времени их актуальности.
• Ценность (от англ. Value) — показатель, характеризующий важность и необходимость выборки данных при работе с ними над решением конкретных практических задач.
• Переменчивость (от англ. Variability) — способность данный терять свою актуальность со временем. Может является частным показателем для жизнеспособности, если рассматривать их как единое целое и в одной системе классификации.
• Визуализация (от англ. Visualization) — характеризует набор данных в зависимости от степени удобства их представления и графической интерпертации [8].
Набор признаков VVV (Volume, Velocity, Variety) был выработан Meta Group в 2001 году вне контекста представлений понятия Big Data как об определённой структуры информационно-технологических методов и инструментов, поскольку, в связи с ростом популярности концепции центрального хранилища данных для организаций того времени, отмечалась
равнозначимость проблематик при управлении данными по всем трём аспектам. Затем стали появляться интерпретации с «4V», где четвёртая V представляет собой достоверность (от английского veracity) — набор истинной и наиболее важной для практического применения данных (использовалась в рекламных материалах IBM). IDC интерпретирует «четвёртое V» как value c точки зрения важности экономической целесообразности обработки соответствующих объёмов в соответствующих условиях, что отражено также и в определении больших данных от IDC. Интерпретация «5V» прибавляет к набору характеристик жизнеспособность (от англ. Viability), и ценность (от англ. Value), представляющие собой схожее с достоверностью определения, однако не берущее во внимания истинную причину происхождения данных и характер их правдивости. Это сделано с целью взять во внимания все имеющиеся выборки и выявить из них максимально возможное количество характеристик [9]. Интерпретация «7V» ,кроме всего упомянутого, добавляет также переменчивость (от англ. Variability) — способность данный терять свою актуальность со временем и визуализацию (от англ. visualization) — показатель степени возможности графической интерпретации выборок данных и их закономерностей. В каждом из случаев, в этих признаках подчёркивается, что определяющей характеристикой для больших данных является не только их физический объём, но и другие категории, специально разработанные для формирования представления о сложности задачи обработки и анализа данных.
Также, наборы данных характеризуют и по их физическому представлению. Существуют следующие категории: 1. Структурированные данные: это когда данные хранятся, извлекаются, или могут быть использованы в конкретном, определенном формате. Например, информация о клиенте банка может содержаться в базе данных в виде таблицы, сериализованного пакета и содержать информацию, которую возможно найти однозначно и без особых усилий (имя, возраст, номер телефона, номер счёта, состояния счёта, аресты и др.)
2. Неструктурированные данные: этот вид данных трудно категорировать или структурировать. Неструктурированные данные не имеют определенной формы или общего формата, а храниться могут в виде текста, пакетов или мультимедийных файлов. Хорошим примером могут являться электронные письма, текстовые документы, презентации, видео — которые хоть и могут принадлежать конкретной категории, однако данные в них хранятся хаотично и непредсказуемое.
3. Слабоструктурированные (полуструктурированные) данные: представляет собой некий гибрид, смешанную категорию между структурированными и неструктурированными данными. Основное отличие заключается в том, что нельзя категоризировать, но они имеют некоторые определенные свойства (например логи, тэги), которые можно проанализировать и структурировать для их хранения.
Рассмотренная выше классификация уже имеет своё отражение при исследовании проблематики использования Big Data. Исследуются оптимальные технологии для работы с учётом особенностей массива данных по «каждой из V», ведутся работы для разработки оптимальных алгоритмов при анализе неструктурированных массивов. Это достаточно важное направление для исследования, поскольку 80%-90% информации, которую получают компании — это неструктурированные данные [10]. Многообразные, большого объёма, имеющие не всегда необходимую скорость обработки, что приводит к их низкой жизнеспособности и ценности за счёт имеющейся переменчивости. Это всё представляет сложность при поиске необходимого значения. Достоверность данных уже является следующим направлением для исследования, хоть и для составления и анализ точных практических моделей необходимы правдивые наборы. Затем необходимо иметь алгоритмы, которые учитывают при работе каждую из особенностей датасета и способны давать ожидаемый результат. Для работы и анализа с Big Data используются такие направления как Data Science
(наука о данных), технологии Machine Learning (машинного обучения), частным случаем которого является Artificial Intelligence (искусственный интеллект). Но в основе любого подхода лежит серьёзный математический аппарат и большие вычислительные ресурсы для ЭВМ.
1. United Nations Development Programme. Public service excellence in the 21 st century
— Singapore: Springer Singapore, 2019 — 345 C.
2. Lynch C. How do your data grow? //Nature. — 2008. — V. 455. № 7209. — P. 28-29.
3. Корнев М.С. История понятия "Большие данные" (Big Data): словари, научная и деловая периодика // Вестник РГГУ. Серия: История. Филология. Культурология. Востоковедение. — 2018. — № 1(34). — С. 81-85.
4. Свириденкова М.А., Свириденков К.И.. Тенденции развития Big Data // Международный журнал информационных технологий и энергоэффективности.
— 2020. — № 1(15). — С. 23-29.
5. Сердюк С. В., Иващенко И. И. Применение Big Data в современных IT-технологиях. // Ассоциация научных сотрудников "Сибирская академическая книга". — 2017. — №1. — С. 73-74
6. XLVI международная научно-практическая конференция. Инновационные подходы в современной науке, Москва, 2019, 5 С.
7. Клименко А.В., Слащев И. С., Калайда А. В.. Методы обработки больших массивов данных в крупномасштабных системах // Инновационные подходы в современной науке (Москва, 24 мая 2019 года). — Москва, 2019.- С. 98-102.
8. Искаков Р.Р.. Big Data: Актуальные проблемы и пути решения // Моя профессиональная карьера — 2020. — Т.2 № 12. — С. 129-133.
9. Шаталова В.В., Лихачевский Д.В., Казак Т.В.. Большие данные: как технологии Big Data меняют нашу жизнь. // Big data and advanced analytics. — 2021. — № 7-1. -С. 188-192.
10. Формула Big Data: семь «V» + неординарная задача / Блог Форсайт.
11. IV Всероссийская научно-практической конференциия. Приоритетные и перспективные направления научно-технического развития российской федерации, Москва, 2021, 5 С.
12. Дегтярёва В.В., Гусейнова Н.Р.. Возможности применения глобальных технологий Big Data в автоматизированных системах управления // Приоритетные и перспективные направления научно-технического развития российской федерации (Москва, 11-12 марта 2021 года) — Москва, 2021. — С. 338342.
1. United Nations Development Programme. Public service excellence in the 21 st century
— Singapore: Springer Singapore, 2019 — 345 P.
2. Lynch C. How do your data grow? //Nature. — 2008. — V. 455. № 7209. — P. 28-29.
3. Kornev M.S. The history of the concept of "Big Data" (Big Data): dictionaries, scientific and business periodicals // Bulletin of the Russian State University for the Humanities. Series: History. Philology. Culturology. Oriental studies. — 2018. — No. 1 (34). — P. 81-85.
4. Sviridenkova M.A., Sviridenkov K.I. Big Data Development Trends // International Journal of Information Technologies and Energy Efficiency. — 2020. — No. 1(15). — P. 23-29.
5. Serdyuk S. V., Ivashchenko I. I. Application of Big Data in modern IT technologies. // Association of Researchers "Siberian Academic Book". — 2017. — No. 1. — P. 73-74
6. XLVI International scientific and practical conference. Innovative approaches in modern science, Moscow, 2019, 5 P.
7. Klimenko A.V., Slashchev I.S., Kalaida A.V. Methods for processing large data sets in large-scale systems // Innovative approaches in modern science (Moscow, May 24, 2019). — Moscow, 2019. — P. 98-102.
8. Iskakov R.R. Big Data: Actual problems and solutions // My professional career — 2020.
— V.2 No. 12. — P. 129-133.
9. Shatalova V.V., Likhachevsky D.V., Kazak T.V. Big data: how Big Data technologies change our lives. // Big data and advanced analytics. — 2021. — No. 7-1. — P. 188-192.
10. Big Data formula: seven "V" + extraordinary task / Foresight Blog. https://www.fsight.ru/blog/formula-big-data-sem-v-neordinarnaja-zadacha-2/ (01.16.2022).
11. IV All-Russian Scientific and Practical Conference. Priority and promising areas of scientific and technological development of the Russian Federation, Moscow, 2021, 5 P.
12. Degtyareva V.V., Huseynova N.R.. Possibilities of using global Big Data technologies in automated control systems // Priority and promising areas of scientific and technical development of the Russian Federation (Moscow, March 11-12, 2021) — Moscow, 2021. — P. 338-342.
© Менщиков А.А., Перфильев В.Э., Федосенко М.Ю., Фабзиев И.Р., 2022 Научный сетевой журнал «Столыпинский вестник» №1/2022.
Для цитирования: Менщиков А.А., Перфильев В.Э., Федосенко М.Ю., Фабзиев И.Р. Основные проблемы использования больших данных в современных информационных системах // Научный сетевой журнал «Столыпинский вестник» №1/2022.
Проблемы анализа Больших Данных
Большие Данные часто создаются путем объединения множества источников данных, соответствующих различным подгруппам. Каждая подгруппа может демонстрировать некоторые уникальные особенности, которые не разделяются другими. В классических условиях, когда размер выборки небольшой или умеренный, точки данных из небольших субпопуляций обычно классифицируются как «отклонения», и их систематически сложно моделировать из-за недостаточного количества наблюдений. Однако в эпоху Больших Данных большой размер выборки позволяет нам лучше понять гетерогенность, проливая свет на исследования, такие как изучение связи между определенными ковариатами (например, генами или SNP) и редкими результатами (например, редкими заболеваниями или болезнями в небольших популяциях) и понимание того, почему определенные виды лечения (например, химиотерапия) приносят пользу одной группе населения и наносят вред другой. Чтобы лучше проиллюстрировать этот момент, мы вводим следующую модель для населения:
Где λj ≥ 0 представляет долю j-й подгруппы, pj (y; θj (x)) — это распределение вероятностей отклика j-й подгруппы, учитывая ковариаты x с θj (x) в качестве вектора параметров. На практике многие субпопуляции наблюдаются редко, то есть λj очень мало. Когда размер выборки n умеренный, nλj может быть небольшим, что делает невозможным вывод ковариатозависимых параметров θj (x) из-за недостатка информации. Однако поскольку Большие Данные характеризуются большим размером выборки n, размер выборки nλj для j-й группы населения может быть умеренно большим, даже если λj очень мала. Это позволяет нам более точно сделать вывод о параметрах субпопуляции θj (·). Короче говоря, основным преимуществом Больших Данных является понимание неоднородности субпопуляций, таких как преимущества определенных персонализированных методов лечения, которые невозможны при небольшом или умеренном размере выборки.
Большие Данные также позволяют нам, благодаря большим размерам выборки, выявить слабую общность среди всего населения. Например, оценить пользу на сердце одного бокала красного вина в день может быть трудно без большого объема выборки. Точно так же риски для здоровья, связанные с воздействием определенных факторов окружающей среды, могут быть оценены более убедительно только тогда, когда размеры выборки достаточно велики.
Помимо вышеупомянутых преимуществ, неоднородность Больших Данных также создает значительные проблемы для статистического вывода. Вывод модели смеси в (1) для больших наборов данных требует сложных статистических и вычислительных методов. В небольших измерениях могут применяться стандартные методы, такие как алгоритм ожидания-максимизации для моделей конечных смесей. В больших размерах, однако, нам необходимо тщательно упорядочить процедуру оценки, чтобы избежать переобучения или накопления шума и разработать хорошие вычислительные алгоритмы.
Накопление шума
Анализ Больших Данных требует от нас чтобы мы одновременно оценили и проверили много параметров. Ошибки оценки накапливаются тогда, когда решение или правило прогнозирования зависит от большого количества таких параметров. Такой эффект накопления шума особенно серьезен в больших размерностях и может даже доминировать над истинными сигналами. Это обычно обрабатывается предположением о разреженности.
Возьмите, например, многомерную классификацию. Плохая классификация обусловлена наличием множества слабых мест, которые не способствуют уменьшению ошибки классификации. В качестве примера рассмотрим задачу классификации, когда данные поступают из двух классов:
Мы хотим построить правило классификации, которое классифицирует новое наблюдение Z∈RdZ∈Rd либо в первый, либо во второй класс. Чтобы проиллюстрировать влияние накопления шума в классификации, мы устанавливаем n = 100 и d = 1000. Мы устанавливаем μ1 = 0μ1 = 0 и μ2 как разреженные, т.е. только первые 10 записей μ2 отличны от нуля со значением 3, а все остальные записи равны нулю. На рисунке 1 показаны первые два основных компонента с использованием первых m = 2, 40, 200 элементов и целых 1000 элементов. Как показано на этих графиках, когда m = 2, мы получаем высокую степень дискриминации. Однако дискриминирующая мощность становится очень низкой, когда m слишком велико из-за накопления шума. Первые 10 функций вносят вклад в классификацию, а остальные — нет. Поэтому, когда m> 10, процедуры не получают никаких дополнительных сигналов, но накапливают шумы: чем больше m, тем больше накапливается шум, что ухудшает процедуру классификации из-за размерности. При m = 40 накопленные сигналы компенсируют накопленный шум, так что первые два главных компонента все еще имеют хорошую способность распознавания. Когда m = 200, накопленный шум превышает усиление сигнала.
Приведенное выше обсуждение мотивирует использование разреженных моделей и выбора переменных для преодоления эффекта накопления шума. Например, в модели классификации (2) вместо использования всех функций мы могли бы выбрать подмножество признаков, которые достигают наилучшего отношения сигнал / шум. Такая разреженная модель обеспечивает более высокую эффективность классификации. Другими словами, выбор переменных играет ключевую роль в преодолении накопления шума при классификации и прогнозировании регрессии. Тем не менее, выбор переменных в больших измерениях является сложной задачей из-за ложной корреляции, случайной эндогенности, неоднородности и ошибок измерений.
Ложная корреляция
Высокая размерность также содержит ложную корреляцию, ссылаясь на тот факт, что многие некоррелированные случайные величины могут иметь высокие выборочные корреляции в больших измерениях. Ложная корреляция может привести к ошибочным научным открытиям и неправильным статистическим выводам.
Рассмотрим задачу оценки вектора коэффициента β линейной модели
где y∈Rny∈Rn представляет вектор ответа, X = [x1,…, xn] T∈Rn × dX = [x1,…, xn] T∈Rn × d представляет матрицу проектирования, ,∈Rnϵ∈Rn представляет независимый вектор случайного шума и Id — единичная матрица d × d. Чтобы справиться с проблемой накопления шума, когда размер d сравним или больше размера выборки n, принято считать, что ответ дает лишь небольшое количество переменных, то есть β является разреженным вектором. В соответствии с этим допущением разреженности, выбор переменной может быть выполнен, чтобы избежать накопления шума, улучшить производительность прогнозирования, а также улучшить интерпретируемость модели с консервативным представлением.
При больших размерах даже для такой простой модели, как (3), выбор переменных затруднен из-за наличия ложной корреляции. В частности, при высокой размерности важные переменные могут быть сильно коррелированы с несколькими ложными переменными, которые с научной точки зрения не связаны. Рассмотрим простой пример, иллюстрирующий это явление. Пусть x1,…, xn — независимые наблюдения d-мерного гауссовского случайного вектора X = (X1,…, Xd) T∼Nd (0, Id) X = (X1,…, Xd) T∼Nd (0, Id ) . Мы многократно моделируем данные с n = 60 и d = 800 и 6400 по 1000 раз. На рисунке 2а показано эмпирическое распределение максимального абсолютного выборочного коэффициента корреляции между первой переменной, а остальные определены как
где Corr ^ (X1, Xj) Corr ^ (X1, Xj) — выборочная корреляция между переменными X1 и Xj. Мы видим, что максимальная абсолютная корреляция выборки становится выше с увеличением размерности.
Кроме того, мы можем вычислить максимальную абсолютную кратную корреляцию между X1 и линейными комбинациями нескольких нерелевантных побочных переменных:
Используя стандартную конфигурацию, приведено эмпирическое распределение максимального абсолютного коэффициента выборочной корреляции между X1 и ∑j ∈ SβjXj, где S — любое подмножество четвертого размера из <2,…, d>и βj является коэффициентом регрессии наименьших квадратов Xj при регрессии X1 на
Ложная корреляция оказывает существенное влияние на выбор переменных и может привести к ошибочным научным открытиям. Пусть XS = (Xj) j ∈ S — случайный вектор, индексированный S, и пусть SˆS ^ — выбранный набор, который имеет более высокую паразитную корреляцию с X1, как на рис. 2. Например, когда n = 60 и d = 6400, мы видим, что X1 практически неотличим от XSˆXS ^ для множества SˆS ^ с | Sˆ | = 4 | S ^ | = 4. Если X1 представляет уровень выраженности гена, ответственного за заболевание, мы не можем отличить его от других четырех генов в SˆS ^, которые имеют аналогичную прогностическую силу, хотя они, с научной точки зрения, не имеют значения.
Помимо выбора переменных, ложная корреляция может также привести к неверному статистическому выводу. Объясним это, рассмотрев снова ту же линейную модель, что и в (3). Здесь мы хотели бы оценить стандартную ошибку σ остатка, которая заметно проявляется в статистических выводах коэффициентов регрессии, выборе модели, тесте соответствия и предельной регрессии. Пусть SˆS ^ — набор выбранных переменных, а PSˆPS ^ — матрица проекции на пространство столбцов XSˆXS ^ . Стандартная оценка остаточной дисперсии, основанная на выбранных переменных:
Оценщик (6) является беспристрастным, когда переменные не выбраны по данным и модель верна. Однако ситуация совершенно иная, когда переменные выбираются на основе данных. В частности, авторы показали, что, когда существует много ложных переменных, σ2 серьезно недооценивается, это приводит к ошибочным статистическим выводам, включая выбор моделей или тесты значимости, и ошибочным научным открытиям, таким как поиск неправильных генов для молекулярных механизмов. Они также предлагают усовершенствованный метод перекрестной проверки, чтобы ослабить проблему.
Случайная эндогенность
Случайная эндогенность — еще одна тонкая проблема, возникающая из-за высокой размерности. В настройке регрессии Y = ∑dj = 1βjXj + εY = ∑j = 1dβjXj + ε термин «эндогенность» означает, что некоторые предикторы
с небольшим множеством S =
Чтобы объяснить проблему эндогенности более подробно, предположим, что неизвестный нам ответ Y связан с тремя ковариатами следующим образом:
На этапе сбора данных мы не знаем истинную модель и поэтому собираем как можно больше ковариат, потенциально связанных с Y, в надежде включить все члены в S в (7). Кстати, некоторые из этих Xj (для j j 1, 2, 3) могут быть связаны с остаточным шумом ε. Это опровергает предположение об экзогенном моделировании в (7). На самом деле, чем больше ковариат собрано или измерено, тем сложнее это предположение.
В отличие от ложной корреляции, случайная эндогенность относится к настоящему существованию корреляций между непреднамеренными переменными. Первое аналогично тому, что два человека похожи друг на друга, но не имеют генетической связи, а второе похоже на знакомство, которое легко происходит в большом городе. В более общем смысле эндогенность возникает в результате смещения выбора, ошибок измерения и пропущенных переменных. Эти явления часто возникают при анализе Больших Данных, в основном по двум причинам:
- Благодаря новым высокопроизводительным методам измерения ученые могут собирать как можно больше функций и стремиться к этому. Это, соответственно, увеличивает вероятность того, что некоторые из них могут быть коррелированы с остаточным шумом.
- Большие Данные обычно объединяются из нескольких источников с потенциально разными схемами генерации данных. Это увеличивает вероятность смещения выбора и ошибок измерения, которые также вызывают потенциальную случайную эндогенность.
Чтобы проиллюстрировать существование эндогенности, мы подгоняем регрессию наименьших квадратов L1 (Лассо) к данным, и штраф автоматически выбирается с помощью 10-кратной перекрестной проверки (отобрано 37 генов). Затем мы восстановим обычную регрессию наименьших квадратов для выбранной модели, чтобы вычислить остаточный вектор. На правой панели рис. 3 мы строим эмпирическое распределение корреляций между предикторами и остатками. Мы видим, что остаточный шум сильно коррелирует со многими предикторами. Чтобы убедиться, что эти корреляции не вызваны чисто ложной корреляцией, мы вводим «нулевое распределение» ложных корреляций путем случайной перестановки порядков строк в матрице проекта, так что предикторы действительно не зависят от остаточного шума. Сравнивая эти два распределения, мы видим, что распределение корреляций между предикторами и остаточным шумом в необработанных данных (помеченных как «необработанные данные») имеет более “тяжелый хвост”, чем в переставленных данных (помеченных как «переставленные данные»). Этот результат предоставляет убедительные доказательства эндогенности.
Недостатки Big Data, о которых нельзя забывать
Анализ больших данных — удивительная штука. Но, как и любая другая новая технология, он несовершенен. Рассказываем о рисках, связанных с Big Data.

В последние несколько лет везде только и говорят, что о Big Data. Чаще всего в центре внимания оказываются удивительные преимущества, которые может принести использование этой технологии. Однако у всего этого есть и обратная сторона. Мы согласны с тем, что большие данные — это очень многообещающая технология. Но нельзя закрывать глаза на ряд возможных проблем, к которым запросто приведет повсеместное внедрение аналитического ПО.

Ничего личного!
Первый недостаток, который обычно приходит в голову критикам больших данных, — это вопрос сохранения собственной конфиденциальности.
Программы для анализа больших данных работают с огромными массивами информации. Чем эти данные уникальнее, а следовательно, «приватнее», тем более интересные выводы может из них сделать алгоритм. Другими словами, личные данные — это та самая «волшебная пыль», на которой работает Магия больших данных. Нередко эта пыль рассыпается и оседает в разных темных углах, тем самым нарушается чья-то конфиденциальность.
Вот вам интересное на вечер: 10 неожиданных проектов, связанных с Большими Данными — http://t.co/4JPk7EPDV0 pic.twitter.com/WtzGOxeGxB
— Kaspersky Lab (@Kaspersky_ru) April 3, 2015
Однако важно понимать, что на этом возможные негативные последствия не заканчиваются: есть целый список менее очевидных проблем, тесным и запутанным образом связанных между собой.
Это наука, детка (на самом деле — нет)
Одна из проблем состоит вот в чем: люди считают, что анализ больших данных — это наука. Однако в действительности аналитические алгоритмы куда ближе к инженерному делу, а не к науке, и это вовсе не одно и то же.
Попробуйте сравнить физику и ракеты. Физика — это, без сомнения, наука, в которой каждая гипотеза исследуется и доказывается как теоретически, так и на практике. И после этого выводы обязательно выдаются на суд научного сообщества, просто потому, что наука работает именно так.
Более того, наука всегда открыта — любой желающий может проверить каждый закон и каждую теорему. И стоит кому-то обнаружить весомый изъян в расчетах или выдвинуть новую, более убедительную теорию, как она тут же становится частью активного обсуждения, в которое вовлекаются все мэтры научного мира.
Ракеты же — это всего лишь инженерно-технические сооружения, созданные на базе определенных физических знаний. И, как вы наверняка знаете, если дизайн ракеты несовершенен, это может с легкостью привести к неприятностям, что регулярно и происходит.
Самые неприятные случаи использования больших данных: банки, страховщики, HR и другие: https://t.co/xPVSal0f7Q pic.twitter.com/ZNnrQRxEK4
— Kaspersky Lab (@Kaspersky_ru) August 25, 2015
С математикой не поспоришь. Правда ведь?
Из предыдущего пункта есть одно важное следствие: ложное чувство непогрешимости выводов компьютера. Вы же не можете спорить с «математически обоснованным» выводом, не так ли?
Не зная математику, использованную в алгоритме, невозможно оспорить справедливость сделанных расчетов. В теории провести независимую оценку могли бы профессиональные математики — если бы им дали доступ. Но могут ли они это сделать в действительности? Зачастую нет.
Черный ящик такой черный
Даже если у вас есть знания, опыт и время, которое вы готовы потратить на проверку того, как работает тот или иной алгоритм, вам вряд ли дадут это сделать. В большинстве случаев технологии анализа больших данных — это коммерческая тайна. Их исходный код закрыт.
В своем выступлении «Оружие математического поражения» математик и борец за права человека Кэти О’Нейл рассказала о том, как она пыталась исследовать методику оценки эффективности преподавателей на основе Big Data, которую применяют в США.
«Моя подруга, которая владеет средней школой в Нью-Йорке, решила изучить этот алгоритм. Это специализированная школа с углубленным изучением естественных наук и математики, потому она была уверена, что разберется с алгоритмом. Она запросила данные в министерстве образования — и знаете, что они сказали? «Ой, да вы ничего не поймете, это же математика!»
«Она настаивала и наконец получила брошюру, а после показала ее мне. Документ оказался слишком абстрактным для того, чтобы прояснить ситуацию. Так что я отправила запрос, опираясь на закон США о свободном доступе к информации, но получила отказ. Позднее я узнала, что научно-исследовательский центр в Мэдисоне, штат Висконсин, который разрабатывает эту аналитическую модель, заключил контракт, согласно условиям которого ни у кого нет права заглянуть внутрь алгоритма».
«Никто в министерстве образования Нью-Йорка не понимает, как работает эта модель. Учителя не знают, на каком основании им ставят те или иные оценки и что нужно сделать, чтобы их повысить, — им никто ничего не может и не хочет объяснить».
Что-то попадает внутрь, что-то другое — наружу
Поскольку механизм работы алгоритма непрозрачен, неясно и то, какие именно данные обрабатываются, а какие — остаются за бортом. Причем непонятно это не только нам с вами, но и оператору, который работает с программой и действует в соответствии с тем, какие она делает выводы.
Поэтому одни и те же данные могут повлиять на суждения человека дважды: когда они попадают в программу и когда оператор принимает решение. Кроме того, какая-то информация может никак не повлиять на результат, если оператор подумал, что она уже была использована в анализе, а алгоритм на самом деле этого не сделал.
К примеру, представьте, что полицейский попадает в криминальный район. Алгоритм предупреждает его, что человек перед ним с вероятностью 55% взломщик. В руках у этого человека подозрительный чемодан. Но учла ли программа при анализе этот факт? Возникает вопрос: делает ли наличие чемодана этого человека более подозрительным или нет?
Следует также учесть еще то, что в исходных данных может содержаться ошибка или вообще отсутствовать информация, критически важная для принятия правильного решения.
Стакан наполовину пуст или наполовину полон?
Выводы программы также не являются полностью прозрачными и могут быть неверно интерпретированы. Одни и те же цифры разные люди поймут по-разному. К примеру, вероятность в 30% — это много или мало? Ответ зависит от множества разных факторов, о которых мы можем даже и не подозревать.
Что еще хуже, этот процент вероятности может использоваться в конкурентной борьбе. К примеру, даже невысокая вероятность того, что тот или иной человек способен совершить преступление, конечно, не отправит его в тюрьму, но вполне может закрыть ему карьеру в некоторых учреждениях.
Похожие алгоритмы используют в госслужбах США, чтобы узнать, с какой вероятностью соискатель может допустить утечку. Так как за место борются множество людей, никого не обеспокоит тот факт, что некоторым кандидатам откажут просто потому, что для них эта вероятность оказалась чуть-чуть выше среднего.
Why Eugene Kaspersky has big problems with big data http://t.co/QPaWyddi via @itworldca cc: @e_kaspersky
— Kaspersky Lab (@kaspersky) May 22, 2012
Без предубеждений?
Все сказанное выше позволяет смело говорить, что одно из самых разрекламированных преимуществ больших данных — беспристрастность — на самом деле не работает. Решение, принятое человеком на базе расчетов, выполненных созданным людьми алгоритмом, все равно остается решением человека.
На него могли влиять те или иные предубеждения, а могли и не влиять. Проблема в том, что секретный алгоритм и непонятно какие вводные данные не позволяют вам точно сказать, было ли решение беспристрастным. И изменить ничего нельзя, ведь порядок жестко прописан в программном коде.
Недостатки больших данных, о которых нельзя забывать #BigData
Tweet
Добро пожаловать на темную сторону, Энакин
Еще один недостаток алгоритмов прогнозирования — это самосбывающиеся пророчества. К примеру, полиция Чикаго использует алгоритм, который определяет потенциально опасных подростков.
Полицейские решают за таким подростком «присматривать», навещают его дома и оказывают всякие другие «знаки внимания» со всей присущей им любезностью. Подросток понимает, что полиция уже относится к нему как к преступнику, хотя он ничего такого не делал, и начинает вести себя в соответствии с ожиданиями. В результате он действительно становится членом банды.
Конечно, проблема тут в большей степени в некорректном поведении сотрудников полиции. Но не будем забывать о том, что это алгоритмы дают им «научные основания» для подобных действий.
Или, как отметила Уитни Меррилл в своем докладе «Прогнозирование преступлений в мире больших данных», который прозвучал на Chaos Communication Congress 32: «Полицейский отправляется патрулировать, и алгоритм ему подсказывает, что в этом районе он с вероятностью 70% встретит взломщика. Найдет ли он взломщика только потому, что ему сказали: «Ты найдешь взломщика»?»
Не хотите участвовать? Не получится
Если какая-либо правительственная или коммерческая организация внедряет аналитическое ПО и вам это не нравится, вы не сможете просто сказать: «Мне надоело, я выхожу из игры». Никто не станет вас спрашивать, согласны ли вы стать частью такого исследования или нет. Более того, вам вообще вряд ли расскажут, что вы в нем участвуете.
Поймите меня правильно: я не говорю, что все эти недостатки должны заставить нас отказаться от продвинутых аналитических алгоритмов. Технологии Big Data сейчас в самом начале пути — они точно никуда не денутся и останутся с нами надолго. Тем не менее сейчас самое время обдумать все эти проблемы, пока не стало слишком поздно.
Нам нужны хорошо защищенные алгоритмы с прозрачными механизмами обработки данных. Необходимо допускать независимых исследователей к исходному коду, правительствам следует создать соответствующие законы. Также не помешает рассказывать людям, какие такие «математические штуки» за ними присматривают. И всем участникам процесса, конечно же, следует учиться на уже сделанных ошибках.