Что такое большие данные big data

Отвечаем на самые частые вопросы о Big Data

Что такое Big Data, откуда она берется и зачем соцсети ее собирают? Правда ли, что смартфоны нас подслушивают? Какие данные собирает билайн и где их хранит? Отвечаем на самые частые вопросы о Big Data.

Такое понятие, как Big Data, быстро вошло в нашу жизнь и теперь встречается буквально повсюду. Голосовые помощники, агрегаторы такси, поиск информации в интернете и многое другое. Несмотря на то что сервисы, без которых мы не можем представить сейчас свою жизнь, стали доступны именно благодаря Big Data, далеко не все понимают, что это такое. Руководитель департамента по внедрению системы управления на основе анализа данных билайна Николай Безносов в новом выпуске проекта билайна «Как это работает» ответил на ключевые вопросы о Big Data.

Что такое Big Data? Сколько это?

Когда человек впервые слышит словосочетание Big Data, он думает только про объем этих самых данных. Само собой, объем важен, но той самой границы, после которой данные становятся «большими», сейчас просто не существует.

Что такое Big Data

Можно сказать так: если вы работаете с данными, которые не помещаются на один сервер и для их обработки требуется уже серьезная инфраструктура (например, кластер из нескольких машин), то у вас Big Data. Это десятки и сотни терабайт. Хотя через лет 5-10, думаю, со мной уже многие не согласятся.

Объем и количество — это важно, но если вы будете разговаривать с экспертами в этой теме, то, скорее всего, под Big Data они будут подразумевать инструменты и методы для хранения и обработки данных большого объема. Потому что какими большими бы данные ни были, они никому не будут интересны, если непонятно, как и где их хранить, с помощью чего обрабатывать и как монетизировать. Когда эти условия выполняются, то можно говорить, что мы имеем дело с Big Data.

Откуда берутся большие данные?

Отовсюду вокруг нас. Если говорить конкретно про источники больших данных, то я бы выделил три основных. Первый — самый неочевидный, но, наверное, самый большой — это машинные данные с различных устройств и девайсов. Возьмем, к примеру, смартфон. Когда вы просто гуляете по улице, ваш телефон обменивается огромным количеством информации с окружающим миром.

Он подключается к разным вышкам сотовой связи, чтобы у вас был интернет, получает пуш-уведомления от различных приложений, если вы включили геолокацию, он отслеживает и корректирует ваше месторасположение, чтобы вы не потерялись. Второй источник — данные социальных сетей. Это и личная информация пользователей, и поведенческая — лайки, репосты и другие взаимодействия. Третий — это транзакционные данные, банковские операции и информация о покупках.

Зачем социальные сети собирают персональные данные?

Ответ на этот вопрос достаточно прозаичный — чтобы зарабатывать на этом деньги. Сейчас говорят, что данные — это новая нефть. С нефтью действительно можно провести аналогию — вот можно продавать сырье, а можно делать нефтепродукты с большей стоимостью. С данными то же самое. Самый простой и плохой способ — продавать данные.

Что такое Big Data за 6 минут

Есть компании, которые этим промышляют, но все же более продвинутые стараются из этих данных создавать продукты для своих клиентов и получать на этом дополнительную прибыль. Если говорить конкретно, то социальные сети зарабатывают на рекламе. Но нельзя же всем пользователям показывать одно и то же, хочется учитывать их индивидуальные предпочтения.

Социальная сеть может догадываться об интересах того или иного пользователя и показывать ориентированную рекламу. Персонализация предложений сейчас, пожалуй, является самым популярным способом использования Big Data. При таком, казалось бы, «меркантильном» подходе стоит понимать, что для самого пользователя поиск необходимой информации был бы невозможен, если социальные сети не собирали бы наши данные и не помогали нам ориентироваться по своим потребностям в этом потоке.

Правда, что смартфоны нас прослушивают? Это опасно?

Однажды наткнулся на комментарий, как какой-то человек пришел домой, увидел, что у него закончилась зубная паста, громко об этом воскликнул, и потом ему в интернете пошла реклама с доставкой зубной пасты на дом. В рамках этой истории можно сказать, что если в этот момент человек не общался с голосовым помощником, если у него не были включены умные устройства и другие девайсы, то я склонен считать, что это простое совпадение.

Если он общался в этот момент, например, с голосовым помощником, то это в целом подтвержденная история, в том числе и самими компаниями. Они используют такие данные, чтобы улучшать качество своего сервиса. Опасно ли это? Я бы относился к этому так — если это мне не вредит, если это направлено на то, чтобы сделать мой клиентский путь проще, сделать сервисы лучше, а не дополнить мое «личное дело», то ничего плохого в этом нет.

Какие задачи у Big Data?

Big Data — это про то, как хранить и обрабатывать данные большого объема. Задача здесь достаточно понятная: сделать этот процесс максимально эффективным. Но компаниям неинтересно просто хранить и обрабатывать данные. Нужно принимать на основе этих данных какие-то решения и разрабатывать продукты.

Вот этим занимается уже другая область — анализ данных и машинное обучение: то, что сейчас называется Data Science. Я уже приводил несколько примеров применения машинного обучения — поиск и персонализированные предложения, но, конечно, их существенно больше. Это и динамическое ценообразование, оптимизация производства, антифрод, маркетинг.

Распознавание изображений в вашем смартфоне на самом деле тоже происходит с помощью машинного обучения. Да и такси сегодня уже не нужно искать с вытянутой рукой, машина к вам приезжает за пару минут. Благодаря анализу миллионов поездок алгоритмы понимают, что в таком-то районе в такое-то время обычно большой пассажиропоток, поэтому туда нужно направить больше водителей. Вот такие задачи у Big Data — делать нашу жизнь удобнее.

Какие данные собирает билайн и где хранит?

У нас есть свой дата-центр в Ярославле. Это сотни серверов, на которых мы храним и обрабатываем данные. Если говорить про сами данные, то они очень разнообразные. Представим, что вы, например, заходите на наш интернет-сайт, приходите в наш офис продаж, покупаете смартфон или оформляете сим-карту, общаетесь с нашим кол-центром и так далее.

В целом все ваше поведение в обезличенном виде складируется на наши сервера, это первое. Второе — информация с нашего оборудования и базовых станций. Кто, где, когда подключился, сколько трафика потратил. Само собой, это не все данные, но если судить по объему, то существенная его часть.

Что билайн делает с помощью больших данных?

История больших данных (Big Data) – часть 2

bannerbanner

В первой части статьи мы рассказали об истории появления больших данных и дали определение этому термину, теперь рассмотрим примеры и области применения, а также поговорим о технологиях, которые используются в Big Data.

Вступление

Доклад о проблемах, связанных с 3V, вышел в свет неспроста. Уже в конце 90-х годов такие индустрии, как поисковые системы, анализирующие и улучшающие свои алгоритмы; маркетинговые компании, начинающие собирать все возрастающий объем данных о поведенческой модели своих потенциальных покупателей; исследовательские агентства, такие как NASA, консолидирующие информацию с тысяч своих устройств, столкнулись с описанными в этом докладе трудностями.

Существующих решений уже не хватало, чтобы справиться с увеличивающимися потоками данных, которые все чаще выходили далеко за пределы оперативной памяти отдельных решений, поэтому подход с вертикальным масштабированием больше не обеспечивал нужды бизнеса. Требовались новые подходы, и мир нуждался в новых технологиях хранения и анализа информации. Технологиях отказоустойчивых и хорошо масштабируемых горизонтально. И они не заставили себя долго ждать.

MapReduce и GFS

MapReduce и GFS

В 2004 году корпорация Google в лице Джеффри Дина и Санжая Гемавата представила миру на удивление простой, но невероятно действенный подход к обработке огромного количества информации. По сути, данный алгоритм позволял работать с неограниченным объемом данных при условии возможности наращивания новых кластерных нод пропорционально увеличению количества обрабатываемой информации.

Как можно понять из названия, алгоритм сводился к разбиению процесса обработки на две простые функции – Map и Reduce, причем единую задачу мы можем разбить на бесконечно большое количество малых подзадач, которые будут выполняться параллельно друг с другом, а потом просто сложить полученный результат. Каждую часть одной большой задачи можно отдать на обработку одному из узлов единого кластера и все, что нам останется при увеличении объемов информации, – это расширить кластер до необходимых нашей задаче размеров.

Давайте попробуем понять подход MapReduce на простейшем примере. Допустим, нам нужно посчитать все упоминания Ивана Иванова, Петра Петрова и Андрея Андреева на всех страницах в Интернете. Потребуется проанализировать огромнейший объем информации, и для одного узла такая задача просто непосильна. Но используя подход MapReduce, мы можем разделить все страницы на части и распределить их анализ на разные ноды нашего кластера.

На первом шаге данные со страниц будут отданы в функцию Map, которая при наличии совпадения вернет нам пары «ключ – значение». В нашем примере это будет (Андрей Андреев, 1), (Петр Петров, 1), (Иван Иванов, 1). То есть при каждом нахождении упоминания нужных людей, мы будем получать от функции Map ключ (Имя Фамилию в нашем случае) и значение, которое в нашем примере свидетельствует об обнаружении упоминания. В итоге мы можем получить следующую картину:

* (Андрей Андреев, 1)

* (Андрей Андреев, 1)

Отлично! Мы отделили зерна от плевел и теперь готовы саккумулировать полученную информацию путем передачи ее в функцию Reduce, которая так же вернет нам на выходе пары «ключ – значение», но уже в обработанном виде:

* (Андрей Андреев, 2)

Готово! На входе мы можем получить терабайты информации, раздробить ее обработку на узлы нашего кластера и с помощью алгоритма MapReduce получить нужные данные.

Эта технология стала отправной точкой для создания систем, работающих с Большими Данными и стала чем-то вроде стандарта de facto при разработке решений в области Big Data. Такой подход помог компании Google повысить эффективность своего поискового ресурса и распараллеливать линейные задачи при работе с петабайтами данных. На своей заре MapReduce использовался Google как средство оптимизации индексирования данных для поисковых запросов. Но как хранить эти данные, а главное – как их быстро находить и обращаться к ним, если они размещены на тысячи серверов?

MapReduce и GFS

Для этих целей Google использовал свою же разработку – распределенную файловую систему GFS (Google File System), которая в качестве единицы хранения использовала так называемые чанки, имеющие определенный размер и несущие в себе информацию. Все серверы, входящие в кластер GFS, можно представить как один большой жесткий диск, в отличие от которого, информация о расположении того или иного блока данных (чанка) хранится на отдельных мастер-серверах, постоянно держащих в оперативной памяти метаданные, что позволяет оперативно обращаться именно к нужной части кластера. Для достижения избыточности копия одного чанка хранится на нескольких серверах, а мастер-сервер рассылает снимки своей оперативной памяти на подчиненные серверы, в любой момент готовые развернуть снимок в своем пространстве и перехватить роль мастера.

Рейтинг
( Пока оценок нет )
Загрузка ...
Заработок в интернете или как начать работать дома