Парсинг маркетплейсов, только за большие деньги не иначе.
Довольно часто мне стали попадаться задания на тему парсинга крупных интернет-площадок, не то что бы раньше такого не было, было конечно но не в таких масштабах как сейчас.
В основном я делаю эту статейку для людей которые хотят парсить маркетплейсы и для новичков которые еще не сталкивались с парсингом таких крупных сайтов. Забегу на перед и скажу, что все таки парсинг маркетплейсов это нетривиальная и дорогая задачка, дальше мы с вами обсудим чего же там такого сложного и дорогого в этом деле. Ну и если у вас нет кругленькой суммы денег то в принципе можете даже не пробовать парсить эти сайты.
Ну все поехали!
Люди по разным причинам хотят парсить маркетплейсы, кому то нужна самая низкая цена на товар, кому то нужен список цен, кто-то хочет у себя иметь маркетплейс а не простой интернет-магазин. Причин конечно же много это только некоторые из них. Но мало кто знает с какими сложностями приходиться сталкиваться во время парсинга таких крупных платформ, сейчас я попробуй описать те самые проблемы с которыми лично сталкивался и после этого зарекся не иметь дело с этой не благодарной работой.
Как мы начали зарабатывать на парсинге
Проблемы в парсинге маркетплейсов, на примере яндекс маркета
Первая и самая главная проблема это так называемые поведенческие факторы, во времена когда не было биг-даты и серьезного анализа поведения юзера на этой биг-дате, были хороши, ты мог с малой кровью парсить все что угодно. Но как только появился реал-тайм анализ поведения юзера, парсинг по старинке ушел далеко и надолго. Теперь с учетом этой технологии мне нужно будет прикинуться реальным юзером, а это значит что мне нужно найти и купить какой-нить 2-х годовалый аккаунт яндекса, выделить для него чистый как слеза младенца ip — прокси, с эмулировать поведенческие факторы в браузере при парсинге и парсить. Да и таких аккаунтов + чистых проксей, для нормального парсинга, нужно в районе +100 потому есть некий негласный лимит запросов к маркетплейсу и тебя уверяю что если тебя распознают как бота, то по парсить на этой связке аккаунта+прокси уже по нормальному не получиться, хотя может со временем отпускает я не пробовал.
Вторая и не маловажная проблема это расход ресурсов, есть 2 вида парсинга 1-й это без браузерный вариант, этот вариант тупо видит то что отдает ему сервер и не производит ни какой работы в процессе получения кода. Этот вариант требует минимум оперативной памяти.
Но проблема сейчас в том что современные сайты собираются прямо в браузере с помощью javascript, после этого идет еще запросы за данными для собранной страницы. Проблема первого варианта в том что он получает код но не исполняет javascript, соответственно и данные он тоже не получит.
Второй вариант предусматривает использование браузера, который исполняет javascript тем самым собирая страничку и запрашивая данные на сервере еще раз. Этот вариант довольно затратен по ресурсам, например вот прямо щас я пишу статью и у меня открыта одна вкладка браузера, потребление памяти в этот момент достигает 500мб.
Как заработать на парсинге сайтов
Есть еще так называемый headless режим, это когда браузер запускается в невидимом режиме, тогда потребление памяти существенно снижается, но все равно это много для простого парсинга. Например нам нужно будет арендовать машину для парсинга, мы же не будем на своем компьютере это все делать, держа его включенным сутками. Дак вот месечная стоимость аренды машины вот с такими характеристиками 2 ядра х 2000мгц + 2гига оперативы + белый российский ip в подарок, будет стоить 300р. С учетом того что например для нормального парсинга потребуется например 100 потоков, можно я думаю взять машин 30, расход будет 10-ка в месяц. В зависимости от амбиций заказчика, кол-во потоков естественно должно быть увеличено.
И третья проблема собственно которая меня выворачивает на изнанку, это организация процесса парсинга, и так мы знаем что нам нужны нормальные аккаунты, без них яндекс маркет начинает выдавать на каждый запрос каптчу. У нас есть акки, мы разобрались с машинами, теперь наша задача раскидать код по машинам, и нам нужна будет ведущая машина которая будет управлять потоком парсинга, раскидывая задачи по разным машинам. И обрабатывая ситуация с выдачей каптчи на каждой машине.
Этот подход будет работать, но тут нужно быть очень внимательным, ошибок при парсинге бывает очень много, начиная от долгой загрузки сайта, и заканчивая внезапными изменениями кода на странице доноре. Это тяжелая практически круглосуточная работа, нужно смотреть за всеми этими машинами, что бы каждая работала именно так как задумано, ведь у тебя не будет доступа к браузеру и ты не увидишь что там происходит. Максимум что ты можешь это ментально догадаться почему не работает парсер. Ну и попробовать сменить аккаунт + прокси и посмотреть работает ли. В общем работа эта не благодарная.
Итак какие выводы можно сделать исходя из этой информации?
Парсинг сложен, (стек используемых технологий довольно сложен), затратен (кол-во машин + кол-во аккаунтов + работа программиста), требует уверенных знаний от программиста в этой области. Теперь понимаете почему это все так сложно и дорого. И месяцем работы ни как обойдемся, нужен постоянный мониторинг, тестирование и разработка. Стоимость нормального прогера начинается от +40 тысяч рублей, я бы например взялся за один парсинг яндекс маркета где-то за 50тр в месяц, с учетом того что это долгосрочный проект.
Надеюсь эта статья вас вразумит от бесполезной траты времени и денег. Ну и удачи вам!
Источник: dzen.ru
Парсинг сайтов — подработка для фрилансеров (Россия)
Спарсить: есть сайт с задачами, который сразу выдает правильный ты ввел ответ или нет, мне нужен код для перебора ответов в заданном диапозоне. Есть сайт с задачами, который сразу выдает правильный ты ввел ответ или нет, мне нужен код для перебора ответов в заданном диапазоне На сайте есть авторизация.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: товары. Я дам ссылки, нужно скачать фотографии, выписать название, цену и описание в Exell.
Фрилансеры
Парсинг сайтов
дистанционно
от 1000.00 руб.
Спарсить: контакты. Более 200 человек.
Фрилансеры
Парсинг сайтов
дистанционно
от 2000.00 руб.
Спарсить: контакты. Необходимо собрать базу из контактов таргетологов (фио, телефон, почта).
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: Проект. Нам требуется периодически парсить криптовалютные маркетплейсы с крипто-проектами.
Санкт-Петербург
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: товары, цены.
Загрузить на сайт, картинки фото, характеристики.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: контакты, объявления. Необходимо спарсить каталог предприятий по ссылкам: https://www.echoru.com/russian-business-directory/ (2000 руб) http://chicago.ru/cgi-bin/yp/yp.cgi (2000 руб) https://www.racsouthflorida.com/member-directory (2000 руб) https://www.zocdoc.com/ (отсортировать по языку русский и украинский) (3500 руб).
Необходимы в табличной форме информация: 1. Наименование 2. Вебсайт (если указан) 3. email (если указан) 4. email 2 (если указан) 5. телефон 1 (если указан) 6. телефон 2 (если указан) 7. Адрес в формате 7.1. Номер дома, улица, оффис 7.2. Город 7.3. Штат 7.4. Индекс 8. Описание (если указан) 9. Категория в каталоге 10.
Ссылка на исходную запись.
Фрилансеры
Парсинг сайтов
дистанционно
от 1000.00 руб.
Спарсить: товары, цены. Добрый день, нужен парсер и обучение по нему. Цена обговаривается. Задачи парсера: Спарсить товары с сайта www.sima-land.ru. «API www.sima-land.ru предоставляет доступ к каталогу товаров.
API построен на концепции REST.» Технические моменты описаны тут: https://www.sima-land.ru/api/v5/help/#operations-tag-unit Нужно выгружать товары в формате xml, где возможно управлять ценами, т.е. например выгружаемая цена от 100 рублей до 200, увеличиваем итоговую на 200% ну и т.п., плюс исключать из выгрузки какие то категории товаров или определенные. Плюс остатки товаров(они предоставляют эти данные). Делаться это все должно автоматически по 1-2-3-4 раза в день.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: объявления, цены, товары. Сайты застройщиков официальные, с ценами и планировками. Парсить объявления авито/циан.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: контакты. Интересует парсинг e-mail адресов по определенным тематикам с 2гис.
Санкт-Петербург
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: отслеживания мест. Отслеживание открытых мест на запись на визу в сша.
Фрилансеры
Парсинг сайтов
дистанционно
от 2000.00 руб.
Спарсить: контакты. Добрый день! Интересует парсинг резюме По вакансиям Город Пенза НУжны Архитекторы Инженер КОнструктор Пгс Инженер проектировщик систем отопления Инженер геодезист Инженер проектировщик газоснабжения Инженер проектировщик электроснабжения.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: контакты, Нахождение фоловеров и людей из фоллоу на нахождение на Бали. Нахождение фоловеров и людей из фоллоу на нахождение на Бали с определенного акаунта. Стоимость по договоренности.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Спарсить: Майнинг. Надо найти майнинг компании на LinkedIn.
Фрилансеры
Парсинг сайтов
дистанционно
договорная
Добрый день, ищу специалиста на постоянной основе, который разбирается в парсинге сайтов и наполнении сайта товарами. Требования: 1) Уметь писать парсеры для сбора данных 2) Обработка спаршенных данных под формат выгрузки. Выгрузка в екселе в формате CSV.
Что имеется ввиду под обработкой данных: распределение товаров по категориям, обработка характеристик, чтобы они соответствовали формату сайта и фильтру (если он имеется в данной категории), проработка названий. 3) Работать с екселем: обрабатывать данные, знание формул, сопоставление данных из разных таблиц. 4) Знание CMS Opencart.
Касательно работы с товарами — создание, редактирование, добавление характеристик, опций. Работа с модулями. Особенно полезным будет навык работы с модулем — CSV Price Pro import/export 5) Добавление товаров на сайт. Преимущества: 1) Удаленная работа 2) Стабильная ЗП раз в месяц.
Источник: napodrabotku.ru
20 млн рублей в год на парсинге сайтов
Так как тема парсинга часто привлекает внимание и вызывает эмоции (в массе негативные), подготовил статью, где ответил на основные вопросы (их получилось 43) с которыми сталкивались в процессе работы и, надеюсь, развеял некоторые мифы.
1. Можно ли зарабатывать на парсинге? Да. Мы стали активно заниматься этим бизнесом в 2018 году и с тех пор к счастью растем. Привожу открытые налоговые данные.
В 2022 году надеемся, что результат будет чуть лучше.

2. В чем заключается бизнес на базе парсинга? Бизнес, условно говоря, можно разделить на две части: сбор данных и аналитика. Мы не занимаемся аналитикой (попробовали и поняли, что не потянем) и сконцентрировались только на сборе “сырых” данных. Другими словами — мы ежедневно предоставляем нашим заказчикам итоги парсинга в формате CSV/XML.
3. Что такое аналитика? Мало собрать данные, с ними надо уметь работать. Например, сервисы, которые занимаются аналитикой маркетплейсов. Эти команды парсят данные и сразу их обрабатывают в удобном для использования виде. Как упоминал ранее, мы попробовали и не справились.
Почему? Нужно очень хорошо знать предметную область, чтобы сделать качественную аналитику. Мы же парсим все, что “шевелится”: ) и далее наши клиенты сами работают с этими данными.
4. Что клиенты делают с данными? Анализируют, но как — мы не знаем. Наша задача обеспечить поставку на ежедневной основе полных данных. Знаю, что часть клиентов загружают данные в 1С для удобства работы менеджеров, кто-то работает с PowerBI/Google BigQuery, а кто-то просто предпочитает Excel и открывать файлы по протоколу WebDav (у вас файлы будут доступны в проводнике Windows, как будто они находятся локально).
5. Что вы парсите? Все то, что в открытом доступе и доступно к сбору руками человека. Например: цены на товары, наличие по магазинам и т. п. Мы не занимаемся парсингом сайтов, где требуется указать логин- пароль (или эти данные должен предоставить сам клиент, понимая, что риски на блокировку полностью на его стороне, но стараемся отговаривать от таких решений).
6. Какой средний чек в этом бизнесе? С некоторой погрешностью можно назвать сумму 15 000 руб. в месяц. Но учитывая, что это бизнес больше проектный, чем продуктовый, разброс цен может быть большой. У нас есть клиенты, которые платят 400 000 р. в месяц за большой набор данных, а есть совсем “малыши” с чеком 5 000 р. в месяц.
7. В чем плюсы и минусы этого бизнеса? 80% клиентов ожидают регулярные данные (ежедневно, еженедельно), что позволяет применять подписную модель (иными словами — регулярные платежи). Минус в большой конкуренции и низкой стоимости входа.
8. Этот бизнес масштабируем? Да, но не так просто, как хотелось бы. Любой новый клиент (если он крупный), требует усиление команды разработчиков.
9. Сколько у вас сейчас персонала? 5 разработчиков full time в штате и команда поддержки (сотрудники, которые занимаются ежедневным тестированием результатов суточного парсинга). У нас очень молодая команда, ребята учатся (магистратура, бакалавриат) и им очень интересно заниматься парсингом, особенно если этому противодействуют.
10. Почему вы занялись этим бизнесом? Совершенно случайно. Нас попросили собрать цены с Леруа Мерлен. Попробовали, получилось ну и закрутилось: ).
11. Много поддержки? Очень. Поддержка фактически прямо пропорциональна количеству сайтов, которые парсим. Любое изменение разметки сайта может привести к тому, что парсинг сломается.
Мы всегда предупреждаем клиентов, что такие риски существуют, но от этого объем работы не уменьшается).
12. Как клиенты получают данные? После многих экспериментов, мы остановились на частном облаке на базе NextCloud и я могу смело его рекомендовать. Удивительно устойчивое и бесплатное решение, регулярно обновляется, есть документированное API.
Мы ежедневно выгружаем огромный объем данных на это облако в виде файлов, а клиенты забирают информацию удобным способом: API, WebDav, браузер. Звучит не так уж сложно, но как показал опыт — работает.

13. Сколько у вас серверов задействовано? Недавно заказали 6-й. Ранее мы парсили с VPS/VDS, но оказалось, что экономически целесообразнее парсить с помощью bare metal серверов (иными словами “железные” выделенные сервера), которые мы арендуем в нескольких ДЦ. В месяц сервера нам обходятся в ~70 000 руб. и сейчас, к сожалению, сильно подорожала аренда.
Перед арендой мы рассказываем хостеру (ДЦ) в чем суть нашего бизнеса, как мы работаем и т. п. Очень редко (может быть раз в год) поступают жалобы на работу наших парсеров хостеру, но всегда вопросы урегулируем.
14. Насколько этот бизнес устойчив к санкциям? Мы, откровенно говоря, ничего не заметили. 100% наших клиентов в СНГ (80% Россия, 20% Казахстан, Беларусь и т. п.). Разве что пришлось открыть еще один расчетный счет помимо Альфа-Банка (клиенты из Казахстана не могли оплачивать).
15. Какие типы сайтов вы парсите? Любые, где есть открытые данные. Подчеркну — парсинг фактически означает автоматизацию того, что может сделать руками человек. Чаще всего (90%) просят парсить Интернет-магазины, которые относятся к категории ТОП 100.
16. Были судебные угрозы? Пару раз мы получали предупреждающие письма от компаний, которые находили у нас примеры парсинга их сайтов. Последний раз я получил письмо от CEO Aviasales, который угрожал судом и жесткой расправой, хотя по факту мы их не парсили на момент обращения.
Претензия была оформлена некой нанятой юридической компанией с непонятными трактовками, т. к. видимо юристы не совсем поняли о чем идет речь вообще. Я думаю, что когда Aviasales столкнулся с массовым парсингом, они сделали рассылку претензии по всем компаниям, которые публично заявляют, что занимаются этим бизнесом на тот случай, что кто-то отреагирует.
Было еще обращение от компании, которая отслеживает упоминание товарных знаков (простите, могу ошибаться, кажется это были brandmonitor), чтобы мы убрали упоминание Эльдорадо. Нам тоже грозили небесными карами, но чуть успокоились и перешли в более конструктивное русло, когда мы запросили официальные документы на подтверждение представления интересов компании Эльдорадо в этом вопросе. Чтобы сгладить вопрос, мы теперь выкладываем примеры парсинга вот с таким названием (см. ниже). Полная чепуха, понимаю, но юридически безопаснее (нет времени и желания заниматься юридической бюрократией).

17. Можно ли получить льготы от государства, как ИТ- компании? Пытаемся, т. к. фактически мы работаем с базами данных (в законе есть соответствующие формулировки). В Сколково точно не возьмут: )
18. Парсить этично? Сложный вопрос, полагаю что да. Вообще мне кажется, что бизнес должны работать в правовом поле, а не рассматривать свое существование как этичное или нет. Вопрос философский, но обсуждаемый, т. к. парсинг зачастую вызывает негативные эмоции.
Никто не любит, если их парсят. Но я сотрудникам всегда говорю — при общении с новым клиентом, если мы вдруг парсим его сайт, обязательно расскажите про это.
19. Парсить законно? Да, если вы соблюдаете некоторые моменты. Я не буду приводить развернутую юридическую оценку нашего бизнеса, но если говорить коротко — то любая общедоступная информация может собираться, если это не наносит вред источнику и не нарушает прав. Канцелярским языком это звучит следующим образом:
Организация вправе осуществлять автоматизированный сбор информации (парсинг сайтов), размещенной в открытом доступе на сайтах в сети интернет если соблюдаются следующие условия:
Информация находится в открытом доступе и не защищается законодательством об авторских и смежных правах.
Автоматизированный сбор осуществляется законными способами.
Автоматизированный сбор информации не приводит к нарушению в работе сайтов в сети интернет.
Автоматизированный сбор информации не приводит к ограничению конкуренции.
Вот, например, обычный запрос от клиента:
“Здравствуйте. Мне нужен парсер, который будет ежедневно собирать остатки с сайта поставщика и отдавать их в виде excel файла или xml фида.”
20. А что относительно авторского права? Не нужно просто парсить (или использовать) информацию, которая может быть объектом авторского права. Например описания товаров.
К счастью, 99% клиентов просят нас собирать фактические данные, которые не попадают под эту категорию: цена, бренд, категория и т. п. Тут уместно упомянуть Яндекс/Google, которые парсят ваш сайт, собирая контент с страниц в свой индекс. Владельцам сайтов это нравится, т. к. это увеличивает посещаемость, а парсинг не нравится, т. к. потенциально усиливает конкурента. Но эти роботы действуют одинаково.
21. Я написал в оферте на моем сайте, что запрещаю парсинг! Простите, но это никого не интересует и вашу оферту никто читать не будет.
22. Усложняю вам парсинг — цену выведу картинкой! Хоть звучит смешно, но встречали и такое на ряде сайтов. Пожалуйста, не тратьте свое время — библиотеки распознавания изображений работают великолепно. Вы же не будете цены на ваши товары выводить следующим образом:

23. Я тогда ограничу количество запросов, а потом попрошу решить капчу (captcha) и это усложнит вам работу сильно! Есть очень дешевые сервисы ручного решения капчи. Упрощенно говоря, когда наши роботы встречают капчу, по API мы подключаем этот сервис, которые перекидывает задачу оператору для ручного решения. В месяц мы тратим порядка 4 000 р. на оплачу этих сервисов.
24. Вы сильно нагружаете сайты, которые парсите? Нет. Никто не хочет сделать так, чтобы владельцы сайта, раздраженные мощной, паразитной нагрузкой от парсеров, стали внедрять механизмы защиты, которые просто усложняют нам «жизнь”. Если говорить про абсолютные цифры, то нормальным считаем парсинг данных с карточки одного товара в 3-4 секунды.
К сожалению, не все придерживаются такой парадигмы и ко мне лично обращались владельцы сайтов, которые уточняли не мы ли их парсим, т. к. нагрузка была запредельной. Чаще всего причина в »кривых руках” разработчиков.
25. Чем парсинг отличается от DDOS? Тем, что наша задача — автоматизированный сбор данных, на регулярной основе, в течении длительного времени. DDOS преследует совершенно иную цель —” сломать” сайт.
26. Вы взламываете сайты? Нет и не планируем. Бывает, что нас просят «как-то решить” с получением данных, которые защищены паролем. Но это не наш бизнес и вообще это не бизнес, а некая »тема” относящаяся уже к darknet.
27. Можно ли защититься от парсинга? Нет, но можно усложнить парсинг до такой степени, что мы начнем отказывать клиентам, т. к. для клиента это будет экономически невыгодно оплачивать нашу исследовательскую работу по обходу защиты. Все что доступно без пароля в сети Интернет так или иначе может быть собрано автоматизированным способом.
28. Все же, какой самый лучший способ защиты? Выложить данные в формате XML и дать ссылку. Вас гарантированно перестанут парсить и будут забирать данные в удобном виде. Звучит, конечно, как некая утопия и я понимаю, что мало кто последует данному совету, но это единственный способ избежать парсинга.
29. У кого самая сложная защита? АВИТО. У них достаточно ресурсов, чтобы заниматься этим вопросом на очень высоком уровне. Причем, как я думаю, в основном компании защищаются не от самого парсинга, а от DDOS — атак, а парсинг, образно говоря, попадает “под раздачу” защитными фильтрами.
30. Нужно ли мне внедрять на своем сайте защиту? В случае промышленного парсинга, лично мое мнение, — защита не очень поможет, но может усложнить задачу. Но совершенно точно любая защита может отсеять «студентов”, которые вчера прочитали книжку «Парсинг с помощью Python для чайников”. Бизнес устроен так, что чем сложнее парсить сайт, тем дороже будет цена для конечного клиента и тем больше усилий будет приложено командой для решения задачи.
31. Много у вас конкурентов? Очень. Много фрилансеров-самозанятых, которые предлагают услуги парсинга значительно дешевле наших. Насколько мне известно, к ним обращаются за разовым услугами, т. к. если заниматься парсингом регулярно, должна уже быть команда специалистов в штате на поддержку.
32. Как вы обходите защиту? Прокси. Разные. Много.
Смена fingerprint (цифровой отпечаток браузера). Плюс — опыт команды, который накопился за несколько лет. Чем сложнее защита, тем медленнее парсинг, т.к. нам приходится, например, решать капчу — а это время. Сайты на 5-6 запрос просят решить капчу, парсер ждет решения человеком, далее продолжает работу (меняя fingerprint), до следующего запроса на решение.
33. Что думаете про cloudflare? Научились обходить. Но отмечу, что этот сервис в основном ставят для CDN/DDOS, а не для защиты от парсинга. С введением санкций количество сайтов с ним упало. Qrator отличное решение для защиты от DDOS — атак тоже добавляем нам сложностей 🙂
34. Как вы ищите клиентов? Тут мы не оригинальны и все клиенты приходят через сайт с помощью органического трафика (Яндекс и Google 50-50%). Мы пытались давать контекстную рекламу, но отдачу не увидели. Самое результативное, что догадались сделать — публиковать примеры (статичные) парсинга известных компаний на своем сайте с возможностью их скачать и изучить.
Дальше люди просят данные уже в динамике и мы заключаем договор. Пример ниже, цифры по скачиванию честные. Сам сайт сделан на WordPress, ничего сложного.

35. На что конкретно заключается договор? Автоматизированный сбор неструктурированных данных с открытых источников в сети Интернет с преобразованием в структурированные данные. Собственно так и есть.
36. Какой запрос на парсинг самый частый? “Соберите мне, пожалуйста, контакты маркетологов фитнес-центров г. Казань”. Это не шутка, именно подобные запросы мы получаем чаще всего. Задача не имеет роботизированного решения, т. к. мы не работаем с персональными данными людей, которые еще и не хотят их делать публичными.
Мы можем сделать, например, базу Интернет-магазинов косметики, с помощью анализа title/description сайтов в зоне. RU/. РФ и собрать публичные адреса электронной почты и телефоны. Но не решить задачу по сбору личных контактов ЛПР.
Какие еще интересные запросы вы получаете? Вот, пожалуйста. Задача тоже не имеет никакого решения.
“Здравствуйте, хотим получить базу стоматологических клиник. При возможности параметры: в городах больше 500,000. Более 4 кабинетов в клинике. Средний чек больше 7000. + Имейл и телефон ЛПР (рабочие, не пустые)”
37. Как делают базы компаний? Создание баз компаний с открытыми данными — производная парсинга. Настраивают роботов, которые обходят все сайты в Рунете (где-то 6.5 млн.) и собирают общедоступные данные. Таким образом можно создать, например, Базу всех ресторанов и кафе, Базу оптовых компаний и т. п. В любом случае, обрабатываются только общедоступные, публичные корпоративные данные.
38. А вы делаете матчинг товаров? Нет. Может быть зря, но наша задача — поставлять данные регулярно, в запрашиваемом клиентом объеме. Признаю, что если сделать “шаг вперед” и заняться матчингом товаров между разными продавцами и продавать аналитическую отчетность, мы могли бы добиться больших результатов.
Могу ошибаться, но именно этим занимаются наши конкуренты (или смежники, так лучше назвать) и финансовые результаты по выручке у них явно лучше (см. ниже, я завидую :). Что удерживает? Ресурсоемкость. Матчить (сопоставлять) между собой товары по названию между разными игроками на постоянно основе очень сложно. Мы пытались внедрять различные алгоритмы, которые частично автоматизируют этот процесс, но результаты были неудовлетворительные (попробуйте, например, сопоставить аптечные препараты с фасовкой-граммовкой-литражом).

39. Почему крупные компании заказывают парсинг на стороне, а не делают сами? Причины разные. Очень крупные, публичные компании, сталкиваются с рекомендациями своих юристов/СБ, чтобы никоем образом не быть самим вовлеченными в автоматизированном сборе данных (это не домыслы, а опыт общения). Другие компании не хотят заниматься наймом дополнительных разработчиков, управлять ими, тестировать результаты и т. п.
40. Компании вообще знают, что вы (или кто-то другой) их парсит? Часто новые клиенты спрашивают (в шутку или нет), а не парсим ли мы их случайно!? Наша позиция — мы честно отвечаем как есть. Только один раз, крупный клиент рассердился и сказал, что если мы хотим с ним работать, прекратить парсить его.
В итоге мы с ним не работаем.
41. Вы храните данные исторические? Нет. Нам не «по карману» хранить историю ежедневного среза цен по всем магазинам. Звучит очень интересно, но нашими силами это не потянуть.
Мы регулярно удаляем данные старше 7 дней.
42. Можете выйти на глобальные рынки? Боюсь что нет. Это больше проектная деятельность, чем продуктовая. Нужен менеджер по работе с клиентами с отличным английским, поддержка на этом языке и т.п.
Но совершенно точно — можно работать на локальных рынках и зарабатывать, т.к. услуга востребованная. Чем больше информации, чем активнее идет цифровая трансформация (простите за этот изъезженный термин), тем больше востребованность превращения неструктурированных данных в структурированные!
Спасибо за внимание, старался быть краток и по делу — не стесняйтесь задавать свои вопросы в комментариях.
p. s. Не ругайтесь: ) я понимаю, что парсинг сразу настраивает на негатив. Но это обычный бизнес, которым, уверяю вас, занимаются 80% торговых компаний (в том или ином виде) .
- парсинг
- парсинг контента
- парсинг сайта
- парсинг json
- парсинг html
Источник: habr.com
Полное руководство по парсингу веб-сайтов

За последнее десятилетие данные стали ресурсом для развития бизнеса, а Интернет — их основным источником благодаря пяти миллиардам пользователей, формирующим миллиарды фрагментов данных каждую секунду. Анализ данных Всемирной паутины может помочь компаниям выявлять скрытые закономерности, позволяющие им добиваться выполнения своих целей. Однако сбор большого объема данных — непростая для компаний задача, особенно для тех, которые думают, что кнопка «Экспортировать в Excel» (если такая присутствует) и обработка данных вручную — единственные способы сбора данных.

₽ 0.00 – ₽ 1,499.00

₽ 0.00 – ₽ 2,999.00

₽ 0.00 – ₽ 1,299.00

₽ 0.00 – ₽ 1,999.00

₽ 0.00 – ₽ 1,999.00



₽ 0.00 – ₽ 1,299.00

₽ 0.00 – ₽ 999.00



₽ 0.00 – ₽ 799.00
Парсинг веб-сайтов позволяет компаниям автоматизировать процессы сбора данных во Всемирной паутине, используя ботов или автоматические скрипты, называемые «обходчиками» веб-страниц, автоматическими сборщиками данных или веб-сборщиками (web crawlers). В этой статье раскрыты все важные аспекты парсинга веб-сайтов, включая понятие парсинга, почему он важен, как он работает, варианты применения, а также сведения о поставщиках парсеров и руководство по доступным к покупке программным продуктам и услугам.
Содержание скрыть
Что такое парсинг веб-сайтов?
Парсинг веб-сайтов, который также называют сбором/извлечением данных, скрейпингом данных или содержимого экрана, добычей данных/интернет-данных и иногда обходом/сканированием Всемирной паутины, — это процесс извлечения данных из веб-сайтов.
Процесс парсинга веб-сайтов включает в себя отправку запросов на получение веб-страницы и извлечение из нее машиночитаемой информации.
Почему парсинг веб-сайтов востребован?

Всё более широкое использование аналитики данных и автоматизации — существенные тенденции бизнеса. Парсинг веб-сайтов может стать движущей силой для обеих тенденций. Помимо этих причин, у парсинга веб-сайтов есть множество применений, которые могут повлиять на все отрасли. Парсинг веб-сайтов дает компаниям возможность:
- автоматизировать процессы сбора данных в необходимом масштабе;
- получить доступ к источникам данных во Всемирной паутине, которые могут повысить эффективность вашего бизнеса;
- принимать решения, опираясь на данные.
Эти факторы объясняют возрастающий интерес к парсингу веб-сайтов, который можно наблюдать в Google Trends на представленном выше изображении.
Как осуществляется парсинг веб-сайтов?
Обычно процесс парсинга веб-сайтов состоит из следующих последовательных шагов:
- Идентификация целевых URL-адресов.
- Если веб-сайт, сканируемый для сбора данных, использует инструменты противодействия парсингу, то парсеру, возможно, придется выбрать подходящий прокси-сервер, чтобы получить новый IP-адрес, через который парсер будет отправлять свой запрос.
- Отправка запросов на эти URL-адреса для получения HTML-кода.
- Использование указателей для обнаружения местонахождения данных в HTML-коде.
- Аналитический разбор строки данных, которая содержит нужную информацию.
- Преобразование собранных данных в желаемый формат.
- Передача собранных данных в выбранное хранилище данных.
Для чего применяется парсинг веб-сайтов?
Распространенные варианты применения парсинга веб-сайтов перечислены ниже.
- Аналитика данных и наука о данных (data science).
- Сбор «тренировочных» данных для машинного обучения.
- Наполнение корпоративных баз данных.
- Сравнение цен (особенно актуально в электронной коммерции).
- Извлечение описания товаров.
- Отслеживание в поисковых системах конкурентов и текущего состояния компаний в рамках усилий по поисковой оптимизации (SEO).
- Лидогенерация.
- Тестирование веб-сайтов.
- Отслеживание потребительских настроений.
- Агрегация новостей о компании.
- Сбор финансовых данных.
- Исследование рынка.
Как выглядит сфера парсинга веб-сайтов?
Чтобы называться компаний по парсингу веб-сайтов, поставщик подобных программных решений должен предоставлять возможность извлечения данных из множества интернет-ресурсов и возможность экспорта извлеченных данных в различные форматы. Да, сфера парсинга веб-сайтов переполнена, и есть разные способы решения задач по парсингу веб-сайтов на корпоративном уровне.
Инструменты
Решения с открытым исходным кодом
Фреймворки с открытым исходным кодом делают парсинг веб-сайтов дешевле и проще для личного использования. Наиболее широко используемые инструменты: Scrapy, Selenium, BeautifulSoup и Puppeteer.
Пользователи могут собирать информацию, используя библиотеки наподобие Selenium, чтобы автоматизировать этот процесс. Когда на веб-странице есть список, то чаще всего есть и другие страницы, помимо той, которая сразу отображается пользователю. Пример — веб-страницы с «бесконечной прокруткой». Например, предположим, что вы просматриваете веб-страницы YouTube.
На веб-странице, которую вы просматриваете, среди всех перечисленных видео не оказалось такого, который вы бы захотели посмотреть. Затем вам нужно прокрутить список вниз, чтобы появились следующие видео. Selenium позволяет пользователям автоматизировать перемещение по последующим страницам списка и сканирование требуемой информации о каждом элементе списка. Далее пользователи могут сформировать набор данных, содержащий информацию о каждом элементе списка, представленного на веб-сайте. Например, можно создать набор данных о фильмах, в который будут входить наименования, рейтинги IMDb, актеры и позиции фильмов в топе 250 IMDb, сканируя список лучших фильмов по версии IMDb с помощью инструментов с открытым исходным кодом наподобие Scrapy.
Проприетарные программные решения
Хотя на рынке есть различные проприетарные решения, продукты разделены на два типа:
- Решения, для взаимодействия с которыми нужно писать программный код. Поставщики таких решений предоставляют ключ API для доступа к данным.
- Решения без кода, для использования которых необязательно обладать навыками программирования и которые предоставляют инструменты, делающие сканирование веб-сайтов более доступным.
Облачные (SaaS) решения
Хотя парсить данные со своего собственного веб-сайта нетрудно, эта задача будет более сложной на веб-сайтах, стремящихся противодействовать сканированию своего контента роботами, которые не относятся к роботам поисковых систем. Как следствие, передовые парсеры собирают данные с использованием набора различных IP-адресов и цифровых подписей, действуя не как автоматический программный робот, а как группа пользователей, просматривающих веб-сайт.
Управляемые услуги
Полностью управляемые услуги по парсингу веб-сайтов, также называемые «данные-как-услуга» (data-as-a-service, DaaS), будут более удобны для компаний, которым нужен широкомасштабный сбор данных. Работа с веб-сервисами, предоставляющими такие услуги, обычно выглядит так:
- Клиент отправляет требования, как например: перечень сканируемых веб-сайтов, извлекаемые поля и частота сбора данных.
- Компания-поставщик управляемых услуг проверяет, возможно ли выполнить эти требования, и подготавливает к работе программных роботов, которые будут собирать данные.
- Компания использует лучшие методы «очистки» данных, преобразует их в нужный формат и отправляет клиенту.
Такие компании, как Yipitdata, PromptCloud и ScrapeHero, — некоторые из поставщиков, предлагающих полностью управляемые услуги по парсингу веб-сайтов.
Собственные внутриорганизационные решения
Используя готовое существующее программное обеспечение (ПО) с открытым или закрытым исходным кодом и навыки программирования, любая компания может создавать качественные парсеры веб-сайтов. При условии, что у компании есть технический персонал для осуществления этой задачи, и что парсинг необходим для реализации стратегически важного проекта, собственную разработку можно считать оптимальным вариантом.
Какой сборщик данных рекомендуется использовать?

Выбор подходящего инструмента или веб-сервиса для сбора данных во Всемирной паутине зависит от различных факторов, включая тип проекта, бюджет и наличие технического персонала. Чтобы кратко охарактеризовать представленную выше схему принятия решения, правильный ход мыслей при выборе автоматического сборщика данных должен быть таким:
- Собираетесь ли вы собирать данные только для личного использования?
- Если да, то выберите инструмент с открытым исходным кодом или его community-версию, что позволит вам собирать данные бесплатно.
- Если нет, то работает ли ваша IT-компания над стратегически важными проектами, которые дифференцируют ваши продукты или услуги?
- Если да, то сформируйте в компании команду, которая будет предотвращать сбор ваших данных сторонними компаниями.
- Если нет, то позволяет ли ваш бюджет инвестировать более $10 000?
- Если да, то отдайте предпочтение управляемым услугам, поскольку системы парсинга данных требуют существенных усилий по их поддержке. Возможно, что вам не захочется, чтобы команда вашей компании была сосредоточена на поддержке проекта, который не является стратегически важным.
- Если нет, то есть ли у вас навыки программирования?
- Если есть, то отдайте предпочтение решениям с открытым исходным кодом или недорогим проприетарным решениям. Разработка своего парсера может быть эффективнее, чем использование решений, не требующих написания программного кода, поскольку разработанное решение может предложить более высокий уровень автоматизации.
- Если их нет, то сделайте выбор в пользу решений, которыми можно пользоваться без программирования. Большинство из них проприетарные, но их можно приобрести и с ограниченным бюджетом.
Законно ли заниматься парсингом?
Коротко говоря, если: при парсинге собираются общедоступные данные, парсинг не наносит вред компании-владельцу данных, среди собранных данных нет персональных и при повторной публикации собранных данных добавляется ссылка на источник, то, по всей видимости, заниматься парсингом законно. Однако это не юридическое заключение, поэтому, пожалуйста, обратитесь к профессиональному юристу за конкретной консультацией.
Персональные данные
Законность парсинга ранее долгое время была неоднозначной, но сейчас в этом вопросе больше ясности. В настоящее время нормативно-правовые акты, регулирующие конфиденциальность персональных данных, наподобие GDPR Европейского союза и CCPA в Калифорнии не препятствуют парсингу веб-сайтов.
- Собираются общедоступные данные.
- Персональные данные хранятся в надежных условиях и в соответствии с передовыми методиками.
- Данные не продаются или не передаются посторонним, если только на это не было получено согласие отдельного пользователя.
Данные, которые не относятся к персональным
Говоря о компаниях, Апелляционный суд девятого округа США после иска LinkedIn против hiQ постановил, что автоматический парсинг общедоступных данных, очевидно, не нарушает Закон о компьютерном мошенничестве и злоупотреблении (Computer Fraud and Abuse Act, CFAA).
Ограничения
Тем не менее при использовании парсинга веб-сайтов действуют ограничения.
- Извлечение данных не должно причинять какой-либо ущерб владельцам данных.
- Парсер не может публиковать данные без указания их источника. Это было бы неэтично и незаконно.
Примеры
При оценке законности парсинга учтите также, что каждый результат поиска, который вы видите на страницах поисковых систем, был собран ею. Помимо этого, сообщается, что хедж-фонды тратят миллиарды на сбор данных, чтобы принимать более эффективные инвестиционные решения. Поэтому парсинг — это не сомнительная практика, которую применяют только небольшие компании.
Почему владельцы веб-сайтов хотят защитить их от парсинга?

- Сборщики данных могут значительно ухудшить производительность веб-сайта. Роботы, включая поисковых, составляют 24 % веб-трафика согласно Imperva — поставщику ПО для обеспечения информационной безопасности.
- Конкуренты могут собирать и анализировать данные на страницах веб-сайта. Например, это позволяет им посредством уведомлений оперативно узнавать о новых клиентах, партнерских связях или возможностях конкурентов.
- Кроме того, внутренние непубличные данные владельцев веб-сайта могут быть собраны конкурентами, создающими аналогичные продукты или конкурирующие услуги, уменьшая спрос на услуги владельцев веб-сайта.
- Защищенный авторским правом контент владельцев веб-сайта может быть скопирован и процитирован без ссылок на источник, приводя к потере дохода у создателей контента.
Какие сложности могут возникнуть при парсинге веб-сайтов?
- Веб-сайты со сложной структурой: большинство веб-страниц основаны на использовании HTML, и структура одной веб-страницы может сильно отличаться от структуры другой. Следовательно, когда вам нужно спарсить несколько веб-сайтов, для каждого из них придется создать свой парсер.
- Поддержка парсера может быть дорогой: веб-сайты всё время меняют дизайн веб-страницы. Если местоположение собираемых данных меняется, то программный код сборщиков данных необходимо снова доработать.
- Используемые веб-сайтами инструменты противодействия парсингу: такие инструменты позволяют веб-разработчикам управлять контентом, который отображается роботам и людям, а также ограничивать роботам возможность собирать данные на веб-сайте. Некоторые из методов защиты от парсинга: блокировка IP-адресов, CAPTCHA (Completely Automated Public Turing test to tell Computers and Humans Apart — полностью автоматический тест Тьюринга для различения компьютеров и людей) и ловушки в виде приманок для парсеров.
- Необходимость авторизации: чтобы собрать во Всемирной паутине определенную информацию, возможно, вам сначала потребуется пройти авторизацию. Поэтому когда веб-сайт требует войти в систему, нужно убедиться, что парсер сохраняет файлы cookie, которые были отправлены вместе с запросом, чтобы веб-сайт воспринимал парсер в качестве авторизованного ранее посетителя.
- Медленная или нестабильная скорость загрузки: когда веб-сайты загружают контент медленно или не отвечают на запросы, может помочь обновление страницы, хотя парсер, возможно, не знает, что делать в такой ситуации.
Какие приемы парсинга веб-сайтов считаются лучшими?
Распространенные и наиболее успешные приемы парсинга веб-сайтов:
Использование прокси-серверов
Многие администраторы крупных веб-сайтов применяют инструменты для защиты от роботов. Роботам приходится обходить их, чтобы просканировать большое количество HTML-страниц. Использование прокси-серверов и отправка запросов через разные IP-адреса могут помочь преодолеть эти трудности.
Использование динамического IP-адреса
Переход от статического IP-адреса на динамический также может оказаться полезным для того, чтобы парсер не обнаружили и не заблокировали.
Замедление процесса сбора данных
Следует ограничить частоту отправки запросов на один и тот же веб-сайт по двум причинам:
- веб-сборщиков данных легче обнаружить, если они делают запросы быстрее людей;
- сервер веб-сайта может перестать отвечать, если он получает слишком много запросов одновременно. Кроме того, эту проблему поможет решить программирование сборщика данных на взаимодействие с веб-страницей и планирование сеансов сбора данных таким образом, чтобы они начинались не в периоды пиковой нагрузки на веб-сайты.
Соблюдение требований GDPR
Согласно GDPR, незаконно собирать личную информацию (personally identifiable information, PII) резидентов ЕС, если только у вас нет их явного на это согласия.
Бойтесь пользовательских соглашений
Если вы собираетесь собирать данные на веб-сайте, где требуется проходить авторизацию, вам нужно принять пользовательское соглашение (Terms https://xmldatafeed.com/polnoe-rukovodstvo-po-parsingu-veb-sajtov-v-2021-godu/» target=»_blank»]xmldatafeed.com[/mask_link]
