Поиск по блогу

Показаны сообщения с ярлыком xpath. Показать все сообщения
Показаны сообщения с ярлыком xpath. Показать все сообщения

среда, 21 января 2015 г.

Первый вариант шаблона для подбора и проверки XPath запросов и команды для нормализации строк

На примере carmailPrice. Здесь мы пробуем XPath запросы и тут же чистим полученные списки от лишних проблеов и переносов строк. Возвращаемся к задаче парсинга страницы bmw_mail. Сначала "фотографируем" страницу, потом копипастим сюда фрагмент кода, потом подбираем XPath запросы, потом формируем цепочки для чистки текстовых строк ' '.join(), replace(), split(), strip() эту чистку гордо именуем нормализацией. Работа муторная, но пост наглядный... Потому что с lxml html.fromstring(In[2]) ... а вссылках - примеры кода для "remove ALL whitespace from String"

понедельник, 19 января 2015 г.

Самый краткий справочник по "простейшему" XPath и полсотни примеров

Сделан по двум книгам. "Самоучитель XML" и "XSLT сборник рецептов". Здесь я "адаптировал" почти все примеры для HTML и выполнил их, используя библиотеку lxml. Не хватило терпения на примеры фильтров, я просто скопировал их из книги...

пятница, 16 января 2015 г.

Пробуем сделать html-парсер из из IPyNotebook по рецептам из статьи "HTML Scraping"

Понравилась идея о том, чтобы использовать IPython Notebook для настройки XPath запросов. Это можно делать при помощи объектов lxml, requests. Здесь я успешно опробовал работу связки и распечатал справки по объектам. Нашел ссылки на справочники, после беглого прочтения пришел к выводу, что обе библиотеки не только похожи на объекты Scrapy, но могут быть использованы для экспресс- скрапинга.

пятница, 2 января 2015 г.

Готовим Xpath Запросы для страницы cars.mail.ru/catalog/bmw/ с помощью Xpath helper chrome

Здесь запросы для трех полей текста ссылок BMW X6 кроссовер (37 значений), значения @href /catalog/bmw/m3/f30/sedan/(37 значений), и поля цены 4121000 (34 значения)... Две красивых картинки и фрагменты кода страницы.
Этот пост использовался для подбора и тестирования XPath запросов.

воскресенье, 28 декабря 2014 г.

Ссылки по теме "XPath MDN Mozilla" и "Introduction to using XPath in JavaScript MDN"

Здесь десяток ссылок от Mozilla Development Network. Эти записи я сделал, когда пытался выбрать инструментарий для парсинга html-страниц. Потом я догадался разделить все мои задачи на две категории. Первая - настройка селекторов для спайдеров (Scrapy). Вторая - ручной (экспрес)парсинг из одной-двух html-страниц, когда надо быстро, а паука писать не хочется. ТОгда можно открыть консоль и по-быстрому вырезать нужные элементы. И все работает, только одна проблема вырисовывается - чтобы вытащить нужные данные из объектов консоли нужны довольно сложнве команды. К таким выводам я пришел после беглого знакомства с мануалами от MDN И Явускрипт победил простой плагин XPath helper.

суббота, 27 декабря 2014 г.

Найден хороший плагин XPath Helper for chrome, но хочется большего

Это предисловие я пишу уже после того, как понял, что мне нужно разделить задачи генерирования Xpath для "боевого" парсера и "экспресс-парсинга" данных с HTML страницы. Здесь же я пытался решить сразу две, окончательное решение для каждой в последующих постах, а здесь пример, пояснения и картинка для XPath Helper for chrome