Поиск по блогу

Показаны сообщения с ярлыком lxml. Показать все сообщения
Показаны сообщения с ярлыком lxml. Показать все сообщения

пятница, 16 января 2015 г.

Пробуем сделать html-парсер из из IPyNotebook по рецептам из статьи "HTML Scraping"

Понравилась идея о том, чтобы использовать IPython Notebook для настройки XPath запросов. Это можно делать при помощи объектов lxml, requests. Здесь я успешно опробовал работу связки и распечатал справки по объектам. Нашел ссылки на справочники, после беглого прочтения пришел к выводу, что обе библиотеки не только похожи на объекты Scrapy, но могут быть использованы для экспресс- скрапинга.

среда, 2 апреля 2014 г.

Статья "Web Scraping" с примерами

Я скопипастил этот пост, поскольку здесь разбираются примеры с библиотеками: pattern, lxml, requests, Scrapy, Beautiful Soup... вот только не помню, откуда...