Поиск по блогу

Показаны сообщения с ярлыком linkextractor. Показать все сообщения
Показаны сообщения с ярлыком linkextractor. Показать все сообщения

вторник, 27 января 2015 г.

Начинаем боевой краулер учебного проекта carmailPrice с освоения Rules

Здесь черновик кода спайдера с разными (закоментированными) вариантами Rules Linkextractor. Регулярные выражения в правилах и все остальное я далее изменил. Здесь записано, как я "вспоминал" свжеполученные навыки двухнедельной давности:
"Две недели назад я написал краулер-полуфабрикат. Потом неделя ушла на упражнения с XPath и RE, потом неожидано "образовалась" другая срочная работа..."

вторник, 13 января 2015 г.

Делаем Crawler`а из простого (basic) паука carmailPrice Scrapy

Это продолжение поста "Срочно пишем...". Теперь вместо списка спарсенных вручную ссылок настроим краулера при помощи Rule(lLinkExtractor(allow=r'Items/') ... ) и будем следовать по сылкам на странице. Однако, здесь мы вырежем только по три ссылки со страницы. Чтобы вырезать больше надо знать оси XPath. Об этом потом
Нам понадобится знание регулярных выражений. В предыдущем посте краткий справочник по RE.

воскресенье, 11 января 2015 г.

Подборка примеров Scrapy LinkExtractor, Rules для последующих практикумов

Здесь скопированы десятка полтора фрагментов кода с примерами Scrapy LinkExtractor, Rules Больше двух правил в одном примере мне найти не удалось. Однако, надеюсь, что примеры регулярных выражений здесь на все случай паучьей жизни.