Поиск по блогу

Показаны сообщения с ярлыком downloadmiddleware. Показать все сообщения
Показаны сообщения с ярлыком downloadmiddleware. Показать все сообщения

воскресенье, 16 ноября 2014 г.

Попробовал Scrapy HTTPCACHE middleware. Понравилось

Включается FHTTPCACHE_ENABLED, два режима (политики) кэширования, три вида хранилищ, возможность управлять кэшированием для (схем) типов файлов, протоколов ответов серверов, задавать время перезагрузки кэша ...

понедельник, 3 ноября 2014 г.

Как я учился, чтобы исправить свои дурацкие ошибки... и совершал новые при отладке в пауке XMLFeed...

В пауке XMLFeed... решил поробовать создать новый столбец из свежеспарсенного словаря списков... Пишем файл pipeline.py в котором фильтруем записи о серверах по времени, типу прокси и стране. Потом записываем результат в виде строк "http://777.77.77.77:8080" в текстовый файл. В процессе работы выскакивают ошибки, я быстро ликивидирую безграмотность перечитывая и конспектируя книгу Лутца. Сроки поджимают, стоит ли продолжать ликбез? Насколько он необходим?

пятница, 17 октября 2014 г.

Разбираем, что делает в Scrapy "downloadermiddleware\httpproxy.py"

В справке к urllib.getproxies() нашел "It scans the environment for variables named _proxy ...and when it cannot find it... looks for proxy information from ... Windows Systems Registry ..." ... и поумнел... По сути httpproxy.py этим только и занимается. Поскольку он включен по умолчанию, то надо попробовать "set (export) http_proxy"