Поиск по блогу

Показаны сообщения с ярлыком requests. Показать все сообщения
Показаны сообщения с ярлыком requests. Показать все сообщения

четверг, 12 марта 2015 г.

Я увяз в pandas-cookbook вместо того, чтобы писать свой код. Далее используем GitHub+Nbviewer

Пост, в котором я сначала пытаюсь объединить несколько разных приемов для экспресс-анализа данных (парсинг- обработка таблиц - разведочный анализ данных). Для парсинга я предполагал использовать requests + lxml. Но оказалось, что Pandas загружкет csv из WWW не хуже, чем с локального диска. А для короткого фрагмента (например, оглавления раздела) проще использовать копипаст тегов. Здесь пример того, как я увяз в разнородных мелких вопросах, поскольку начал изучать приемы построения (масштабирования) диаграмм ('figure.figsize')... форматирование таблиц (например, display.max_columns')

Далее будем целенаправленно искать практикумы на GitHub+Nbviewer

пятница, 16 января 2015 г.

Пробуем сделать html-парсер из из IPyNotebook по рецептам из статьи "HTML Scraping"

Понравилась идея о том, чтобы использовать IPython Notebook для настройки XPath запросов. Это можно делать при помощи объектов lxml, requests. Здесь я успешно опробовал работу связки и распечатал справки по объектам. Нашел ссылки на справочники, после беглого прочтения пришел к выводу, что обе библиотеки не только похожи на объекты Scrapy, но могут быть использованы для экспресс- скрапинга.

среда, 2 апреля 2014 г.

Статья "Web Scraping" с примерами

Я скопипастил этот пост, поскольку здесь разбираются примеры с библиотеками: pattern, lxml, requests, Scrapy, Beautiful Soup... вот только не помню, откуда...