Поиск по блогу

Показаны сообщения с ярлыком furl. Показать все сообщения
Показаны сообщения с ярлыком furl. Показать все сообщения

среда, 5 февраля 2014 г.

Проба кода grab и furl для задачи "Процессинг csv таблиц"

У меня в репозитории ждут своего часа с десяток бибилиотек для парсинга html страниц. Здесь мы посмотрим, как работает grab.
С одной стороны, автор старается быть последовательным: сначала мы подготовили соглашение о наименованиях (файлов и директорий), потом, вот уже третий пост, последовательно кодируем процессы работы с файлами CSV.
Здесь подошла очередь процесса сохранения скачаных файлов. Очевидно, что сначала файлы нужно скачать. Потому здесь рассмотрим пример с библиотекой grab.

среда, 29 января 2014 г.

Код для формирования имени загруженного файла CSV

Предположим, что мы скачиваем CSV файл. Нам нужно определить папку (путь) для записи и как-то назвать этот файл. Ранее мы подготовили соглашение о наименованиях (далее по тексту "СН") и собираемся ему следовать. Здесь мы проверим код для соответствующих функций на языке Python.

вторник, 28 января 2014 г.

Формируем список URL для скачивания файлов CSV со счетчика

Выберем в качестве счетчика top.mail.ru Здесь есть великолепныя возможности: 1) Скачивать CSV файлы, 2) выбирать период (год, день, неделя, месяц),3) выбирать параметры пол, возраст...
Все параметры передаются в подстроке запроса URL. Таким образом, задавая разные параметры в строках URL, мы можем сформировать список файлов для скачивания. Здесь мы напишем функции для формирования списка URL на Python 2.7

четверг, 23 января 2014 г.

Постановка задачи "Парсинг URL в csv таблице" (итерация 1 продолжение)

В предыдущем посте мы определились с тем, как мы будем преобразовывать CSV таблицы на первом этапе, сначала во всех файлах мы приклеиваем (слева) дополнительные вспомогательные столбцы, а потом собираем все строки в один общий файл, где несколько тысяч строк.