Поиск по блогу

Показаны сообщения с ярлыком project_CSVfolder. Показать все сообщения
Показаны сообщения с ярлыком project_CSVfolder. Показать все сообщения

среда, 5 февраля 2014 г.

Проба кода grab и furl для задачи "Процессинг csv таблиц"

У меня в репозитории ждут своего часа с десяток бибилиотек для парсинга html страниц. Здесь мы посмотрим, как работает grab.
С одной стороны, автор старается быть последовательным: сначала мы подготовили соглашение о наименованиях (файлов и директорий), потом, вот уже третий пост, последовательно кодируем процессы работы с файлами CSV.
Здесь подошла очередь процесса сохранения скачаных файлов. Очевидно, что сначала файлы нужно скачать. Потому здесь рассмотрим пример с библиотекой grab.

среда, 29 января 2014 г.

Код для формирования имени загруженного файла CSV

Предположим, что мы скачиваем CSV файл. Нам нужно определить папку (путь) для записи и как-то назвать этот файл. Ранее мы подготовили соглашение о наименованиях (далее по тексту "СН") и собираемся ему следовать. Здесь мы проверим код для соответствующих функций на языке Python.

вторник, 28 января 2014 г.

Формируем список URL для скачивания файлов CSV со счетчика

Выберем в качестве счетчика top.mail.ru Здесь есть великолепныя возможности: 1) Скачивать CSV файлы, 2) выбирать период (год, день, неделя, месяц),3) выбирать параметры пол, возраст...
Все параметры передаются в подстроке запроса URL. Таким образом, задавая разные параметры в строках URL, мы можем сформировать список файлов для скачивания. Здесь мы напишем функции для формирования списка URL на Python 2.7

понедельник, 27 января 2014 г.

Как создать структуру папок. Скрипты и правила (соглашения о наименованиях)

Очевидно, что для того, чтобы создать сразу несколько папок с несколькими файлами в них, проще использоват скрипт. Здесь попробуем написать два скрипта, на Питоне... и в командной оболочке Windows.

Как создать создать несколько папок и файлов для скачивания и последующей обработки файлов (картинка)

В процессе постановки задачи сначала в Постановка задачи "обработка файлов в папках, а потом в заключительной части поста Постановка задачи "Процессинг csv таблиц" (итерация 1) мы почти определились со структурой папок проекта. Вот те диаграммы, которые мы использовали в упомянутых постах:

четверг, 23 января 2014 г.

Постановка задачи "Парсинг URL в csv таблице" (итерация 1 продолжение)

В предыдущем посте мы определились с тем, как мы будем преобразовывать CSV таблицы на первом этапе, сначала во всех файлах мы приклеиваем (слева) дополнительные вспомогательные столбцы, а потом собираем все строки в один общий файл, где несколько тысяч строк.

вторник, 21 января 2014 г.

Постановка задачи "Процессинг csv таблиц" (итерация 1)

После того, как мы скачали несколько десятков однотипных файлов, нужно классифицировать их, добавить к ним столбцы, почистить от мусора, потом склеить строки... Здесь мы выбираем наиболее оптимальную структуру папок, структуру имен, содержание служебных файлов... Для этого мы будем использовать функции записи и чтения строк, import CSV, преобразование строк в объект датавремя

воскресенье, 19 января 2014 г.

Постановка задачи "обработка файлов в папках

Пока я твердо знаю, только то, что при парсинге интернет у меня в компьютере будет собираться уйма "сырых" файлов, из которых я буду компоновать новые файлы-таблицы... Через 3-5 месяцев мне будет трудно вспомнить, что и зачем я делал, где и что лежит... Как не забивать свой винчестер таким мусором? Как разложить все по полочкам?