Мастерская опрятных данных
Принципы Tidy Data Хэдли Уикхэма: как превратить «грязные» данные в аккуратную таблицу, пригодную для анализа. С примерами на Python и R.
Что такое Tidy Data?
Tidy Data — это стандартный способ организации данных, при котором каждый столбец — это переменная, каждая строка — это наблюдение, а каждая ячейка — одно значение.
Концепцию предложил Хэдли Уикхэм в 2014 году в статье «Tidy Data» (Journal of Statistical Software). Основная идея: «опрятные наборы данных все одинаковы, каждый неопрятный набор неопрятен по-своему».
Три правила:
- Каждая переменная — отдельный столбец.
- Каждое наблюдение — отдельная строка.
- Каждое значение — отдельная ячейка.
Почему это важно?
По оценкам, до 80% времени data scientist тратит на очистку и подготовку данных. Tidy Data делает этот процесс системным:
- Унификация — все инструменты (pandas, ggplot2, dplyr) ожидают данные в одном формате.
- Векторизация — R и Python оптимизированы для работы с векторами, что ускоряет вычисления.
- Воспроизводимость — структурированный пайплайн очистки легко повторить.
Ссылки на литературу
- Wickham, H. (2014). Tidy Data. Journal of Statistical Software, 59(10). jstatsoft.org
- Wickham, H., Çetinkaya-Rundel, M., & Grolemund, G. (2023). R for Data Science (2nd ed.). O'Reilly. r4ds.hadley.nz
- McKinney, W. (2017). Python for Data Analysis (2nd ed.). O'Reilly.
- VanderPlas, J. (2016). Python Data Science Handbook. O'Reilly. jakevdp.github.io
- Data Carpentry. Data Cleaning with OpenRefine. datacarpentry.org