science

Учебник Научная визуализация данных для начинающих

27 уроков · 8 разделов · бесплатно, без регистрации

Этот курс — про графики, которые попадают в научные статьи, отчёты и презентации результатов. Не про «красиво», а про честно, точно и воспроизводимо: как выбрать тип графика под данные, как показать неопределённость, почему радужная палитра врёт, как не обмануть читателя обрезанной осью и как собрать публикационную фигуру скриптом. Мы опираемся на статистику и численные методы, а расчёты для графиков (биннинг, нормировка плотности, доверительные интервалы) считаем прямо в браузере на чистом Python. Код самих графиков (matplotlib/seaborn/plotly) показан как образец для копирования — он рисует, а не печатает, поэтому не запускается здесь.

Курс «Научная визуализация данных» состоит из 8 разделов и 27 уроков: Что такое научная визуализация, Восприятие и принципы Тафти, Выбор типа графика под данные, Распределения: гистограммы, KDE, scatter, Зависимости, ошибки и шкалы, Цвет в научной графике, Многомерные данные и поля и Публикационная фигура: композиция, честность, экспорт. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Что такое научная визуализация

    1. Зачем учёному график

      Роль графика в науке: показать результат честно и точно, отличие научной визуализации от бизнес-графиков и инфографики.

    2. Квартет Энскомба: почему нельзя верить одной статистике

      Квартет Энскомба: четыре набора с одинаковыми средними, дисперсией и корреляцией, но совершенно разными графиками — почему всегда нужно рисовать данные.

    3. Воспроизводимая фигура: скрипт вместо редактора

      Почему научная фигура должна собираться скриптом из данных, а не вручную в графическом редакторе: воспроизводимость, обновляемость, проверяемость.

  2. 2 Восприятие и принципы Тафти

    1. Ранг визуальных каналов: позиция против цвета

      Иерархия точности визуальных каналов по Кливленду и Макгиллу: позиция точнее длины, длина точнее угла, угол точнее цвета и площади.

    2. Data-ink ratio и борьба с chartjunk

      Принципы Эдварда Тафти: data-ink ratio (доля чернил на данные), удаление chartjunk, lie factor и стремление к информационной плотности.

    3. Гештальт и предвнимательное восприятие

      Принципы гештальта (близость, сходство, общая судьба) и предвнимательные признаки в дизайне графиков: как направлять взгляд читателя.

  3. 3 Выбор типа графика под данные

    1. Таблица выбора: какой график под какой вопрос

      Систематическая таблица выбора типа графика: распределение, зависимость двух величин, динамика во времени, сравнение категорий и состав целого.

    2. Почему круговая диаграмма почти всегда плоха

      Разбор недостатков круговой диаграммы: углы считываются плохо, сравнение секторов трудно, 3D-pie искажает доли. Чем заменить pie в науке.

    3. Heatmap и матрицы: когда цвет уместен

      Тепловые карты для матриц и таблиц сопряжённости: корреляционные матрицы, кластеризация, выбор палитры и нормировка. Когда heatmap полезен, а когда вводит в заблуждение.

  4. 4 Распределения: гистограммы, KDE, scatter

    1. Гистограмма: сколько брать бинов

      Как выбрать число столбцов гистограммы: правило Стёрджеса, корня, Фридмана–Дайкониса. Почему число бинов меняет вид распределения и как считать ширину бина.

    2. Нормировка плотности и ядерная оценка (KDE)

      Нормировка гистограммы в плотность (площадь = 1), сравнение выборок разного размера и ядерная оценка плотности KDE как гладкая альтернатива.

    3. Boxplot и violin: что они скрывают и показывают

      Ящик с усами (boxplot): медиана, квартили, усы и выбросы. Скрипичная диаграмма (violin) как сочетание boxplot и KDE. Когда что выбирать.

  5. 5 Зависимости, ошибки и шкалы

    1. Scatter и overplotting: когда точки сливаются

      Диаграмма рассеяния для зависимости двух величин и проблема overplotting при больших данных: прозрачность (alpha), джиттер, hexbin и 2D-плотность.

    2. Error bars: std, стандартная ошибка и доверительный интервал

      Планки погрешностей: разница между стандартным отклонением, стандартной ошибкой среднего и доверительным интервалом. Формула CI и почему показывать неопределённость обязательно.

    3. Логарифмические шкалы и степенные законы

      Когда нужны логарифмические оси: степенные законы, экспоненциальный рост, многопорядковый разброс. Лог-лог график и наклон как показатель степени.

  6. 6 Цвет в научной графике

    1. Три типа палитр: последовательная, расходящаяся, категориальная

      Как выбрать цветовую палитру под тип данных: последовательная для упорядоченных величин, расходящаяся для отклонений от центра, категориальная для групп.

    2. Почему радуга и jet вредны, и что такое viridis

      Почему радужная палитра jet вредна в науке: неравномерная светлота создаёт ложные границы и скрывает структуру. Перцептивно равномерные палитры viridis.

    3. Дальтонизм и доступность цвета

      Около 8% мужчин страдают дальтонизмом. Как делать графики доступными: безопасные палитры, не только цвет для кодирования, проверка симуляцией.

  7. 7 Многомерные данные и поля

    1. Small multiples и фасетки

      Small multiples (фасетки): много маленьких графиков с общими осями вместо одного перегруженного. Принцип Тафти, общая шкала и сравнение по группам.

    2. Параллельные координаты и временные ряды

      Параллельные координаты для многомерных данных: каждая ось — переменная, объект — ломаная. Визуальные приёмы для временных рядов: тренд, сезонность, выравнивание.

    3. Поля, контуры и векторные поля

      Визуализация двумерных полей: heatmap, контурные линии (изолинии) и векторные поля (quiver, streamlines). Связь с физикой: потенциал, градиент, течения.

    4. Когда 3D обманывает: псевдо-3D как зло

      Почему 3D-графики часто вводят в заблуждение: перспектива искажает, окклюзия прячет данные, считывание трёх координат с плоскости неточно. Когда 3D оправдан.

  8. 8 Публикационная фигура: композиция, честность, экспорт

    1. Композиция фигуры: subplots, аннотации, единицы, легенда

      Как собрать публикационную фигуру: панели subplots с подписями a/b/c, аннотации, обязательные единицы измерения на осях, легенда, DPI и LaTeX в подписях.

    2. Как графиками врут: обрезанная ось и искажённые пропорции

      Манипуляции в графиках: обрезанная ось Y, искажённые пропорции, двойные оси, инверсия и cherry-picking. Как распознавать визуальную ложь и не врать самому.

    3. Экспорт: вектор для статьи, растр для остального

      Векторные форматы (SVG, PDF, EPS) против растровых (PNG, JPEG) для научных фигур: масштабируемость, качество при печати, когда что выбирать и почему не JPEG.

    4. Инструменты: matplotlib, seaborn, plotly

      Обзор инструментов научной визуализации в Python: matplotlib как фундамент, seaborn для статистики, plotly для интерактива. Когда что выбирать.

    5. Чек-лист научной фигуры

      Итоговый чек-лист научной фигуры: тип графика под данные, единицы, неопределённость, честная ось, палитра и доступность, воспроизводимость и экспорт.

py
Курс по теме
Пройдите курс «Python с нуля» — по шагам, с проверкой
8 уроков · ~14 ч · теория, упражнения и экзамен с бейджем
Открыть курс →