Предиктивное моделирование на практике
Book information
Description
«Предиктивное моделирование на практике» охватывает все аспекты прогнозирования, начиная с ключевых этапов предварительной обработки данных, разбиения данных и основных принципов настройки модели. Все этапы моделирования рассматриваются на практических примерах из реальной жизни, в каждой главе дается подробный код на языке R. Эта книга может использоваться как введение в предиктивные модели и руководство по их применению. Читатели, не обладающие математической подготовкой, оценят интуитивно понятные объяснения конкретных методов, а внимание, уделяемое решению актуальных задач с реальными данными, поможет специалистам, желающим повысить свою квалификацию. Авторы постарались избежать сложных формул, для усвоения основного материала достаточно понимания основных статистических концепций, таких как корреляция и линейный регрессионный анализ, но для изучения углубленных тем понадобится математическая подготовка. Для работы с книгой нужно иметь базовые знания о языке R. Оглавление Предисловие От издательства Глава 1. Введение 1.1. Прогнозирование и интерпретация 1.2. Ключевые ингредиенты предиктивных моделей 1.3. Терминология 1.4. Примеры наборов данных и типичные сценарии данных Музыкальный жанр Заявки на получение грантов Поражение печени Проницаемость Производство химикатов Мошенничество в финансовых отчетах Сравнения наборов данных 1.5. Структура книги 1.6. Условные обозначения ЧАСТЬ I. ОБЩИЕ СТРАТЕГИИ Глава 2. Краткий обзор процесса предиктивного моделирования 2.1. Пример прогнозирования экономии топлива 2.2. Аспекты, заслуживающие отдельного рассмотрения Разделение данных Данные предикторов Оценка эффективности Оценка нескольких моделей Выбор модели 2.3. Итоги Глава 3. Предварительная обработка данных 3.1. Практический пример: сегментация клеток в высокопроизводительном скрининге 3.2. Преобразования данных для отдельных предикторов Центрирование и масштабирование Преобразования для устранения смещения 3.3. Преобразования данных с несколькими предикторами Преобразования для решения проблемы выбросов Прореживание данных и выделение признаков 3.4. Отсутствующие значения 3.5. Удаление предикторов Корреляции между предикторами 3.6. Добавление предикторов 3.7. Группировка предикторов 3.8. Вычисления Преобразования Фильтрация Создание фиктивных переменных Упражнения Глава 4. Переобучение и настройка модели 4.1. Проблема переобучения 4.2. Настройка модели 4.3. Разделение данных 4.4. Методы повторной выборки К-кратная перекрестная проверка Обобщенная перекрестная проверка Повторное разделение тренировочного/тестового набора Бутстрэп 4.5. Практикум: оценка кредитоспособности 4.6. Выбор итоговых параметров настройки 4.7. Рекомендации по разделению данных 4.8. Выбор между моделями 4.9. Вычисления Разделение данных Повторная выборка Базовый процесс построения модели в R Определение параметров настройки Сравнение моделей Упражнения ЧАСТЬ II. РЕГРЕССИОННЫЕ МОДЕЛИ Глава 5. Измерение эффективности регрессионных моделей 5.1. Количественные показатели эффективности 5.2. Обратное отношение между смещением и дисперсией 5.3. Вычисления Глава 6. Модели с признаками линейной регрессии 6.1. Практикум: моделирование количественного соотношения «структура-активность» 6.2. Линейная регрессия Линейная регрессия для данных растворимости 6.3. Частные наименьшие квадраты Применение методов PCR и PLSR для прогнозирования данных растворимости Алгоритмические разновидности PLS 6.4. Штрафные модели 6.5. Вычисления Обычная линейная регрессия Частные наименьшие квадраты Штрафные регрессионные модели Упражнения Глава 7. Нелинейные регрессионные модели 7.1. Нейросети 7.2. Многомерные адаптивные регрессионные сплайны 7.3. SVM, или метод опорных векторов 7.4. Метод к ближайших соседей 7.5. Вычисления Нейросети Многомерные адаптивные регрессионные сплайны SVM, метод опорных векторов Метод KNN Упражнения Глава 8. Древовидные модели. Модели на базе правил 8.1. Базовые деревья регрессии 8.2. Деревья регрессионных моделей 8.3. Модели на базе правил 8.4. Бэггинг-деревья 8.5. Случайные леса 8.6. Усиление 8.7. Модель Cubist 8.8. Вычисления Простые деревья Деревья моделей Деревья бэггинга Случайные леса Усиленные деревья Модель Cubist Упражнения Глава 9. Обзор моделей растворимости Глава 10. Практический пример: сопротивление сжатию бетонных смесей 10.1. Стратегия построения модели 10.2. Эффективность моделей 10.3. Оптимизация сопротивления сжатию 10.4. Вычисления ЧАСТЬ III. КЛАССИФИКАЦИОННЫЕ МОДЕЛИ Глава 11. Определение эффективности в классификационных моделях 11.1. Прогнозы классов Хорошо откалиброванные вероятности Представление вероятностей классов Неоднозначные зоны 11.2. Оценка прогнозируемых классов Задача двух классов Критерии, не основанные на точности 11.3. Оценка вероятностей классов ROC-кривые Диаграммы точности прогнозов 11.4. Вычисления Чувствительность и специфичность Матрица несоответствий ROC-кривые Диаграммы точности прогнозов Калибровка вероятностей Глава 12. Дискриминантный анализ и другие линейные классификационные модели 12.1. Практикум: прогнозирование успешных заявок на получение грантов 12.2. Логистическая регрессия 12.3. Линейный дискриминантный анализ (LDA) 12.4. Дискриминантный анализ методом частных наименьших квадратов 12.5. Штрафные модели 12.6. Ближайшие сжатые центроиды 12.7. Вычисления Логистическая регрессия Линейный дискриминантный анализ Дискриминантный анализ методом частных наименьших квадратов Штрафные модели Метод ближайших сжатых центроидов Упражнения Глава 13. Нелинейные классификационные модели 13.1. Нелинейный дискриминантный анализ Квадратичный и регуляризированный дискриминантный анализ Смешанный дискриминантный анализ 13.2. Нейросети 13.3. Гибкий дискриминантный анализ 13.4. SVM, метод опорных векторов 13.5. Метод KNN 13.6. Наивный байесовский классификатор 13.7. Вычисления Нелинейный дискриминантный анализ Нейросети FDA Модель SVM Модель KNN (к ближайших соседей) Наивный байесовский классификатор Упражнения Глава 14. Деревья классификации и модели на базе правил 14.1. Базовые деревья классификации 14.2. Модели на базе правил Модель C4.5Rules Модель PART 14.3. Бэггинг деревьев 14.4. Случайные леса 14.5. Бустинг Алгоритм AdaBoost Стохастический градиентный бустинг 14.6. Модель С5 0 Классификационные деревья Правила классификации Усиление Другие аспекты модели Данные грантов 14.7. Сравнение двух кодировок категорийных предикторов 14.8. Вычисления Классификационные деревья Правила Деревья с бэггингом Случайный лес Деревья с усилением Упражнения Глава 15. Сравнительный анализ моделей для заявок на получение грантов Глава 16. Решение проблемы дисбаланса классов 16.1. Практикум: прогнозирование политики страхования 16.2. Эффект дисбаланса классов 16.3. Настройка модели 16.4. Альтернативные пороги отсечения 16.5. Корректировка априорных вероятностей 16.6. Неравные веса 16.7. Методы выборки 16.8. Тренировка с учетом стоимости 16.9. Вычисления Альтернативные пороги отсечения Методы выборки Тренировка с учетом стоимости Упражнения Глава 17. Практикум: планирование заданий 17.1. Разделение данных и стратегия модели 17.2. Результаты 17.3. Вычисления ЧАСТЬ IV. ПРОЧИЕ ВОПРОСЫ ПРЕДИКТИВНОГО МОДЕЛИРОВАНИЯ Глава 18. Определение важности предикторов 18.1. Числовые результаты 18.2. Категорийные результаты 18.3. Прочие методы 18.4. Вычисления Числовые результаты Категорийные результаты Показатели важности для разных моделей Упражнения Глава 19. Выбор признаков 19.1. Последствия использования неинформативных предикторов 19.2. Методы сокращения количества предикторов 19.3. Методы-обертки Прямой, обратный и пошаговый выбор Имитация отжига Генетические алгоритмы 19.4. Методы-фильтры 19.5. Смещение выбора 19.6. Практикум: прогнозирование когнитивного расстройства 19.7. Вычисления Прямой, обратный и пошаговый выбор Рекурсивное исключение признаков Методы-фильтры Упражнения Глава 20. Факторы, влияющие на эффективность модели 20.1. Ошибки III типа 20.2. Ошибка измерения результата 20.3. Погрешность измерений в предикторах Практикум: прогнозирование нежелательных побочных эффектов 20.4. Дискретизация непрерывных результатов 20.5. Когда следует доверять прогнозу вашей модели? 20.6. Влияние большой выборки 20.7. Вычисления Упражнения ПРИЛОЖЕНИЯ Приложение А. Краткая сводка различных моделей Приложение Б. Введение в R Б.1. Запуск и вывод справочной информации Б.2. Пакеты Б.З. Создание объектов Б.4. Типы данных и базовые структуры Б.5. Работа с прямоугольными наборами данных Б.6. Объекты и классы Б.7. Функции R Б.8. Три грани = Б.9. Пакет AppliedPredictiveModeling Б.10. Пакет caret Б.11. Пакеты, используемые в книге Приложение В. Рекомендуемые веб-сайты Слисок источников
Similar books
Computers and Intractability: A Guide to the Theory of NP-completeness
1979 · PDF
Exploring Abstract Algebra with Mathematica®
1999 · PDF
Computers and Intractability: A Guide to the Theory of NP-completeness
1979 · PDF
Introduction to Reversible Computing
2013 · PDF
Introduction to Algorithms
2009 · PDF
Codeless Data Structures and Algorithms: Learn DSA Without Writing a Single Line of Code
2020 · PDF
Introduction to Computational Origami: The World of New Computational Geometry
2020 · EPUB
Apache Spark 2 for Beginners
2016 · PDF