
В 2017 году Яндекс открыл доступ к библиотеке градиентного бустинга CatBoost. Её отличительная черта — умение напрямую работать с категориальными признаками, без предварительного One-Hot или Label Encoding.
Показано 3 программы



| Программа | Школа | Срок | Стоимость |
|---|---|---|---|
| Профессия Data Scientist | Слёрм | 3 месяца | 35 000 ₽ |
| Инженер машинного обучения: курс для IT-специалистов | Нетология | 11 месяцев | 117 600 ₽ вместо 237 600 ₽ |
| ML-инженер с опытом | Яндекс Практикум | 4 месяца | 145 000 ₽ |
При стандартных настройках она нередко показывает более высокую точность, чем XGBoost и LightGBM даже после длительной настройки параметров.
Отдельные учебные программы, целиком посвящённые только этой библиотеке, на рынке онлайн-образования встречаются редко. Обычно бустинг изучают в рамках более широких курсов по машинному обучению и Data Science, выделяя на него один-два модуля после разбора решающих деревьев и ансамблей. В данной подборке представлены 3 курса от 3 школ, где CatBoost включён в учебный план. Цены варьируются от 35 000 ₽ до 145 000 ₽, медианная цена составляет 117 600 ₽.
Если требуется не полная профессия, а конкретный навык, стоит обратить внимание на более обширные разделы: курсы по машинному обучению и курсы по Data Science — там выбор значительно больше.
Все три инструмента преследуют одну цель: создать ансамбль решающих деревьев, где каждое последующее дерево корректирует ошибки предыдущих. Отличия кроются в деталях, и на реальных задачах они становятся ощутимыми.
CatBoost способен обрабатывать категориальные признаки без предварительной подготовки: город, тип клиента или категорию товара можно передать модели в виде строки, и библиотека самостоятельно вычислит целевые статистики, используя упорядоченное кодирование. Этот метод был описан авторами в статье «CatBoost: unbiased boosting with categorical features», представленной на NeurIPS 2018. Благодаря такому подходу снижается риск утечки таргета, из-за которой простое кодирование средним значением часто приводит к переобучению.
В XGBoost категории необходимо кодировать заранее, зато он предоставляет больше возможностей для регуляризации. LightGBM выигрывает в скорости на очень широких данных благодаря стратегии роста деревьев по листьям. На табличных данных с большим количеством категорий CatBoost обычно с самого начала показывает более высокие результаты без каких-либо изменений параметров — это его главный практический аргумент.
Табличные данные остаются востребованными, и в ситуациях, где нейросети избыточны, бустинг остаётся ключевым инструментом. Градиентный бустинг регулярно превосходит как линейные модели, так и глубокое обучение.
Яндекс сам применяет CatBoost в поиске, сервисе «Погода» и в Алисе. При этом библиотека остаётся открытой: исходный код и документация доступны на catboost.ai и в разделе технологий Яндекса.
Установка библиотеки выполняется одной командой pip install catboost, а первая модель обучается всего за пять строк кода. Основная сложность заключается не в API.
Для эффективного использования бустинга необходима прочная база: уверенное владение Python, знание Pandas для подготовки данных, Scikit-learn для валидации и расчёта метрик, а также понимание сути переобучения и необходимости отложенной выборки. Без этого настройка depth и learning_rate превращается в беспорядочный перебор.
В программах по машинному обучению ансамбли деревьев обычно выделяются в отдельный блок после линейных моделей: сначала идёт решающее дерево и случайный лес, затем раскрывается идея бустинга, и завершается практикой на одной из трёх библиотек. Объём внимания, уделяемого именно CatBoost, зависит от конкретной школы: где-то это полноценный проект на соревновательном датасете, а где-то одна лекция, посвящённая сравнению трёх библиотек.
При выборе программы стоит обращать внимание на состав практических заданий, а не на перечень упомянутых инструментов. Работа с реальными табличными данными, кросс-валидация, подбор гиперпараметров и анализ ошибок модели дают гораздо больше пользы, чем простое перечисление технологий в рекламных материалах. Полный список программ доступен в разделах машинного обучения и профессии Data Scientist.
