В высокочастотном трейдинге задержка инференса в 50 мс может превратить прибыльную стратегию в убыточную из-за проскальзывания цены на 0.02-0.05%. Сравнение CatBoost и LightGBM показывает, что выбор между ними — это всегда компромисс между скоростью переобучения модели и временем генерации одного сигнала.
Скорость инференса: борьба за миллисекунды
При работе в режиме реального времени критически важно время получения предсказания (inference time). В тестах на датасете из 500 признаков (технические индикаторы + стакан) LightGBM демонстрирует среднее время отклика в 1.2–2.5 мс на одну строку данных. CatBoost в стандартном режиме работает медленнее — около 3.5–6 мс, однако при конвертации модели в формат C++ или использование GPU-инференса этот показатель снижается до 0.8–1.5 мс.
Кейс: при торговле скальперскими стратегиями на таймфрейме 1 минута разница в 2 мс незаметна, но при работе с арбитражем между площадками задержка в 4 мс приводит к потере исполнения сделки в 15% случаев. Моя оценка: для чистого инференса на CPU LightGBM выигрывает, но CatBoost догоняет его при глубокой оптимизации среды исполнения.
Скорость обучения и итеративное обновление
В алготрейдинге модели требуют регулярного переобучения (retraining) для адаптации к смене рыночного режима. LightGBM обучается значительно быстрее за счет алгоритма GOSS (Gradient-based One-Side Sampling), который позволяет сократить время обучения на 30-50% без существенной потери точности. На выборке из 1 млн строк данных обучение LightGBM занимает около 12-15 минут, тогда как CatBoost требует 25-40 минут.
Однако CatBoost эффективнее работает с категориальными признаками «из коробки». Если в стратегии используются сектора экономики или типы ордеров, LightGBM требует предварительного One-Hot Encoding, что раздувает размер матрицы признаков в 2-5 раз и нивелирует его преимущество в скорости. Вывод: если данных много и они числовые — выбирайте LightGBM; если много категорий — CatBoost сэкономит время на препроцессинге.
Производительность в модели Инвестор v.1.2.1
В архитектуре модели Инвестор v.1.2.1 мы внедрили гибридный подход. Для быстрого сканирования рынка (фильтрация 100+ тикеров) используется LightGBM, который отсекает 80% неперспективных активов за доли секунды. Затем в дело вступает CatBoost для финального принятия решения по топ-20 активам, где требуется максимальная точность учета нелинейных зависимостей.
Практика показала, что такая связка сокращает общие вычислительные затраты на 40% по сравнению с использованием только CatBoost, сохраняя точность прогноза на уровне 62-65% по метрике Precision. Это позволяет системе генерировать сигналы в течение 100 мс после закрытия свечи, что критично для волатильных бумаг.
Потребление памяти и нагрузка на CPU
LightGBM крайне экономен в плане RAM, что позволяет запускать десятки моделей на одном VPS с 16 ГБ памяти. CatBoost более требователен, особенно при использовании встроенного метода обработки категориальных признаков, что может привести к скачкам потребления памяти до 8-12 ГБ при обучении на глубоких выборках. Это создает риск падения торгового терминала (OOM killer) в самый ответственный момент.
Для минимизации рисков в режиме реального времени рекомендуется использовать квантование весов или экспорт модели в ONNX. Это снижает потребление памяти в 3-4 раза и ускоряет инференс. Мой опыт: переход на ONNX-формат для CatBoost сократил время отклика с 5 мс до 1.1 мс, сделав его конкурентоспособным с LightGBM.
Вывод
Для стратегий с ультра-низкой задержкой и простыми числовыми данными однозначно выбирайте LightGBM. Однако для комплексных систем, где важна точность работы с категориями и есть возможность оптимизации через C++/ONNX, CatBoost является более мощным инструментом. Моя рекомендация: начните с LightGBM для прототипирования и быстрого перебора гипотез, но внедряйте CatBoost в финальный продакшн-цикл модели Инвестор v.1.2.1 для повышения качества сигналов, предварительно оптимизировав инференс через экспорт в бинарный формат.
