AI/ML · 27 сентября 2026, 14:26
SkyRL на SageMaker HyperPod: мультимодальное RL-обучение для навигации по лабиринту
AWS показала, как с помощью SkyRL и SageMaker HyperPod обучить визуально-языковую модель Qwen3-VL-8B проходить 2D-лабиринты методом GRPO. Доля решений на фиксированном наборе из 64 лабиринтов выросла с 43,75% до более чем 95%.
Компания Amazon опубликовала в AWS Machine Learning Blog пошаговое руководство по запуску мультимодального обучения с подкреплением на инфраструктуре SageMaker HyperPod с Amazon EKS. В качестве примера используется открытый фреймворк SkyRL и модель Qwen3-VL-8B, которую дообучают проходить визуальные лабиринты алгоритмом Group Relative Policy Optimization (GRPO). В качестве отправной точки применяется контрольная точка после supervised fine-tuning (VisGym SFT checkpoint).
В решении используется кластер HyperPod Ray с тремя GPU-воркерами на базе ml.g7e.12xlarge (по две NVIDIA RTX PRO 6000 Blackwell, всего 6 GPU) и CPU-узлом ml.r5d.16xlarge с 512 ГБ ОЗУ. Обучение и инференс (vLLM) размещаются на одних и тех же GPU, а обновления LoRA-адаптеров ранга 32 синхронизируются через общее хранилище Amazon FSx for Lustre, смонтированное в /shared.
Описывается весь цикл работы: сборка Docker-образа со SkyRL и VisGym, запуск Ray-кластера через SageMaker Studio, подготовка скрипта train_job.sh и удалённая отправка задач по протоколу sagemaker_ray:// без kubectl port-forward. Для мониторинга доступны Ray Dashboard и четыре предустановленных дашборда Amazon Managed Grafana (Ray Core, Ray Data, Ray Train, Ray Serve), которые автоматически разворачиваются через HyperPod Observability EKS add-on.
Каждые 10 шагов выполняется оценка на отложенном наборе из 64 лабиринтов, каждые 20 шагов сохраняется полный чекпойнт и Hugging Face-совместимый LoRA-адаптер. По данным авторов, точность прохождения достигла 75% примерно к шагу 100 и пика 96,875% (62 из 64) на шаге 160.
Готовый адаптер загружается в S3 и хостится через Ray Serve с динамической LoRA-загрузкой на базе образа AWS Deep Learning Container for Ray Serve LLM. Один эндпоинт обслуживает как базовую SFT-модель, так и GRPO-адаптер через идентификатор вида <base-model-id>:<adapter-name>. Доступ к адаптерам из S3 обеспечивается через Amazon EKS Pod Identity.
В конце приводятся инструкции по очистке созданных ресурсов и ссылки на документацию SageMaker HyperPod и руководство Ray on HyperPod.
Источник: AWS Machine Learning Blog