Проект HAMi для виртуализации ускорителей перешел в инкубатор CNCF
Зачастую дорогие графические процессоры фрагментируются и простаивают. Классическая проблема — задача забирает видеокарту целиком, хотя в действительности использует лишь малую часть ее ресурсов. Как в таком случае эффективно распоряжаться кластером? Не забываем, что оборудование поставляется разными вендорами, каждый из которых предлагает свою модель управления.
Проблему оркестрации для таких случаев берет на себя HAMi (Heterogeneous AI Computing Virtualization Middleware) — решение с открытым исходным кодом для виртуализации GPU в Kubernetes. На днях проект получил статус Incubating в экосистеме Cloud Native Computing Foundation (CNCF).
С точки зрения платформенной команды, HAMi — это инструмент, который позволяет выжать максимум из железа без переписывания кода приложений и изменения манифестов Kubernetes.
Вместо того чтобы отдавать карту монопольно, HAMi позволяет «нарезать» физический GPU (а также NPU, DCU, MLU и другие ускорители) на доли по объему памяти, вычислительным ядрам или количеству устройств. При этом обеспечивается жесткая изоляция ресурсов.
Ключевое отличие от конкурентов — архитектура, поддерживающая множество вендоров. Обычно инструменты — например, device plugins — строятся вокруг экосистемы конкретного производителя. HAMi же предоставляет единый унифицированный интерфейс для гетерогенного парка железа и умеет планировать поды, используя политики с учетом топологии, а также продвинутые стратегии — например, «максимальное уплотнение» и «равномерное распределение».
Новые GPU в облаке Selectel от 132,18 ₽/час
Видеокарты для ресурсоемких задач — NVIDIA® H200, RTX™ 6000 Pro.
Подробнее →
С момента попадания в Sandbox в августе 2024 года, проект показал взрывной рост. В разработке участвуют более 550
Читать на habr.com
