Рекомендуемые модели и ресурсы для GPU

В этой статье описывается рекомендуемое количество ресурсов, необходимое виртуальной машине при использовании того или иного GPU. Также в статье кратко описываются возможности и запускаемые модели для того или иного GPU, которые доступны для аренды.

RTX PRO 6000 Blackwell
Крайне производительный GPU, позволяет запускать модели масштаба Llama 70B. Может работать с несколькими моделями одновременно и поддерживает файнтюнинг крупных языковых моделей.

Задача Модели
Инференс LLM Llama 3.3 70B (FP8), Qwen3 72B (FP8),
DeepSeek-R1 70B (Q4/Q8), Mixtral 8x22B (Q4)
Файнтюнинг LoRA/QLoRA до 70B, SFT/RLHF до 30B на полной точности
Генерация изображений Flux.1 Dev FP16, SDXL + ControlNet + несколько LoRA, SD 3.5 Large FP16

 

Рекомендуемые ресурсы для ВМ при использовании RTX PRO 6000 Blackwell:

vCPU RAM
16-32  128-256 GB

 

 

GA100
Карта изначально создана для майнинга, при разблокировке является аналогом A100, поскольку появляются FP32, FP16 и другие режимы вычислений, также разблокируется и память этой GPU. В таком режиме возможны инференс моделей среднего масштаба, задачи компьютерного зрения и файнтюнинг небольших моделей

Задача Модели
Инференс LLM Llama 3.3 70B Q4, Qwen3 72B Q3, QwQ 32B FP8
Файнтюнинг LoRA/QLoRA до 13B
Генерация изображений Flux.1 FP8, SDXL FP16, SD 3.5 Medium FP8
NLP BERT large, bge-large, e5-large
Компьютерное зрение YOLO v8, EfficientDet, Mask R-CNN

 

Рекомендуемые ресурсы для ВМ при использовании GA100:

vCPU RAM
8-16 32-64 GB

 

 

RTX 6000 Ada
Мощная карта с ECC видеопамятью. Карта справляется с инференсом моделей до 70B в квантизации, файнтюнингом средних и крупных моделей, а также генерацией изображений.

Задача Модели
Инференс LLM Qwen3 72B, DeepSeek-R1 32B FP16
Файнтюнинг QLoRA, Llama 3.1 70B
Генерация изображений Flux.1 FP8 + ControlNet + IP-Adapter, SDXL полный стек, SD 3.5 Large FP16

 

Рекомендуемые ресурсы для ВМ при использовании RTX 6000 Ada:

vCPU RAM
12-24 64-96 GB

 

 

GeForce RTX 5090
Самая мощная из потребительских карт в настоящее время. Позволяет запускать модели до 32B без квантизации. Хорошо подходит для локальной разработки и тестирования, генерация изображений выполняется с высокой скоростью.

Задача Модели
Инференс LLM Gemma 4 31B FP16, DeepSeek-R1 32B FP16,
Qwen3 30B-A3B FP16, Mistral Small 24B FP16
Инференс LLM (квантизация) Qwen3 72B Q3/Q4, Llama 3.3 70B Q3
Файнтюнинг QLoRA до 30B, LoRA до 13B на FP16
Генерация изображений Flux.1 FP8, SDXL FP16, SD 3.5 Large FP8

 

Рекомендуемые ресурсы для ВМ при использовании GeForce RTX 5090:

vCPU RAM
12-24 64-128 GB

 

 

GeForce RTX 4090
Один из лучших вариантов по соотношению цены и возможностей. 24 ГБ памяти достаточно для инференса моделей до 14B, файнтюнинга небольших моделей и генерации изображений.

Задача Модели
Инференс LLM Phi-4 14B FP16, Mistral Small 24B Q5, Qwen3 14B FP16,
Gemma 3 27B Q4
Инференс LLM (квантизация) DeepSeek-R1 32B Q4, Qwen3 30B-A3B Q4
Файнтюнинг QLoRA до 13B, LoRA до 7B на FP16, DreamBooth SDXL
Генерация изображений Flux.1 FP8, SDXL + ControlNet + LoRA, SD 3.5 Medium FP16

 

Рекомендуемые ресурсы для ВМ при использовании GeForce RTX 4090:

vCPU RAM
8-16 32-64 GB

 

 

Tesla V100
Серверная карта, которая успешно справляется с обучением и файнтюнингом классических моделей.
Может использоваться для задач компьютерного зрения, генерации изображений, является хорошим вариантом для повседневных ML-задач.

Задача Модели
Инференс LLM Llama 3.1 8B, Mistral 7B FP16, Phi-4 14B Q5
Инференс LLM (квантизация) Qwen2.5 14B Q4, Qwen2.5 32B Q4
Обучение/Файнтюнинг BERT Large, RoBERTa, GPT-2 XL, T5-large, LoRA до 7B
Генерация изображений SD 1.5 / SD 2.1

 

Рекомендуемые ресурсы для ВМ при использовании Tesla V100:

vCPU RAM
8-16 32-64 GB

 

 

Tesla P100
Карта способна выполнять инференс небольших моделей, генерация изображений работает медленнее, может подойти для задач начального уровня.

Задача Модели
Инференс LLM Mistral 7B Q4, Phi-4-mini 3.8B Q5, Qwen2.5 7B Q4
NLP BERT base / large, DistilBERT, T5-base, RoBERTa
Генерация изображений SD 1.5, SDXL

 

Рекомендуемые ресурсы для ВМ при использовании Tesla P100:

vCPU RAM
4-8 16-32 GB

 

 

Tesla M60
GPU может выполнять инференс только самых небольших моделей до 3–4 миллиардов параметров. Генерация изображений ограничена базовыми настройками.

Задача Модели
Инференс LLM Phi-4-mini 3.8B Q4, Llama 3.2 3B Q6,
Gemma 3 4B Q4
NLP BERT base, DistilBERT, TinyBERT
Компьютерное зрение ResNet-18/34, MobileNet, YOLO v5n (nano)
Генерация изображений SD 1.5

 

Рекомендуемые ресурсы для ВМ при использовании Tesla M60:

vCPU RAM
4-8 2-4 GB

 

  • 1 用戶發現這個有用
這篇文章有幫助嗎?

相關文章

Диагностика проблем со скоростью Интернет

Периодически у пользователей встречаются проблемы, когда скорость загрузки с какого-либо...

Cloud4Y RDP Connect to Terminal Mini-HowTo

Как подключится к рабочему терминальному серверу Компании Для работы в корпоративных системах...

Интерактивная схема по категориям

В данной статье располагается интерактиваня схема для поиска ответа на часто задаваемые вопросы....

Как открыть тикет в техническую поддержку?

Создание тикетов является основным способом обращения в техническую поддержку Cloud4Y. Несмотря...

Расширенный вопросник по производительности при подаче заявки в тикет-систему

Расширенные вопросы и проблемы с производительностью. В случае, если вы замечаете какие-то...