Содержание
Llama 3.1 70B в формате FP16 занимает около 140 ГБ видеопамяти. Ни одна игровая карта столько не даёт, поэтому спор «4090 или 5090» решается не мощностью, а тем, какие модели вы гоняете и сколько готовы платить за каждый гигабайт VRAM. Разница в цене между картами доходит до 150 тысяч рублей, и окупается она далеко не всегда. Многие команды перед покупкой арендуют обе карты в облаке ml.cloud и сравнивают на своих задачах, а не на чужих бенчмарках.
Короткий ответ: какую карту брать под AI
RTX 5090 стоит брать, если вы обучаете модели, запускаете LLM от 30B параметров или генерируете видео. RTX 4090 хватает для инференса моделей до 13B, fine-tuning через LoRA и Stable Diffusion. Всё остальное — нюансы бюджета и питания.
Разница между поколениями заметна уже в спецификациях. У RTX 5090 32 ГБ GDDR7 против 24 ГБ GDDR6X, 21 760 CUDA-ядер против 16 384 и тензорные ядра пятого поколения с поддержкой FP4. Архитектура Blackwell сменила Ada Lovelace, а рекомендованная цена выросла с 1599 до 1999 долларов.
Восемь гигабайт памяти звучат скромно. На практике это граница между «модель помещается» и «модель уходит в оффлоад на CPU с падением скорости в десять раз». Qwen2.5-32B в квантизации Q4 весит около 19 ГБ, и на 4090 остаётся пять гигабайт под контекст. На 5090 свободных 13 ГБ хватит на контекст в 32 тысячи токенов.
Не спешите закрывать вопрос спецификациями. Если рабочая нагрузка — это Mistral 7B, Whisper и пара SDXL-пайплайнов, переплата за 5090 не даст ничего, кроме красивых цифр в nvidia-smi. Дальше разберём, где новинка отрабатывает каждый рубль.

Память и пропускная способность: где 5090 реально уходит вперёд
Главный выигрыш 5090 в инференсе LLM даёт не число ядер, а пропускная способность памяти: 1792 ГБ/с против 1008 ГБ/с у 4090. Генерация токенов упирается именно в скорость чтения весов из VRAM.
Каждый новый токен требует прогнать через модель все её веса. Для Llama 3.1 8B в Q4 это примерно 5 ГБ на токен, и 4090 физически прочитает их не чаще 200 раз в секунду. У 5090 потолок выше на 78%, что в тестах llama.cpp превращается в рост со 140-150 до 220-240 токенов в секунду на той же модели.
Что это даёт в деньгах? Один разработчик из телеграм-чата про локальные LLM собрал RAG-ассистента для юридической фирмы на Qwen2.5-14B. На 4090 ответ на запрос с контекстом 8K занимал 11 секунд, на 5090 — 6,5. Юристы перестали открывать ChatGPT параллельно, и проект прошёл приёмку.
Отдельная история — генерация видео. Wan 2.1 на 14B параметров и HunyuanVideo в FP16 требуют 26-30 ГБ и на 4090 запускаются только с агрессивным квантованием или разбиением по блокам. Здесь 32 ГБ 5090 не ускорение, а сама возможность работать.

Обучение и fine-tuning: сколько времени экономит Blackwell
В задачах обучения RTX 5090 быстрее RTX 4090 на 30-50% в зависимости от точности вычислений. В FP8 и особенно FP4 отрыв растёт, в классическом FP16 держится ближе к нижней границе.
Полный fine-tuning даже 7B-модели на одной потребительской карте нереален: веса, градиенты и состояния оптимизатора Adam съедают около 112 ГБ. Поэтому на практике речь идёт о LoRA и QLoRA, где обучаются лишь адаптеры. QLoRA на Llama 3.1 8B помещается в 24 ГБ с батчем 4, а на 5090 батч можно поднять до 8 без градиентного чекпоинтинга.
Возьмём типовой прогон: дообучение 8B-модели на датасете из 50 тысяч диалогов, три эпохи. На 4090 это 9-10 часов, на 5090 около 6. Экономия трёх часов на итерации в проекте с двадцатью итерациями превращается в полторы рабочие недели.
Перед выбором стоит честно ответить на три вопроса:
- сколько экспериментов с обучением вы запускаете в месяц;
- какие форматы точности поддерживает ваш стек (FP4 в Blackwell даёт выигрыш только с TensorRT-LLM и свежим PyTorch);
- нужен ли батч больше четырёх для стабильной сходимости.
Если на первый вопрос ответ «пять», 4090 справится. Если «пятьдесят», разница в скорости окупит карту за квартал.

Питание, охлаждение и сборка: скрытые расходы
RTX 5090 потребляет до 575 Вт против 450 Вт у 4090, и это тянет за собой замену блока питания, а иногда и корпуса. Бюджет на апгрейд редко ограничивается ценой самой карты.
NVIDIA рекомендует для 5090 блок питания от 1000 Вт, а с учётом Ryzen 9 или Core i9 под нагрузкой разумнее брать 1200 Вт. Для 4090 достаточно 850 Вт. Качественный блок ATX 3.1 на 1200 Вт стоит 25-35 тысяч рублей, и его придётся добавить к смете.
Разъём 12V-2×6 остался прежним, и истории с оплавленными коннекторами перекочевали из поколения в поколение. Причина почти всегда одна: кабель вставлен не до щелчка. На 575 Вт запас по току меньше, чем на 450, поэтому проверять посадку кабеля нужно каждый раз после переноса системного блока.
Тепло тоже нужно куда-то девать. Под полной нагрузкой в обучении 5090 отдаёт в комнату примерно как масляный обогреватель на минимальной мощности. Для домашнего кабинета летом это ощутимо, для серверной с кондиционером — нет. Founders Edition при этом стала двухслотовой, а партнёрские версии от ASUS и MSI занимают 3,5-4 слота и не влезают в компактные корпуса.
Цена, окупаемость и облачная альтернатива
Новая RTX 5090 в России обходится в полтора-два раза дороже RTX 4090, которую NVIDIA сняла с производства ещё в конце 2024 года. Рынок 4090 теперь в основном вторичный, и это меняет расчёт.
Считайте не цену карты, а стоимость GPU-часа. Если 5090 стоит 350 тысяч и работает по 8 часов в день, за два года выйдет около 60 рублей в час без учёта электричества. Карта, которая простаивает половину недели, стоит вдвое дороже в пересчёте на реальную работу.
Есть сценарии, где покупка проигрывает аренде:
- Проект длится 2-3 месяца, а дальше карта будет пылиться.
- Нужно временно больше памяти, например 80 ГБ на одном ускорителе для 70B-модели.
- Команда распределённая, и физическую карту не поставить в одно место.
В каждом из этих случаев выгоднее взять GPU-сервер в ml.cloud на нужный срок: платите за часы работы, а не за железо, и можете переключиться с 4090 на 5090 или A100 за минуты. Ещё один рабочий приём: прогнать свою модель на арендованных 4090 и 5090 сутки, снять метрики и только потом решать, что покупать. Сутки теста стоят дешевле ошибки в выборе на 150 тысяч.