Все системы работают Ваш IP: 18.97.14.83 info@cloudhosting.lv +371 66 66 29 69 Личный кабинет
AI-серверы · GB10 Blackwell

AI-серверы: приватный искусственный интеллект на вашем железе

AI-сервер, который запускает приватную модель уровня ChatGPT на вашем железе: NVIDIA GB10 Blackwell, 128 GB VRAM, Llama 3.3 70B в полной точности для 10-20 пользователей. Запросы и документы не покидают вашу сеть.

  • Данные остаются на вашем железе
  • OpenAI-совместимый API и чат-интерфейс
  • У вас в офисе или в нашем ДЦ
AI-серверы
Оборудование

Выберите устройство

Оба устройства построены на одном и том же чипе GB10 Blackwell со 128 GB VRAM. Доставка по Риге включена в цену.

Самый популярный

NVIDIA GB10 Blackwell

€7410.00 разово

Под заказ

  • GB10 Blackwell
  • 128 GB VRAM
  • 4 TB NVMe
  • Поддержка кластера
  • Работает с Llama 3.3 70B в полной точности
  • 10-20 одновременных пользователей

Свяжитесь с нами

ASUS Ascent GX10 128GB

€5902.50 разово

В наличии: 50

  • GB10 Blackwell
  • 128 GB VRAM
  • 1 TB NVMe
  • Только одиночный узел
  • Работает с Llama 3.3 70B в полной точности
  • 10-20 одновременных пользователей

Свяжитесь с нами

Цены на оборудование указаны без 21% НДС. Доставка по Риге включена, в другие места по договорённости.

Ускорители

Сервер уже есть? Возьмите только карту

Тот же кремний NVIDIA, что мы ставим в свои машины, но отдельно. Выбирайте по памяти: именно она решает, какая модель поместится и сколько её останется на карте, а не поползёт через системную память.

NVIDIA L4 24GB

24 GB RAM
€3587.26разово Мало: 1

Тихая рабочая лошадка: один слот, 72 Вт, бездополнительного питания. Влезает практически в любой серверный корпус и спокойно тянет модель на 7-14B.

NVIDIA RTX PRO 4500 Blackwell 32GB

32 GB RAM
€3915.89разово В наличии: 15

Лучшая память за евро в середине линейки. Модель класса 30B помещается с запасом. Есть вентиляторы, поэтому её место в башне, а не в тонком сервере.

Самый популярный

NVIDIA L40S 48GB

48 GB RAM
€11700.00разово Доступно до 50 шт.

Карта, вокруг которой построено большинство платформ инференса. 48 ГБ берут модель на 70B в квантовании, охлаждение пассивное. Самый безопасный выбор, если не хотите сюрпризов.

NVIDIA RTX PRO 6000 96GB

96 GB RAM
€14609.89разово Под заказ

96 ГБ тянут модель на 70B в полном качестве или несколько поменьше разом. Пассивная, сделана под стойку, и дешевле, чем версия той же карты для рабочей станции.

NVIDIA H200 141GB NVL

141 GB RAM
€35750.00разово Под заказ

Верх линейки. 141 ГБ HBM3e с той пропускной способностью памяти, на которой и живут обучение и тяжёлый инференс. Заказывается под проект, а не лежит на складе.

Цены на карты указаны без 21% НДС. Наличие живое от нашего дистрибьютора: что на складе, уезжает сразу, остальное привозим в указанный срок. Скажите, какой у вас сервер, и мы подтвердим совместимость до оплаты.

Мы превращаем это в работающий сервис

Железо само по себе ещё не продукт. Внедрение превращает коробку в приватный сервис искусственного интеллекта, а управляемый план держит его быстрым, пропатченным и актуальным.

Внедрение

€5000.00 разово

  • Распаковка и настройка у вас или в нашем дата-центре
  • Развёртывание модели на vLLM или llama.cpp
  • OpenAI-совместимый API и чат-UI в вашей LAN/VPN
  • Опциональный RAG: Qdrant/pgvector, SharePoint и другое
  • Защита: API-ключи, журнал аудита, лимиты запросов
  • План бэкапов и аварийного восстановления

Управляемая эксплуатация

от €500.00 /мес

  • Мониторинг 24/7: загрузка GPU, VRAM, очередь, задержки
  • Патчи ОС и CUDA в ежемесячном окне обслуживания
  • Квартальное обновление моделей (Llama 4, Qwen 3...)
  • Ночная переиндексация RAG и тонкая настройка
  • Управление пользователями и доступом
  • 4 часа работы инженера каждый месяц

Зачем свой искусственный интеллект

По-настоящему приватно

Запросы, документы и эмбеддинги остаются на машине, которая принадлежит вам. Ничего не уходит сторонним AI-провайдерам.

Предсказуемая цена

Одна покупка железа вместо счетов за токены, растущих с каждым новым пользователем.

У вас или у нас

Работает в офисе в локальной сети или размещается в нашем рижском дата-центре с VPN-доступом для команды.

Стандартные интеграции

OpenAI-совместимый API означает, что существующие инструменты, SDK и плагины работают без изменений кода.

Соответствие

Счетам и договорам не место в публичном ИИ

Вставляя счета клиентов, договоры или кадровые документы в ChatGPT, Claude или другой публичный ИИ, вы передаёте персональные данные третьей стороне, часто за пределы ЕС. По GDPR для этого нужны правовое основание и договор обработки, а NIS2 требует отвечать за своих поставщиков. Свой GPT снимает проблему: данные не покидают оборудование, которое контролируете вы.

GDPR: данные остаются у вас

Запросы, документы и эмбеддинги обрабатываются на вашей машине: в офисе или в нашем дата-центре в Риге. Никакой передачи сторонним ИИ-сервисам и ничего, что пришлось бы объяснять регулятору.

NIS2: поставщики под контролем

Директива ЕС требует управлять рисками поставщиков. Одна машина в вашей собственности - короче список поставщиков, чем зарубежный ИИ-API, а мы обслуживаем её как европейский провайдер с полным комплектом документов.

Конфиденциальность по умолчанию

Счета, договоры, медицинские и кадровые документы работают в чате и RAG, не покидая вашей сети: сотрудники получают помощь ИИ без утечки данных клиентов.

Как это работает

  1. 1

    Оцениваем нагрузку

    Обсуждаем количество пользователей, модели и источники данных; вы выбираете устройство и место, где оно будет жить.

  2. 2

    Мы разворачиваем

    Железо приезжает, модель запускается за API и чат-интерфейсом, RAG подключается к вашим документам.

  3. 3

    Команда пользуется

    Сотрудники приватно работают со знаниями компании, а управляемый план держит модели и индексы свежими.

Где это работает

Наш собственный Tier 3+ дата-центр в Риге

Ваши сервисы работают на нашем оборудовании в Латвии, в юрисдикции ЕС. Второй регион в Нидерландах, Дубай планируется в 2026.

  • Резервирование питания и охлаждения N+1
  • Собственная сеть BGP с резервными аплинками
  • Мониторинг 24/7, инженеры на площадке с 9:00 до 17:00
  • GDPR и данные в ЕС

Подробнее

Дата-центр CloudHosting Tier 3+ в Риге

Вопросы о своём GPT

Можно ли работать с документами, где есть персональные данные?

Да, именно для этого решение и создано. Счета, договоры, кадровые и медицинские документы обрабатываются на оборудовании, которое принадлежит вам, поэтому персональные данные не передаются стороннему ИИ-сервису, и для самой модели не нужен отдельный договор обработки. Обработка остаётся внутри вашего периметра GDPR, а список поставщиков по NIS2 не удлиняется. Честная оговорка: вы по-прежнему остаётесь контролёром данных, поэтому внутренние правила доступа никуда не исчезают. Внедрение включает API-ключи, журнал аудита и лимиты запросов, так что вы можете документировать, кто, когда и о чём спрашивал модель. Если сомневаетесь насчёт конкретного типа документов, напишите в поддержку, и мы разберём этот случай до внедрения.

Какие нейросети он может запускать?

128 GB VRAM уверенно тянут Llama 3.3 70B в полной точности, то есть модель работает без потери качества, которую даёт квантование. Модели поменьше, такие как Qwen или Mistral, помещаются с большим запасом, и лёгкую модель можно выбрать тогда, когда скорость ответа важнее максимальной глубины. Модели разворачиваются на vLLM или llama.cpp, поэтому замена одной на другую остаётся рутинной операцией. В управляемом плане мы обновляем модели раз в квартал и подключаем свежие релизы вроде Llama 4 или Qwen 3 по мере выхода. Если не уверены, какая модель подходит под вашу задачу, напишите в поддержку, и мы подберём её вместе.

API действительно совместим с OpenAI?

Да. Сервис отдаёт стандартный chat-completions API в вашей LAN или VPN, поэтому библиотеки, SDK и плагины, написанные под эндпоинты OpenAI, работают после замены только базового URL и API-ключа. Существующие интеграции продолжают работать без изменений кода, ради этого мы и держимся стандартного интерфейса. Эндпоинт доступен только внутри вашей сети, а не из публичного интернета, и каждому приложению можно выдать отдельный ключ. Вместе с API вы получаете чат-интерфейс для сотрудников, которым достаточно задавать вопросы в браузере. Если в вашем стеке есть критичный инструмент, назовите его поддержке, и мы проверим его работу с эндпоинтом до внедрения.

Может ли он отвечать по нашим внутренним документам?

Да. Опциональный RAG связывает модель с вашими знаниями. Документы из источников вроде SharePoint превращаются в эмбеддинги и хранятся в Qdrant или pgvector на той же машине, поэтому индекс тоже не покидает вашу сеть. Когда сотрудник задаёт вопрос, система находит подходящие фрагменты, и модель отвечает по ним, а не угадывает. В управляемом плане индекс перестраивается каждую ночь, поэтому вчерашние правки появляются в ответах, а мы донастраиваем поиск по мере роста контента. Честно скажем: качество ответов зависит от того, насколько аккуратно ведутся сами документы. Перечислите ваши источники при запросе расчёта, и мы подтвердим, что из них можно подключить.

Где размещается оборудование?

У устройства два возможных дома. Оно может стоять у вас в офисе, где сотрудники обращаются к нему по локальной сети и работа не зависит от интернет-подключения, либо размещаться в нашем собственном дата-центре уровня Tier 3+ в Риге, куда команда подключается по VPN. В обоих случаях оборудование остаётся вашей собственностью, и всё, что на нём хранится, включая модели, индексы и журналы, принадлежит вам. Раз коробка ваша, можно начать в офисе и позже переехать в дата-центр или наоборот. Доставка по Риге включена в покупку, доставку в другие места согласуем отдельно, поэтому при запросе расчёта укажите ваше местоположение.

Обязателен ли управляемый план?

Нет, управляемый план не обязателен. Уже само внедрение передаёт вам готовый защищённый сервис с планом бэкапов и аварийного восстановления, и с первого дня вы можете обслуживать его сами. Только честно оцените, что это значит: кому-то на вашей стороне придётся следить за загрузкой GPU и задержками, ставить патчи ОС и CUDA и самостоятельно обновлять модели. Управляемый план от 500 EUR в месяц снимает именно эту работу и добавляет 4 часа инженера каждый месяц на изменения и запросы. Можно начать своими силами и подключить план позже, если обслуживание окажется в тягость: достаточно написать в поддержку, и мы его включим.

Сколько стоит свой GPT-сервер?

Считайте цену из трёх частей. Первая часть, оборудование: покупается один раз, актуальные цены устройств указаны на этой странице без 21% НДС. Вторая часть, внедрение за 5000 EUR разово: оно покрывает развёртывание, защиту и запуск API с чат-интерфейсом. Третья часть, опциональный управляемый план от 500 EUR в месяц. Платы за токены нет, поэтому ежемесячные расходы не растут, когда вы подключаете новых пользователей или команда начинает работать с сервисом интенсивно. Если подходящий сервер у вас уже есть, дешевле может выйти отдельная карта-ускоритель. Точную сумму для вашего случая мы назовём в расчёте и распишем её по позициям, запросите его через страницу или поддержку.

Сколько человек могут работать одновременно?

Одно устройство GB10 со 128 GB VRAM обслуживает 10-20 одновременных пользователей на Llama 3.3 70B в полной точности. Одновременными считаются те, кто отправляет запросы в один и тот же момент, поэтому общее число учётных записей может быть заметно больше: в обычном офисе в каждый момент в чате сидит лишь часть сотрудников. Если пиковая нагрузка для вас важнее максимального качества ответов, модель поменьше оставит больше запаса. Когда команда действительно перерастает одну коробку, устройство NVIDIA GB10 поддерживает кластер: мощность наращивается добавлением узлов, а не заменой купленного. Назовите численность и ожидаемую нагрузку на этапе оценки, и мы предложим подходящую конфигурацию.

Чем NVIDIA GB10 отличается от ASUS GX10?

В работе модели разницы нет: оба устройства построены на одном и том же чипе GB10 Blackwell со 128 GB VRAM, поэтому скорость инференса и набор помещающихся моделей одинаковы. Отличия касаются всего остального вокруг чипа. У версии NVIDIA 4 TB NVMe и поддержка кластера, у ASUS Ascent GX10 1 TB и только одиночный узел. На практике объём хранилища важен, когда на коробке лежат несколько моделей и растущий индекс RAG, а кластер нужен лишь тем, кто планирует позже добавлять узлы. Небольшой стабильной команде устройства ASUS вполне достаточно. Внедрение и управляемый план для обоих одинаковы, доставка по Риге включена в обоих случаях.

Готовы начать?

Запустите за минуты или обсудите с инженером, что подходит вашему проекту.