NVIDIA L4 24GB
Тихая рабочая лошадка: один слот, 72 Вт, бездополнительного питания. Влезает практически в любой серверный корпус и спокойно тянет модель на 7-14B.
AI-сервер, который запускает приватную модель уровня ChatGPT на вашем железе: NVIDIA GB10 Blackwell, 128 GB VRAM, Llama 3.3 70B в полной точности для 10-20 пользователей. Запросы и документы не покидают вашу сеть.
Оба устройства построены на одном и том же чипе GB10 Blackwell со 128 GB VRAM. Доставка по Риге включена в цену.
€7410.00 разово
Под заказ
€5902.50 разово
В наличии: 50
Цены на оборудование указаны без 21% НДС. Доставка по Риге включена, в другие места по договорённости.
Тот же кремний NVIDIA, что мы ставим в свои машины, но отдельно. Выбирайте по памяти: именно она решает, какая модель поместится и сколько её останется на карте, а не поползёт через системную память.
Тихая рабочая лошадка: один слот, 72 Вт, бездополнительного питания. Влезает практически в любой серверный корпус и спокойно тянет модель на 7-14B.
Лучшая память за евро в середине линейки. Модель класса 30B помещается с запасом. Есть вентиляторы, поэтому её место в башне, а не в тонком сервере.
Карта, вокруг которой построено большинство платформ инференса. 48 ГБ берут модель на 70B в квантовании, охлаждение пассивное. Самый безопасный выбор, если не хотите сюрпризов.
96 ГБ тянут модель на 70B в полном качестве или несколько поменьше разом. Пассивная, сделана под стойку, и дешевле, чем версия той же карты для рабочей станции.
Верх линейки. 141 ГБ HBM3e с той пропускной способностью памяти, на которой и живут обучение и тяжёлый инференс. Заказывается под проект, а не лежит на складе.
Цены на карты указаны без 21% НДС. Наличие живое от нашего дистрибьютора: что на складе, уезжает сразу, остальное привозим в указанный срок. Скажите, какой у вас сервер, и мы подтвердим совместимость до оплаты.
Железо само по себе ещё не продукт. Внедрение превращает коробку в приватный сервис искусственного интеллекта, а управляемый план держит его быстрым, пропатченным и актуальным.
€5000.00 разово
от €500.00 /мес
Запросы, документы и эмбеддинги остаются на машине, которая принадлежит вам. Ничего не уходит сторонним AI-провайдерам.
Одна покупка железа вместо счетов за токены, растущих с каждым новым пользователем.
Работает в офисе в локальной сети или размещается в нашем рижском дата-центре с VPN-доступом для команды.
OpenAI-совместимый API означает, что существующие инструменты, SDK и плагины работают без изменений кода.
Вставляя счета клиентов, договоры или кадровые документы в ChatGPT, Claude или другой публичный ИИ, вы передаёте персональные данные третьей стороне, часто за пределы ЕС. По GDPR для этого нужны правовое основание и договор обработки, а NIS2 требует отвечать за своих поставщиков. Свой GPT снимает проблему: данные не покидают оборудование, которое контролируете вы.
Запросы, документы и эмбеддинги обрабатываются на вашей машине: в офисе или в нашем дата-центре в Риге. Никакой передачи сторонним ИИ-сервисам и ничего, что пришлось бы объяснять регулятору.
Директива ЕС требует управлять рисками поставщиков. Одна машина в вашей собственности - короче список поставщиков, чем зарубежный ИИ-API, а мы обслуживаем её как европейский провайдер с полным комплектом документов.
Счета, договоры, медицинские и кадровые документы работают в чате и RAG, не покидая вашей сети: сотрудники получают помощь ИИ без утечки данных клиентов.
Обсуждаем количество пользователей, модели и источники данных; вы выбираете устройство и место, где оно будет жить.
Железо приезжает, модель запускается за API и чат-интерфейсом, RAG подключается к вашим документам.
Сотрудники приватно работают со знаниями компании, а управляемый план держит модели и индексы свежими.
Ваши сервисы работают на нашем оборудовании в Латвии, в юрисдикции ЕС. Второй регион в Нидерландах, Дубай планируется в 2026.
Инструкции по AI-агентам, приватным моделям и self-hosted AI от нашей команды.
Да, именно для этого решение и создано. Счета, договоры, кадровые и медицинские документы обрабатываются на оборудовании, которое принадлежит вам, поэтому персональные данные не передаются стороннему ИИ-сервису, и для самой модели не нужен отдельный договор обработки. Обработка остаётся внутри вашего периметра GDPR, а список поставщиков по NIS2 не удлиняется. Честная оговорка: вы по-прежнему остаётесь контролёром данных, поэтому внутренние правила доступа никуда не исчезают. Внедрение включает API-ключи, журнал аудита и лимиты запросов, так что вы можете документировать, кто, когда и о чём спрашивал модель. Если сомневаетесь насчёт конкретного типа документов, напишите в поддержку, и мы разберём этот случай до внедрения.
128 GB VRAM уверенно тянут Llama 3.3 70B в полной точности, то есть модель работает без потери качества, которую даёт квантование. Модели поменьше, такие как Qwen или Mistral, помещаются с большим запасом, и лёгкую модель можно выбрать тогда, когда скорость ответа важнее максимальной глубины. Модели разворачиваются на vLLM или llama.cpp, поэтому замена одной на другую остаётся рутинной операцией. В управляемом плане мы обновляем модели раз в квартал и подключаем свежие релизы вроде Llama 4 или Qwen 3 по мере выхода. Если не уверены, какая модель подходит под вашу задачу, напишите в поддержку, и мы подберём её вместе.
Да. Сервис отдаёт стандартный chat-completions API в вашей LAN или VPN, поэтому библиотеки, SDK и плагины, написанные под эндпоинты OpenAI, работают после замены только базового URL и API-ключа. Существующие интеграции продолжают работать без изменений кода, ради этого мы и держимся стандартного интерфейса. Эндпоинт доступен только внутри вашей сети, а не из публичного интернета, и каждому приложению можно выдать отдельный ключ. Вместе с API вы получаете чат-интерфейс для сотрудников, которым достаточно задавать вопросы в браузере. Если в вашем стеке есть критичный инструмент, назовите его поддержке, и мы проверим его работу с эндпоинтом до внедрения.
Да. Опциональный RAG связывает модель с вашими знаниями. Документы из источников вроде SharePoint превращаются в эмбеддинги и хранятся в Qdrant или pgvector на той же машине, поэтому индекс тоже не покидает вашу сеть. Когда сотрудник задаёт вопрос, система находит подходящие фрагменты, и модель отвечает по ним, а не угадывает. В управляемом плане индекс перестраивается каждую ночь, поэтому вчерашние правки появляются в ответах, а мы донастраиваем поиск по мере роста контента. Честно скажем: качество ответов зависит от того, насколько аккуратно ведутся сами документы. Перечислите ваши источники при запросе расчёта, и мы подтвердим, что из них можно подключить.
У устройства два возможных дома. Оно может стоять у вас в офисе, где сотрудники обращаются к нему по локальной сети и работа не зависит от интернет-подключения, либо размещаться в нашем собственном дата-центре уровня Tier 3+ в Риге, куда команда подключается по VPN. В обоих случаях оборудование остаётся вашей собственностью, и всё, что на нём хранится, включая модели, индексы и журналы, принадлежит вам. Раз коробка ваша, можно начать в офисе и позже переехать в дата-центр или наоборот. Доставка по Риге включена в покупку, доставку в другие места согласуем отдельно, поэтому при запросе расчёта укажите ваше местоположение.
Нет, управляемый план не обязателен. Уже само внедрение передаёт вам готовый защищённый сервис с планом бэкапов и аварийного восстановления, и с первого дня вы можете обслуживать его сами. Только честно оцените, что это значит: кому-то на вашей стороне придётся следить за загрузкой GPU и задержками, ставить патчи ОС и CUDA и самостоятельно обновлять модели. Управляемый план от 500 EUR в месяц снимает именно эту работу и добавляет 4 часа инженера каждый месяц на изменения и запросы. Можно начать своими силами и подключить план позже, если обслуживание окажется в тягость: достаточно написать в поддержку, и мы его включим.
Считайте цену из трёх частей. Первая часть, оборудование: покупается один раз, актуальные цены устройств указаны на этой странице без 21% НДС. Вторая часть, внедрение за 5000 EUR разово: оно покрывает развёртывание, защиту и запуск API с чат-интерфейсом. Третья часть, опциональный управляемый план от 500 EUR в месяц. Платы за токены нет, поэтому ежемесячные расходы не растут, когда вы подключаете новых пользователей или команда начинает работать с сервисом интенсивно. Если подходящий сервер у вас уже есть, дешевле может выйти отдельная карта-ускоритель. Точную сумму для вашего случая мы назовём в расчёте и распишем её по позициям, запросите его через страницу или поддержку.
Одно устройство GB10 со 128 GB VRAM обслуживает 10-20 одновременных пользователей на Llama 3.3 70B в полной точности. Одновременными считаются те, кто отправляет запросы в один и тот же момент, поэтому общее число учётных записей может быть заметно больше: в обычном офисе в каждый момент в чате сидит лишь часть сотрудников. Если пиковая нагрузка для вас важнее максимального качества ответов, модель поменьше оставит больше запаса. Когда команда действительно перерастает одну коробку, устройство NVIDIA GB10 поддерживает кластер: мощность наращивается добавлением узлов, а не заменой купленного. Назовите численность и ожидаемую нагрузку на этапе оценки, и мы предложим подходящую конфигурацию.
В работе модели разницы нет: оба устройства построены на одном и том же чипе GB10 Blackwell со 128 GB VRAM, поэтому скорость инференса и набор помещающихся моделей одинаковы. Отличия касаются всего остального вокруг чипа. У версии NVIDIA 4 TB NVMe и поддержка кластера, у ASUS Ascent GX10 1 TB и только одиночный узел. На практике объём хранилища важен, когда на коробке лежат несколько моделей и растущий индекс RAG, а кластер нужен лишь тем, кто планирует позже добавлять узлы. Небольшой стабильной команде устройства ASUS вполне достаточно. Внедрение и управляемый план для обоих одинаковы, доставка по Риге включена в обоих случаях.
Запустите за минуты или обсудите с инженером, что подходит вашему проекту.