d-Matrix заявляет о 20-кратном превосходстве над NVIDIA Rubin в новой чипсете Raptor
d-Matrix, стартап из Кремниевой долины, представил новый ускоритель Raptor на базе технологии 3D DRAM, заявив о революционном скачке в плотности пропускной способности. Компания утверждает, что их чип обеспечивает в 20 раз большую плотность пропускной способности по сравнению с флагманским решением NVIDIA Rubin. Это заявление сделано в контексте растущих проблем с «узким горлышком» памяти при выполнении задач AI-инференса, где скорость чтения данных из памяти часто становится главным ограничителем производительности.
В основе архитектуры Raptor лежит радикально иной подход к организации памяти по сравнению с традиционными решениями. Если у NVIDIA Rubin и других конкурентов память (HBM) размещается рядом с вычислительным блоком на кремниевом интерпозере, то d-Matrix использует технологию прямого соединения. Чип Raptor объединяет логический блок от TSMC (процесс N4) и слой DRAM с помощью 36-микронной технологии face-to-face bonding. Это позволяет разместить до четырех слоев DRAM непосредственно поверх вычислительного ядра.
Главное преимущество такой конструкции заключается в устранении физического интерфейса PHY, который обычно потребляет сотни ватт энергии на высокопроизводительных пакетах чипов. В архитектуре Raptor электроны перемещаются вертикально всего за несколько микрон по всей поверхности кристалла. d-Matrix заявляет, что это снижает энергозатраты на передачу данных до 0,37 пДж/бит и уменьшает потребление энергии на гигабайт переданных данных в 13,5 раза по сравнению с аналогами.

Хотя плотность памяти у Raptor все еще ниже, чем у HBM, производительность на единицу площади значительно выше. d-Matrix подчеркивает, что их решение ориентировано именно на фазу декодирования (decode) в задачах AI-инференса, которая является наиболее энергозатратной и чувствительной к пропускной способности памяти. Для таких задач наличие огромных вычислительных мощностей не так критично, как быстрый доступ к данным.

Каждая карта Raptor оснащена 32 ГБ памяти, что помещает её в нишу между дорогими блоками SRAM и массивными стеками HBM. Для работы с гигантскими языковыми моделями (LLM) компания предлагает горизонтальное масштабирование: создание кластеров из множества карт Raptor, объединенных высокоскоростными шинами. В конфигурации из 72 карт общая пропускная способность системы достигает петабайт в секунду, что позволяет обрабатывать контекстные окна с миллионами токенов без задержек.

В презентации на конференции Hot Chips d-Matrix привела амбициозные показатели производительности. Они заявляют о скорости обработки около 1000 токенов в секунду на одного пользователя при обслуживании модели класса "3T" с контекстом в 1 миллион токенов. В тестах с моделью GLM 5.2 кластер Raptor показал результат в 2121 токен/сек/пользователя для 32 пользователей, а на новой модели Kimi K3 — 785 токенов при 32 одновременных запросах.

Стоит отметить, что эти цифры являются заявленными характеристиками и пока не подтверждены независимыми тестами в реальном продакшене. d-Matrix уже имеет коммерческие продукты на рынке, поэтому это не просто теоретический проект стартапа, но отсутствие живых демо-сессий нового чипа Raptor остается фактором неопределенности. Индустрия с интересом ожидает появления независимых бенчмарков, которые смогут подтвердить или опровергнуть заявления о превосходстве над архитектурой NVIDIA Rubin.