DTGaraGe | Автомобили, Офроуд, Заваряване, Linux, AI

Регистрирайте безплатен акаунт днес, за да станете член! След като влезете, ще можете да участвате в този сайт, като добавяте свои собствени теми и публикации, както и да се свързвате с други членове чрез вашата лична пощенска кутия!

IT Новини RAM-ът избяга от дъното: CXL паметта и новият резервоар за AI машините

RAM-ът избяга от дъното: CXL паметта и новият резервоар за AI машините


RAM паметта за бъдещето.png


TECH: CXL Memory Pooling
TARGET: AI / LLM Inference / Data Center
TEST: 1 TB CXL Memory Pool
STACK: vLLM + LMCache
RESULT: near-DRAM performance
STATUS: RAM is no longer just RAM




Преди RAM-ът беше нещо просто.

Слагаш плочки на дъното, машината ги вижда, системата диша. Ако не стига - купуваш още. Ако пак не стига - купуваш по-голям сървър. Класика.

Само че AI машините не играят по старите правила.

Големите езикови модели не искат просто процесор, видеокарта и малко памет за красота. Те искат огромни количества RAM, VRAM, кеш и пропускателна способност. Искат памет като гладен звяр, който не пита колко струва фуражът.

И тук влиза CXL.



Какво е CXL с човешки думи?


CXL, или Compute Express Link, е технология, която позволява паметта да не бъде заключена само в една машина.

Представи си го така:

Обикновеният сървър има RAM като личен резервоар. Само той си пие от него.

CXL прави нещо по-хитро - създава общ басейн от памет, към който могат да се свързват процесори, ускорители и сървъри. Не е просто “още една RAM плочка”. Това е памет, която започва да се държи като инфраструктура.

Не като шкаф.

Като водоем.



Защо това е важно за AI?


При LLM моделите има нещо, наречено KV Cache.

Казано просто: когато моделът започне да отговаря, той пази част от вече сметнатото, за да не го преизчислява постоянно. Това спестява време, ток и нерви.

Проблемът?

Колкото по-дълъг е контекстът и колкото повече потребители има, толкова повече KV Cache трябва. И в един момент GPU паметта започва да се задъхва.

Това е все едно да имаш чудовищен двигател, но резервоарът ти да е от моторна резачка.

CXL предлага друг подход: част от тази памет може да се изнесе в по-голям общ пул. GPU-то не остава само с това, което има на борда. До него вече има допълнителен резервоар.



Samsung вече го тества сериозно


Samsung показа тест с:
  • NVIDIA RTX PRO 6000 Blackwell GPU система
  • Samsung CMM-D CXL памет
  • CXL switch
  • 1 TB CXL memory pool
  • vLLM
  • LMCache
  • AI inference натоварване

Резултатът е интересен: при 8 GPU конфигурация CXL memory pool-ът достига около 92% от производителността на DRAM, но дава значително по-голям капацитет за KV Cache.

Това вече не звучи като лабораторна играчка.

Звучи като бъдеща архитектура за AI центрове.



Голямата промяна


SSD-то вече не е просто склад.

То стана гориво.

GPU-то вече не е просто видеокарта.

То стана двигател.

А RAM-ът?

RAM-ът започва да се превръща в обща кръвоносна система.

Това е голямата промяна. Компютърът вече не е кутия с части. В AI ерата той става организъм. Едно звено мисли, друго храни, трето помни, четвърто охлажда, пето прехвърля данни като артерия под налягане.

И ако една част се задъха, целият звяр започва да куца.



Трябва ли ни това вкъщи?


Не.

Поне не на нормален човек с нормален бюджет и нормална електромерна партида.

За домашен лаб, форум, NAS или сървърен кът много по-смислено е:

  • повече реална RAM
  • добър NVMe диск
  • 10G мрежа
  • стабилен backup
  • ZFS или добър RAID
  • добро охлаждане
  • чиста кабелна организация

CXL memory pooling е за голямата сцена - data center, AI inference, HPC, cloud инфраструктура.

Но е важно да го следим, защото това, което днес е екзотика за корпорации, утре става техника за ентусиасти, а вдругиден го гледаме втора ръка с описание “ползвано внимателно, не е копало, само AI”.



Финалният извод


CXL не е просто нов начин да добавиш памет.

CXL е знак, че старият компютърен модел започва да се пука по шевовете.

AI вече не иска “компютър”.

AI иска фабрика.

И в тази фабрика RAM-ът вече не е плочка на дъното.

Той е резервоар.
Той е водоем.
Той е кръвта, която държи машината будна.


──[DTGarage@MemoryFuture]
│ layer: CXL
│ role: memory pooling
│ target: hungry AI machines
│ lesson: RAM is becoming infrastructure
└─> echo "Когато моделите огладнеят, паметта трябва да стане езеро."


Автор: Тони Ангелчовски
DTGaraGe.EU - мястото, където техниката не се гледа само по спецификации, а по характер.
Ако темата ти е била полезна и искаш да подкрепиш форума:

SEO ключови думи: CXL memory, CXL памет, memory pooling, Samsung CMM-D, AI инфраструктура, LLM inference, KV Cache, vLLM, LMCache, data center memory, RAM pooling, Compute Express Link, хардуер за изкуствен интелект
 
CXL е като да преместиш цялата си памет от малък бидон в обща цистерна на квартала.
Не просто добавяш RAM – вече я споделяш, преразпределяш, разширяваш динамично, без да мислиш за физически слотове или кое дъно колко държи.

Това прави KV Cache-а на LLM моделите почти “еластичен”.
Вместо да реже контекст или да отделя задачи по GPU-та, системата дърпа от общия басейн и сервира на модела толкова памет, колкото му трябва – на момента.

В реален deployment – забравяш за “Out of Memory” грешки, които убиват инстанции при тежки заявки.
Можеш да скейлваш inference без да раздуваш целия хардуер – просто точиш още RAM от пула.

Практически:
– vLLM + LMCache върху 1TB CXL pool = near-DRAM performance
– latency почти като локална памет, мащабируемост като облак
– GPU-та не се задъхват, защото не са единствения резервоар
– повече паралелни сесии, по-дълги контексти, без да режеш качество

За админите – мониторингът става малко по-друг:
– free -h и top вече не показват цялата истина
– ще трябва специализиран CXL tooling за real-time usage
– bottleneck-a се мести – от слотове и шини, към мрежа/PCIe bandwidth и latency

Който не влезе в този влак, ще гледа как моделите му давят хардуера, докато съседът точи от общата цистерна и върти обороти.
RAM-ът вече е инфраструктура, не просто част.
Старият подход свършва тук.
 
CXL не е просто „още RAM“. Това е преминаване от лична собственост към обща инфраструктура на паметта.

За локалните AI експерименти (Ollama, vLLM и големи контексти) това е потенциален game changer в следващите 2-3 години. Особено когато комбинираш с бързите NVMe като PM1763 от предишната тема — горивото + кръвта на звяра.:):):cool:
 
Абсолютно точно казано, Razor.

Това вече не е просто ъпгрейд на една част, а смяна на философията.
PM1763 носи горивото, CXL движи кръвта, а AI машината започва да прилича повече на жив организъм, отколкото на класически компютър.

И да - за локалните AI експерименти това ще стане много интересно. Днес го гледаме като data center екзотика, утре ще го дебнем втора ръка, а вдругиден някой ще каже: Абе аз имам един CXL модул в шкафа, дали да не го пробвам с Ollama? :)

Точно такива коментари правят темата жива. Благодаря!
 
Top Bottom
🛡️ Този сайт използва аналитични инструменти за подобряване на потребителското изживяване. Никакви лични данни не се събират. С продължаването си в Потока приемаш тази философия на прозрачност и уважение.