محدودیت «پنجره زمینه» (Context Window) و هزینههای سرسامآور محاسبات مجدد، همواره بزرگترین مانع در مسیر پردازش حجم عظیمی از دادهها توسط مدلهای زبانی بزرگ بوده است. اکنون یک پژوهش پیشگامانه با تکیه بر لایهی حافظه جدیدی به نام galahad-kv نشان داده است که میتوان پنجره زمینه هوش مصنوعی را تا ۵۰ میلیون توکن افزایش داد، آن هم با مصرف انرژی ۱۲ برابر کمتر و سرعتی تا بیش از ۴ برابر سریعتر از روشهای متداول بازپردازش.
انقلاب در مدیریت حافظه هوش مصنوعی: فراتر از مرزهای سنتی
یکی از بزرگترین چالشهای فنی در مدلهای زبانی بزرگ (LLM)، نیاز به محاسبه مداوم وضعیت داخلی کلید-مقدار (Key-Value State یا همان KV Cache) به ازای هر درخواست جدید است. در سیستمهای استاندارد، وقتی دادههای ورودی افزایش مییابند، میزان حافظه مصرفی کارت گرافیک (VRAM) به شکل تصاعدی رشد میکند و هزینه اجرای مدل بهشدت بالا میرود.
در مقالهی پژوهشی منتشرشده در arXiv با عنوان Real Long-Term Memory for AI، ساختاری معرفی شده است که وضعیت حافظه موقت (KV Cache) به ازای بلوکهای تقریباً ۱۶ هزار توکنی را روی دیسکهای رمزنگاریشده NVMe محلی ذخیره میکند. در مراجعات بعدی، سیستم بدون نیاز به محاسبه مجدد و بهصورت بایتبهبایت، اطلاعات را مستقیماً فراخوانی میکند.
دادهها چه میگویند؟ سرعت بالاتر، مصرف انرژی بسیار کمتر
آزمایشهای انجامشده روی یک جریان متنی ۵۰ میلیون توکنی از دادههای عمومی و با استفاده از مدلهای سری Gemma (در نسخههای ۱۲ و ۳۱ میلیارد پارامتری) روی یک کارت گرافیک NVIDIA H100 نتایج شگفتانگیزی را به همراه داشته است:
- افزایش چشمگیر سرعت: بارگذاری بلوکهای حافظه از دیسک محلی بین ۲.۸ تا ۴.۳ برابر سریعتر از محاسبه مجدد آنها توسط پردازنده گرافیکی انجام میشود.
- کاهش شگفتانگیز مصرف برق: مصرف انرژی پردازنده گرافیکی در فرایند بازیابی اطلاعات بین ۸.۸ تا ۱۲.۳ برابر کمتر از حالت بازپردازش سنتی است.
- ثبات مصرف رم گرافیکی: در طول پردازش کل ۵۰ میلیون توکن، مصرف حافظه VRAM روی کارت گرافیک کاملاً ثابت و خطی باقی ماند و دچار سرریز نشد.
جدول مقایسه روش ذخیرهسازی NVMe در برابر بازپردازش سنتی (Recompute)
| شاخص ارزیابی | بازپردازش سنتی (Recompute) | معماری galahad-kv (ذخیره روی NVMe) | میزان بهبود |
|---|---|---|---|
| سرعت دسترسی و پردازش | پایه (۱X) | ۲.۸X تا ۴.۳X سریعتر | تا ۳۳۰٪ افزایش سرعت |
| مصرف انرژی GPU | ۱۰۰٪ | ۸٪ تا ۱۱.۳٪ | حدود ۹۰٪ کاهش مصرف برق |
| مصرف حافظه گرافیکی (VRAM) | افزایش تصاعدی با طول متن | کاملاً ثابت در طول ۵۰ میلیون توکن | پایداری کامل سختافزار |
| دقت بازیابی اطلاعات دوردست | نیازمند کانتکستهای عظیم پرهزینه | ۸۲٪ (مدل 12B) تا ۹۸٪ (مدل 31B) | دقت فوقالعاده بدون هذیان |
دقت یادآوری در مقیاس ۵۰ میلیون توکن؛ پایان توهمات هوش مصنوعی؟
یکی از تستهای کلیدی در این آزمایش، آزمون «سوزن در انبار کاه» بود. فکتها و اطلاعات خاصی در عمق چندین میلیون توکن قبلتر پنهان شدند تا توانایی مدل در بازیابی دقیق سنجیده شود. مدل ۳۱ میلیارد پارامتری توانست در ۹۸ مورد از ۱۰۰ آزمایش، پاسخ کاملاً دقیق را پیدا کند، در حالی که مدل ۱۲ میلیاردی به دقت ۸۲ از ۱۰۰ رسید.

نکته حائز اهمیت در این آزمایش این است که هیچکدام از مدلها دچار پدیده «توهم یا هذیان» (Hallucination) نشدند؛ این یعنی مدل یا پاسخ درست را از حافظه استخراج کرد یا پاسخی ساختگی ارائه نداد.
مزایا، محدودیتها و تأثیر بر بازار زیرساخت هوش مصنوعی
این رویکرد جدید تفاوت مفهومی مهمی با بزرگتر کردن صِرف پنجره توجه (Attention Window) دارد. درک تفاوتهای ساختاری و محدودیتهای این فناوری برای متخصصان و توسعهدهندگان ضروری است:
۱. استفاده مجدد از وضعیت به جای پنجره توجه همزمان
این سیستم در هر لحظه یک بلوک ذخیرهشده را فراخوانی میکند؛ بنابراین نمیتوان انتظار داشت توجه همزمان روی تمام ۵۰ میلیون توکن برقرار باشد. با این حال، برای اموری مثل پردازش پایگاههای داده عظیم، تاریخچه مکالمات طولانیمدت، اسناد حقوقی و آرشیو کدها، این شیوه عملکردی بینقص و بهشدت اقتصادی دارد.
۲. تغییر موازنه بازار سختافزار
تا پیش از این، ارائهدهندگان خدمات هوش مصنوعی مجبور به سرمایهگذاری سنگین روی کلاسترهای گرانقیمت GPU برای تأمین حافظه VRAM بودند. با انتقال بار حافظه بلندمدت به حافظههای فوقسریع NVMe، هزینه سختافزاری سرورها به شکل چشمگیری کاهش مییابد و وابستگی شدید به خرید زنجیرهای از پردازندههای گرافیکی کمتر میشود.
«بازنویسی و بازپردازش مکرر توکنها یکی از بزرگترین هدررفتهای انرژی در عصر هوش مصنوعی است؛ کش کردن لایههای میانی روی حافظه غیرفرار، این معادله را برای همیشه تغییر میدهد.»
جمعبندی
توسعه معماریهایی مانند galahad-kv نشان میدهد که آینده مدلهای زبانی لزوماً به سختافزارهای گرانتر با حافظههای سرسامآور وابسته نیست، بلکه استفاده هوشمندانه از معماریهای ذخیرهسازی لایهای (Hierarchical Caching) میتواند پنجرههای زمینه چند ده میلیون توکنی را با هزینهای ناچیز و سرعت سرسامآور در دسترس همگان قرار دهد.
سؤالات متداول
پنجره زمینه ۵۰ میلیون توکنی چگونه کار میکند؟
این فناوری به جای محاسبه مجدد تمام متنها در هر درخواست، وضعیت میانی محاسبات (KV Cache) را در بلوکهای ۱۶ هزار توکنی روی درایوهای فوقسریع NVMe ذخیره کرده و در صورت نیاز فوراً بارگذاری میکند.
آیا این سیستم سرعت اجرای مدل را کاهش میدهد؟
خیر، طبق نتایج آزمایشها، فراخوانی دادهها از حافظه NVMe بین ۲.۸ تا ۴.۳ برابر سریعتر از محاسبه مجدد آنها توسط پردازنده گرافیکی (GPU) است.
دقت مدلها در بازیابی اطلاعات در این روش چقدر است؟
در آزمایشهای انجامشده، مدل ۳۱ میلیاردی با دقت ۹۸٪ و مدل ۱۲ میلیاردی با دقت ۸۲٪ اطلاعات مخفیشده در میان ۵۰ میلیون توکن را بدون هیچگونه پاسخ ساختگی یا توهم بازیابی کردند.
اصلیترین محدودیت این شیوه چیست؟
این فناوری یک حافظه ذخیرهسازی و بازیابی بلوکی است، نه پنجره توجه همزمانِ سرتاسری؛ همچنین نوشتن اولیه اطلاعات روی دیسک به زمان و چند ترابایت فضای NVMe نیاز دارد.