شرکت Liquid AI در جدیدترین همکاری خود با پلتفرم هاگینگ فیس (Hugging Face)، از مدل پیشنویس LFM2.5-DSpark رونمایی کرد. این مدل نوآورانه با هدف بهینهسازی فرآیند استنتاج (Inference) توسعه یافته و میتواند سرعت تولید متن در مدلهای زبانی را تا ۳.۲ برابر افزایش دهد، بدون آنکه افت کیفیتی در خروجی نهایی ایجاد شود. در دنیایی که هزینههای پردازشی هوش مصنوعی سر به فلک کشیده است، این دستاورد میتواند قواعد بازی را برای توسعهدهندگان تغییر دهد.
مدل LFM2.5-DSpark چیست و چرا اهمیت دارد؟
استفاده از مدلهای زبانی بزرگ (LLMs) همواره با یک چالش اساسی روبهرو بوده است: تأخیر در پاسخگویی و هزینههای بالای پردازشی. شرکت Liquid AI برای حل این مشکل، مدل LFM2.5-DSpark را بهعنوان یک «مدل پیشنویس» (Draft Model) معرفی کرده است. این مدل بهصورت یک دستیار کوچک و چابک برای مدلهای اصلی (Target Models) سری LFM 2.5 عمل میکند و وظیفهی آن تسریع فرآیند تولید توکنهاست.
اهمیت این مدل در این است که نیاز به سختافزارهای گرانقیمت را کاهش داده و امکان اجرای روانترِ هوش مصنوعی را روی طیف وسیعتری از دستگاهها فراهم میکند.
فناوری DSpark چگونه کار میکند؟
راز سرعت بالای LFM2.5-DSpark در استفاده از تکنیکی به نام رمزگشایی گمانهزنی (Speculative Decoding) نهفته است. در روشهای سنتی، مدل زبانی باید کلمات (توکنها) را یکییکی و بهصورت متوالی تولید کند که فرآیندی زمانبر است. اما DSpark این روند را تغییر میدهد:
- پیشبینی سریع: مدل کوچکتر (DSpark) بهسرعت چندین توکن بعدی را حدس میزند و یک «پیشنویس» تهیه میکند.
- تأیید موازی: مدل اصلی و بزرگتر، این پیشنویس را بهصورت موازی بررسی میکند.
- پذیرش یا اصلاح: اگر حدسهای مدل پیشنویس درست باشد، توکنها تایید میشوند؛ در غیر این صورت، مدل اصلی آنها را در کسری از ثانیه اصلاح میکند.
این همکاری تیمی باعث میشود تا گلوگاههای پردازشی از بین رفته و تولید متن با سرعتی خیرهکننده انجام شود.
معماری و روند آموزش
بر اساس مستندات منتشرشده در بلاگ هاگینگ فیس، معماری DSpark بهگونهای طراحی شده که توزیع احتمالات آن کاملاً با مدل اصلی LFM2.5 همسو باشد. برای رسیدن به این هماهنگی، تیم Liquid AI از تکنیکهای تقطیر دانش (Knowledge Distillation) استفاده کرده است. در این روش، مدل کوچکتر یاد میگیرد که چگونه الگوهای تصمیمگیری مدل بزرگتر را با کمترین پارامتر ممکن تقلید کند.
حفظ کیفیت در کنار سرعت (Quality Parity)
یکی از بزرگترین نگرانیها در استفاده از مدلهای سبکسازیشده، افت کیفیت پاسخهاست. با این حال، Liquid AI تضمین کرده است که استفاده از LFM2.5-DSpark منجر به برابری کیفی (Quality Parity) صددرصدی با مدل اصلی میشود. از آنجا که مدل بزرگتر همیشه حرف آخر را در تایید توکنها میزند، خروجی نهایی از نظر دقت، لحن و درستیِ اطلاعات، هیچ تفاوتی با زمانی که مدل اصلی بهتنهایی کار میکند، نخواهد داشت.
عملکرد روی پردازندههای مختلف (CPU و GPU)
یکی از جذابترین ویژگیهای LFM2.5-DSpark، انعطافپذیری سختافزاری آن است. این مدل نه تنها روی پردازندههای گرافیکی پیشرفته (GPU) عملکرد درخشانی دارد، بلکه روی پردازندههای مرکزی (CPU) نیز سرعت استنتاج را بهطور چشمگیری بهبود میبخشد.

| نوع پردازنده | سرعت استنتاج سنتی | سرعت با فناوری DSpark | میزان بهبود (تقریبی) |
|---|---|---|---|
| پردازنده گرافیکی (GPU) | پایه | بسیار سریع | تا ۳.۲ برابر |
| پردازنده مرکزی (CPU) | کُند | قابل قبول و روان | تا ۲.۵ برابر |
این ویژگی برای شرکتهایی که قصد دارند هوش مصنوعی را روی سرورهای ابری ارزانتر یا حتی دستگاههای لبه (Edge Devices) پیادهسازی کنند، یک مزیت رقابتی بزرگ محسوب میشود.
نحوه استفاده از LFM2.5-DSpark در هاگینگ فیس
توسعهدهندگان میتوانند هماکنون به فایلهای Checkpoint این مدل در پلتفرم Hugging Face دسترسی داشته باشند. برای ادغام این مدل در پروژهها، کافی است از کتابخانهی استاندارد transformers استفاده کرده و مدل DSpark را در کنار مدل اصلی بهعنوان پارامتر assistant_model فراخوانی کنید. این یکپارچگیِ ساده باعث میشود تا بدون نیاز به تغییرات بنیادین در کدهای قبلی، از مزایای افزایش سرعت بهرهمند شوید.
«هدف ما در Liquid AI، ساخت مدلهایی است که نه تنها هوشمند باشند، بلکه از نظر اقتصادی و پردازشی نیز قابلیت پیادهسازی در دنیای واقعی را داشته باشند. DSpark تجلی همین دیدگاه است.»
جمعبندی
انتشار LFM2.5-DSpark توسط Liquid AI یک گام رو به جلو در دموکراتیزه کردن و کاربردیتر شدن هوش مصنوعی است. با کاهش هزینههای پردازشی و افزایش چشمگیر سرعت استنتاج تا ۳.۲ برابر، توسعهدهندگان اکنون ابزار قدرتمندی در دست دارند تا برنامههای هوش مصنوعی بلادرنگ (Real-time) را حتی روی سختافزارهای محدودتر پیادهسازی کنند. این نوآوری بهروشنی نشان میدهد که آیندهی هوش مصنوعی تنها در گرو افزایش تعداد پارامترها نیست، بلکه بهینهسازی معماری و استفاده از تکنیکهایی مانند رمزگشایی گمانهزنی، نقش کلیدی در پذیرش عمومی و تجاری این فناوری خواهد داشت.
سؤالات متداول
مدل LFM2.5-DSpark دقیقاً چیست؟
یک «مدل پیشنویس» (Draft Model) کوچک و سریع است که توسط شرکت Liquid AI توسعه یافته تا در کنار مدلهای اصلی کار کند و سرعت تولید متن (استنتاج) را بهشدت افزایش دهد.
آیا استفاده از DSpark باعث کاهش کیفیت پاسخهای هوش مصنوعی میشود؟
خیر. به دلیل استفاده از تکنیک رمزگشایی گمانهزنی، مدل اصلی همواره پاسخهای مدل پیشنویس را بررسی و تایید میکند، بنابراین کیفیت خروجی نهایی دقیقاً برابر با مدل اصلی خواهد بود.
آیا این مدل فقط روی کارتهای گرافیک (GPU) قدرتمند کار میکند؟
خیر، یکی از مزایای اصلی DSpark این است که علاوه بر GPU، سرعت استنتاج را روی پردازندههای مرکزی (CPU) نیز بهطور چشمگیری بهبود میبخشد.
چگونه میتوانم از این مدل در پروژههای خود استفاده کنم؟
این مدل در پلتفرم هاگینگ فیس (Hugging Face) در دسترس است و توسعهدهندگان میتوانند با استفاده از کتابخانه Transformers و تنظیم آن بهعنوان assistant_model، بهسادگی از آن بهره ببرند.