گزارشهای اخیر و بررسیهای فنی پیرامون بزرگترین مخزن هوش مصنوعی متنباز جهان، یعنی هاگینگ فیس (Hugging Face)، ابعاد نگرانکنندهای از آسیبپذیریهای امنیتی و سوءاستفادههای ساختاری را برملا کرده است. نتایج تحقیقات جدید نشان میدهد که این بستر محبوب نهتنها میزبان خلاقیت توسعهدهندگان، بلکه هدفی جذاب برای نفوذگران و کمپینهای دستکاری داده است.
ماجرای بررسی امنیتی هاگینگ فیس چیست؟
پلتفرم هاگینگ فیس (Hugging Face) که از آن بهعنوان گیتهابِ دنیای هوش مصنوعی یاد میشود، محل اشتراکگذاری صدها هزار مدل زبانی، مجموعه داده و ابزار پردازشی است. با افزایش وابستگی استارتاپها و غولهای فناوری به مدلهای آماده، امنیت این زنجیره تأمین نرمافزاری به یکی از حیاتیترین چالشهای روز تبدیل شده است. تحقیقات و ارزیابیهای اخیر پژوهشگران امنیتی و تیمهای تحلیل ریسک، پرده از شکافهایی برداشته که میتواند امنیت زیرساختهای متکی به هوش مصنوعی را به خطر بیندازد.
۵ کشف شگفتانگیز و پرریسک در مخازن هاگینگ فیس
بررسیهای عمیق روی مخازن عمومی و نحوه تعامل کاربران با مدلهای به اشتراکگذاشتهشده، الگوهای خطرناکی را آشکار کرده است که در ادامه به مهمترین آنها میپردازیم:
۱. بدافزارهای پنهان در فرمتهای سنتی مدل (حملات اجرای کد دلخواه)
یکی از جدیترین تهدیدها، استفاده از فایلهای سریالی سنتی مانند Pickle در پایتون است. مهاجمان با بارگذاری وزنهای دستکاریشده مدل، کدهای مخربی را درون این فایلها جاسازی میکنند. هنگامی که یک توسعهدهنده یا سامانه ابری مدل را لود میکند، کد بدافزار بدون نیاز به هیچ اقدام اضافهای اجرا شده و دسترسی روت یا امکان سرقت اطلاعات را فراهم میسازد.
۲. افشای گسترده کلیدهای حساس و توکنهای API
هزاران فضای اختصاصی (Hugging Face Spaces) و کدهای آزمایشی حاوی توکنهای دسترسی افشاشده به سرویسهای ابری معتبر نظیر AWS، OpenAI و Google Cloud هستند. توسعهدهندگان بهصورت سهوی کلیدهای احراز هویت را درون کدهای منبع رها میکنند که این مسئله امکان دسترسی غیرمجاز و تخلیه منابع پردازشی گرانقیمت را برای هکرها مهیا میکند.
۳. دستکاری و مسمومسازی مجموعه دادهها (Data Poisoning)
در بسیاری از مخازن عمومی، دادههای آموزشی بدون بازبینی دقیق آپلود میشوند. مهاجمان با تغییر نامحسوس نمونههای متنی یا تصویری، مدلها را به گونهای مسموم میکنند که در شرایط خاص رفتاری مغرضانه، توهمآمیز یا سوگیرانه نشان دهند؛ بدون اینکه عملکرد کلی مدل در بنچمارکهای استاندارد کاهش یابد.
۴. سرقت وزنها و کلونسازی بدون مجوز مدلهای اختصاصی
یافتهها نشان میدهد بخش قابلتوجهی از مدلهای ادعاشده بهعنوان «توسعهیافته مستقل»، در واقع خروجی تقطیرشده (Distilled) یا وزنهای بازسازیشده از مدلهای تجاری شرکتهای بزرگی مثل OpenAI و Anthropic هستند که با نقض قوانین استفاده تجاری، تحت برچسب متنباز بازنشر شدهاند.
۵. حملات زنجیره تأمین و تایپواسکواتینگ (Typosquatting)
نفوذگران با ساخت حسابهای کاربری و مدلهایی با اسامی بسیار شبیه به سازمانهای معتبر (مانند اشتباه تایپی در نام Meta یا Microsoft)، کاربران را فریب داده و نسخههای دستکاریشده مدلهای پرکاربرد نظیر Llama را به عنوان نسخه رسمی به آنها تحویل میدهند.

جدول مقایسه: ریسکهای امنیتی رایج و راهکارهای مقابله
| نوع آسیبپذیری | پیامد احتمالی | روش پیشگیری و مهار |
|---|---|---|
| فایلهای آلوده Pickle | کنترل کامل سرور و نشت اطلاعات | مهاجرت به فرمتهای امن مانند Safetensors |
| توکنهای افشاشده API | سوءاستفاده مالی و نفوذ سازمانی | استفاده از Secrets Management و اسکن خودکار |
| مدلهای جعلی (Typosquatting) | اجرای بدافزار و کاهش دقت سامانهها | بررسی تیک تأیید هویت و هش معتبر مخزن |
| مسمومسازی داده | رفتار غیرقابلپیشبینی مدل در تولید | اعتبارسنجی منبع داده و پاکسازی هوشمند |
پیامدهای این یافتهها بر بازار هوش مصنوعی
افشای این چالشها تأثیر عمیقی بر سرمایهگذاریهای سازمانی خواهد داشت. کسبوکارهایی که پیشتر با اتکا به منابع رایگان به دنبال کاهش هزینههای زیرساختی بودند، اکنون باید بودجههای سنگینی را به ممیزی امنیتی هوش مصنوعی (AI Security Auditing) اختصاص دهند. همچنین انتظار میرود نهادهای نظارتی استانداردهای سختگیرانهتری را برای پلتفرمهای اشتراکگذاری مدل اعمال کنند.
اقدامات ضروری برای تیمهای فنی و توسعهدهندگان
- پرهیز از فرمتهای ناامن: فوراً استفاده از فایلهای
.binو.pklرا متوقف کرده و استانداردهای نوین نظیرSafetensorsرا جایگزین کنید. - ممیزی امنیتی وابستگیها: پیش از یکپارچهسازی هر مدل عمومی در محیط پروداکشن، ساختار فایلها و توابع اجرایی آن را در محیط ایزوله (Sandbox) بسنجید.
- پایش لاگها و متغیرهای محیطی: کلیدهای API را هرگز در کدهای عمومی قرار ندهید و چرخه تعویض دورهای توکنها را فعال سازید.
جمعبندی
گسترش بیسابقه هوش مصنوعی نباید به بهای نادیده گرفتن مبانی امنیت سایبری تمام شود. یافتههای اخیر نشان میدهد که مخازن باز هوش مصنوعی نیازمند سازوکارهای اعتبارسنجی دقیقتر، ابزارهای اسکن خودکار بدافزار و آگاهی عمیقتر توسعهدهندگان هستند تا این اکوسیستم نوآورانه به ابزاری در دست هکرها تبدیل نشود.
سؤالات متداول
چرا هاگینگ فیس در برابر حملات سایبری آسیبپذیر است؟
به دلیل ماهیت متنباز و امکان آپلود آزادانه فایلها توسط کاربران، هکرها میتوانند از فرمتهای سنتی ذخیرهسازی مدلها برای تزریق کدهای مخرب و حملات زنجیره تأمین استفاده کنند.
فرمت Safetensors چیست و چگونه به امنیت کمک میکند؟
سِیفتنسورز (Safetensors) فرمتی مدرن برای ذخیره وزنهای مدلهای هوش مصنوعی است که برخلاف Pickle، امکان اجرای هیچگونه کد اجرایی را نمیدهد و تنها دادههای خالص تانسور را بارگذاری میکند.
توسعهدهندگان چگونه میتوانند از آلوده نبودن مدلها مطمئن شوند؟
با استفاده از مدلهای دارای نشان تأیید (Verified)، بررسی هش امنیتی، بارگذاری در محیط ایزوله (Sandbox) و استفاده از ابزارهای ممیزی و اسکن خودکار آسیبپذیریها.