بدون دسته های نکسینو

تمام نیازمندی های شما از یک رسانه هوش مصنوعی

دمیس حسابیس کیست؟ تغییر بزرگ در DeepMind و آینده هوش مصنوعی گوگل

رقابت در دنیای هوش مصنوعی دیگر فقط به ساخت مدل‌های قدرتمندتر محدود نمی‌شود؛ ساختار سازمانی، رهبران علمی و نحوه تصمیم‌گیری شرکت‌ها نیز نقش مهمی در تعیین آینده این صنعت دارند. در سال‌های اخیر، شرکت‌هایی مانند OpenAI، Anthropic و Google DeepMind تلاش کرده‌اند علاوه بر توسعه مدل‌های پیشرفته، مسیر رسیدن به نسل بعدی هوش مصنوعی را نیز مشخص کنند. در همین شرایط، تغییر نقش دمیس حسابیس (Demis Hassabis)، یکی از مهم‌ترین چهره‌های تاریخ هوش مصنوعی، در Google DeepMind توجه زیادی را به خود جلب کرده است. حسابیس از مدیریت اجرایی روزمره فاصله گرفته، اما همچنان در ساختار DeepMind و Alphabet باقی می‌ماند و قرار است تمرکز بیشتری روی تحقیقات بلندمدت و مسیرهایی مانند هوش عمومی مصنوعی (AGI) داشته باشد. این تغییر یک سؤال مهم ایجاد کرده است: آیا گوگل در حال تغییر استراتژی خود در رقابت هوش مصنوعی است یا این تصمیم به حسابیس اجازه می‌دهد روی آینده بلندمدت AI تمرکز بیشتری داشته باشد؟ دمیس حسابیس کیست؟ دمیس حسابیس یکی از شناخته‌شده‌ترین پژوهشگران حوزه هوش مصنوعی و بنیان‌گذار DeepMind است. او پیش از ورود جدی به دنیای AI، در حوزه علوم کامپیوتر، علوم شناختی و علوم اعصاب فعالیت داشت و علاقه‌اش به ساخت سیستم‌هایی با توانایی یادگیری و حل مسئله، مسیر حرفه‌ای او را شکل داد. حسابیس در سال ۲۰۱۰ شرکت DeepMind را همراه با چند همکار دیگر تأسیس کرد. هدف اولیه این شرکت توسعه سیستم‌های هوش مصنوعی عمومی بود؛ سیستم‌هایی که بتوانند مانند انسان از تجربه یاد بگیرند و مسائل پیچیده را حل کنند. در سال ۲۰۱۴، گوگل DeepMind را خریداری کرد و این آزمایشگاه به یکی از مهم‌ترین مراکز تحقیقاتی هوش مصنوعی در جهان تبدیل شد. یکی از ویژگی‌های مهم DeepMind این بود که برخلاف بسیاری از شرکت‌های فناوری، تمرکز اصلی خود را روی تحقیقات بنیادی قرار داد؛ موضوعی که بعدها باعث شکل‌گیری پروژه‌هایی شد که فراتر از کاربردهای تجاری معمول بودند. مهم‌ترین دستاوردهای دمیس حسابیس و DeepMind DeepMind تحت مدیریت حسابیس چند پروژه تاریخی را توسعه داد که تأثیر زیادی بر مسیر هوش مصنوعی گذاشتند. پروژه اهمیت AlphaGo نشان داد هوش مصنوعی می‌تواند در یک بازی پیچیده مانند Go از انسان‌های برتر عبور کند AlphaFold پیش‌بینی ساختار پروتئین‌ها را با کمک AI متحول کرد Gemini تلاش گوگل برای رقابت مستقیم با مدل‌های پیشرفته شرکت‌هایی مانند OpenAI AlphaGo؛ لحظه‌ای که AI جهان را شگفت‌زده کرد در سال ۲۰۱۶، سیستم AlphaGo توانست لی سِدول، قهرمان مشهور بازی Go، را شکست دهد. این اتفاق اهمیت زیادی داشت، زیرا بازی Go برخلاف شطرنج دارای تعداد بسیار زیادی حالت ممکن است و مدت‌ها تصور می‌شد برای هوش مصنوعی بسیار دشوار باشد. موفقیت AlphaGo نشان داد الگوریتم‌های یادگیری عمیق و یادگیری تقویتی می‌توانند در مسائل پیچیده تصمیم‌گیری عملکردی فراتر از انتظار داشته باشند. AlphaFold؛ زمانی که AI وارد علوم زیستی شد یکی دیگر از بزرگ‌ترین موفقیت‌های DeepMind، پروژه AlphaFold بود. این سیستم توانست یکی از مسائل قدیمی زیست‌شناسی یعنی پیش‌بینی ساختار سه‌بعدی پروتئین‌ها را با دقت بالا حل کند. تأثیر AlphaFold فقط محدود به هوش مصنوعی نبود؛ این فناوری می‌تواند در حوزه‌هایی مانند: کاربرد داشته باشد. این پروژه نشان داد DeepMind تنها یک شرکت تولیدکننده مدل‌های زبانی نیست، بلکه تلاش می‌کند از AI برای حل مسائل علمی بزرگ استفاده کند. چه تغییری در نقش دمیس حسابیس اتفاق افتاده است؟ برخلاف برخی برداشت‌ها، دمیس حسابیس از DeepMind جدا نشده است. تغییر اصلی این است که او از مدیریت روزانه فاصله می‌گیرد و بیشتر روی نقش علمی و استراتژیک تمرکز خواهد کرد. هدف این تغییر می‌تواند چند موضوع باشد: در مقابل، Koray Kavukcuoglu که یکی از مدیران باسابقه DeepMind است، مسئولیت اجرایی بیشتری در مدیریت تیم‌ها و توسعه فناوری‌ها خواهد داشت. این مدل تقسیم نقش در شرکت‌های بزرگ فناوری معمول است؛ یک نفر روی چشم‌انداز بلندمدت و تحقیقات تمرکز می‌کند و تیم اجرایی، توسعه محصول و عملیات روزانه را پیش می‌برد. چرا گوگل چنین تغییری ایجاد کرده است؟ یکی از مهم‌ترین دلایل احتمالی این تغییر، فشار رقابت در بازار هوش مصنوعی است. در سال‌های اخیر، گوگل با رقبایی مانند: رقابت مستقیمی داشته است. در این رقابت، تنها داشتن تحقیقات علمی قوی کافی نیست؛ شرکت‌ها باید بتوانند فناوری خود را سریع‌تر به محصول تبدیل کنند. به همین دلیل، گوگل باید بین دو مسیر تعادل ایجاد کند: مسیر تحقیقاتی مسیر تجاری توسعه AGI و تحقیقات بنیادی عرضه سریع محصولات AI پروژه‌های علمی بلندمدت رقابت با محصولات OpenAI کشف فناوری‌های جدید جذب کاربران و کسب درآمد تغییر نقش حسابیس می‌تواند تلاشی برای حفظ هر دو مسیر باشد؛ یعنی DeepMind همچنان آزمایشگاه تحقیقاتی قدرتمند باقی بماند، اما محصولات هوش مصنوعی گوگل نیز با سرعت بیشتری توسعه پیدا کنند. آینده Google DeepMind بعد از دمیس حسابیس چه خواهد بود؟ یکی از مهم‌ترین پرسش‌ها این است که آیا این تغییر باعث دور شدن DeepMind از تحقیقات بنیادی می‌شود یا خیر. از یک طرف، گوگل به توسعه محصولاتی مانند Gemini نیاز دارد تا بتواند در بازار رقابتی امروز حضور قدرتمندی داشته باشد. از طرف دیگر، مزیت تاریخی DeepMind همیشه تحقیقات بلندمدت و پروژه‌های علمی بزرگ بوده است. آینده DeepMind احتمالاً به توانایی گوگل در ترکیب این دو مسیر بستگی دارد: در واقع، موفقیت گوگل فقط به کیفیت مدل‌هایش وابسته نیست؛ بلکه به این بستگی دارد که بتواند میان سرعت تجاری‌سازی و عمق تحقیقات علمی تعادل ایجاد کند. تغییرات DeepMind چه معنایی برای رقابت جهانی هوش مصنوعی دارد؟ رقابت هوش مصنوعی امروز فقط رقابت بین مدل‌ها نیست؛ بلکه رقابت بین استراتژی‌ها، استعدادها و ساختارهای سازمانی است. مقایسه رویکرد شرکت‌های بزرگ: شرکت تمرکز اصلی Google DeepMind تحقیقات بنیادی + توسعه Gemini OpenAI مدل‌های عمومی و محصولات مصرفی Anthropic مدل‌های ایمن و کاربردهای سازمانی دمیس حسابیس همچنان یکی از چهره‌های کلیدی این رقابت باقی خواهد ماند. تغییر نقش او بیشتر نشان‌دهنده تلاش گوگل برای استفاده بهتر از تجربه علمی اوست، نه پایان حضورش در مسیر توسعه هوش مصنوعی. جمع‌بندی تغییر نقش دمیس حسابیس در Google DeepMind یکی از مهم‌ترین اتفاقات مدیریتی اخیر در صنعت هوش مصنوعی است. او از مدیریت اجرایی روزمره فاصله گرفته، اما همچنان به‌عنوان یکی از رهبران علمی Alphabet فعالیت خواهد داشت. با توجه به سابقه حسابیس در پروژه‌هایی مانند AlphaGo و AlphaFold، تمرکز دوباره او روی تحقیقات بلندمدت می‌تواند برای آینده هوش مصنوعی گوگل اهمیت زیادی داشته باشد. در عین حال،

...

آپدیت جدید چت‌جی‌پی‌تی: ارتقای GPT-5.6 Sol و دسترسی رایگان به مدل Luna

اوپن‌ای‌آی با معرفی آپدیت‌های جدید، مدل GPT-5.6 Sol را با قابلیت‌های کنترل استدلال برای کاربران پولی ارتقا داد و مدل GPT-5.6 Luna را با چت متنی نامحدود برای کاربران رایگان عرضه کرد....

مدل هوش مصنوعی WeatherNext؛ انقلاب گوگل دیپ‌مایند در پیش‌بینی دقیق طوفان‌ها

مدل هوش مصنوعی WeatherNext، توسعه‌یافته توسط گوگل دیپ‌مایند، با سرعت و دقتی بی‌نظیر، پیش‌بینی طوفان‌های مخرب را متحول کرده و به ابزاری حیاتی برای مدیریت بحران تبدیل شده است....

Project Perception چیست؟ سیستم دفاع سایبری هوشمند مایکروسافت

تیم‌های امنیت سایبری هر روز با حجم عظیمی از هشدارها، آسیب‌پذیری‌ها، کدهای مشکوک و حملات احتمالی روبه‌رو می‌شوند. مشکل فقط شناسایی تهدید نیست؛ فاصله میان کشف یک آسیب‌پذیری و اصلاح کامل آن می‌تواند فرصت ارزشمندی در اختیار مهاجمان قرار دهد. با گسترش استفاده مهاجمان از هوش مصنوعی، سرعت تولید کد مخرب، کشف ضعف‌های نرم‌افزاری و اجرای حملات نیز افزایش یافته است. ابزارهایی که برای دنیای حملات انسانی طراحی شده‌اند، ممکن است در برابر تهدیدهایی که با سرعت ماشین عمل می‌کنند کافی نباشند. مایکروسافت برای پاسخ به این چالش، سیستم جدیدی به نام Project Perception توسعه داده است. این سامانه با استفاده از چند ایجنت تخصصی، مدل‌های مختلف هوش مصنوعی و داده‌های امنیتی مایکروسافت تلاش می‌کند چرخه شناسایی، ارزیابی و اصلاح آسیب‌پذیری‌ها را سریع‌تر و پیوسته‌تر کند. Project Perception از ۳ اوت ۲۰۲۶ وارد مرحله پیش‌نمایش عمومی شده است. Project Perception چیست؟ Project Perception یک سیستم امنیت سایبری ایجنتی از مایکروسافت است که سیگنال‌های امنیتی، اطلاعات محیط سازمان، مدل‌های هوش مصنوعی و ایجنت‌های تخصصی را برای شناسایی و کاهش ریسک‌های سایبری با یکدیگر ترکیب می‌کند. مایکروسافت این سیستم را در ۲۷ ژوئیه ۲۰۲۶ معرفی کرد و اعلام کرد پیش‌نمایش عمومی آن از ۳ اوت آغاز می‌شود. هدف اصلی Project Perception این است که امنیت سازمانی از یک فرایند مقطعی و واکنشی، به سیستمی پیوسته برای مشاهده، تحلیل و اقدام تبدیل شود. در روش‌های سنتی، ابزارهای امنیتی معمولاً تعداد زیادی هشدار تولید می‌کنند و کارشناسان باید آن‌ها را به‌صورت دستی بررسی، اعتبارسنجی و اولویت‌بندی کنند. Project Perception قرار نیست صرفاً هشدار بیشتری ایجاد کند؛ بلکه باید بتواند تهدیدها را در بستر واقعی سازمان تحلیل کرده و برای کاهش آن‌ها اقدام مناسب پیشنهاد دهد. مایکروسافت تأکید کرده است که انسان همچنان باید کنترل نهایی را در اختیار داشته باشد. بنابراین این سیستم بیشتر به‌عنوان یک نیروی تقویتی برای تیم‌های امنیتی طراحی شده است، نه جایگزینی کامل برای متخصصان. Project Perception چگونه کار می‌کند؟ Project Perception چند نوع ایجنت تخصصی را در قالب یک چرخه دفاعی هماهنگ می‌کند. هر گروه از ایجنت‌ها وظیفه متفاوتی دارد و مسئله امنیت را از زاویه خاصی بررسی می‌کند. مایکروسافت این ایجنت‌ها را در سه گروه اصلی معرفی کرده است: این سه گروه یک چرخه بسته ایجاد می‌کنند. ابتدا ضعف احتمالی کشف می‌شود، سپس واقعی بودن و شدت آن مورد بررسی قرار می‌گیرد و در پایان راهکاری برای اصلاح یا کاهش خطر ارائه می‌شود. پس از اعمال تغییر نیز سیستم می‌تواند دوباره محیط را بررسی کند تا مطمئن شود مشکل برطرف شده است. Project Perception تنها به کد نرم‌افزار محدود نیست. معماری معرفی‌شده از سوی مایکروسافت قرار است اطلاعات مربوط به هویت‌ها، نقاط پایانی، برنامه‌ها، داده‌ها، سرویس‌های ابری و سامانه‌های هوش مصنوعی را در کنار هم بررسی کند. چرخه شناسایی تا اصلاح آسیب‌پذیری یک گردش کار احتمالی در Project Perception می‌تواند به این شکل باشد: مزیت این فرایند آن است که کشف، تحلیل و اصلاح به‌عنوان سه فعالیت جداگانه انجام نمی‌شوند؛ بلکه در یک جریان پیوسته به یکدیگر متصل هستند. MAI-Cyber-1-Flash چیست؟ یکی از اجزای مهم این راهکار، مدل MAI-Cyber-1-Flash است. مایکروسافت آن را نخستین مدل تخصصی امنیت سایبری Microsoft AI معرفی کرده که برای یافتن آسیب‌پذیری‌های دشوار در کدهای پیچیده ساخته شده است. MAI-Cyber-1-Flash یک مدل عمومی مشابه چت‌بات‌های معمولی نیست. این مدل به‌صورت تخصصی برای کارهایی مانند تحلیل کد، شناسایی ضعف‌های امنیتی و کمک به فرایند اصلاح آسیب‌پذیری طراحی شده است. مایکروسافت می‌گوید این مدل از خانواده MAI-Thinking-1 مشتق شده و با تمرکز زیاد بر داده‌ها و وظایف مرتبط با کد توسعه یافته است. همچنین براساس اعلام شرکت، مدل از صفر و در داخل مایکروسافت ساخته شده و برای استفاده دفاعی کالیبره شده است. چرا مایکروسافت از یک مدل تخصصی استفاده کرده است؟ استفاده دائمی از بزرگ‌ترین و گران‌ترین مدل‌ها برای تمام وظایف امنیتی از نظر اقتصادی منطقی نیست. بسیاری از فعالیت‌های روزمره مانند بررسی بخش‌های مشخصی از کد، دسته‌بندی یافته‌ها یا اجرای تحلیل‌های تکرارشونده را می‌توان با یک مدل کوچک‌تر و تخصصی انجام داد. مایکروسافت اعلام کرده MAI-Cyber-1-Flash می‌تواند تا حدود ۹۰ درصد وظایف MDASH را مدیریت کند. حدود ۱۰ درصد از مسائل بسیار دشوار به مدل‌های قدرتمندتر، از جمله GPT-5.4، ارجاع داده می‌شوند. این معماری دو مزیت مهم دارد: در نتیجه، به‌جای انتخاب یک مدل ثابت برای همه مسائل، سیستم براساس پیچیدگی و حساسیت هر وظیفه، مدل مناسب را انتخاب می‌کند. MDASH چیست؟ MDASH سامانه چندمدلی و چندایجنتی مایکروسافت برای شناسایی، اعتبارسنجی و اصلاح آسیب‌پذیری‌های نرم‌افزاری است. براساس اطلاعات رسمی Microsoft AI، این سامانه بیش از ۱۰۰ ایجنت ساخته‌شده با مدل‌های مختلف را هماهنگ می‌کند. این ایجنت‌ها برای پیدا کردن آسیب‌پذیری، اثبات قابل سوءاستفاده بودن آن، بررسی شدت مشکل و کمک به اصلاح کد با یکدیگر همکاری می‌کنند. تفاوت سه نام اصلی را می‌توان به شکل زیر خلاصه کرد: نام نوع وظیفه اصلی Project Perception سیستم دفاع سایبری ایجنتی ایجاد چرخه پیوسته مشاهده، تحلیل و اقدام MAI-Cyber-1-Flash مدل تخصصی امنیت سایبری تحلیل کد و یافتن آسیب‌پذیری‌ها MDASH سامانه چندمدلی و چندایجنتی هماهنگی ایجنت‌ها برای کشف و اصلاح ضعف‌ها MAI-Cyber-1-Flash داخل MDASH فعالیت می‌کند و MDASH نیز یکی از اجزایی است که قابلیت‌های Project Perception را در حوزه مدیریت آسیب‌پذیری نرم‌افزار تأمین می‌کند. عملکرد MAI-Cyber-1-Flash چقدر است؟ مایکروسافت برای ترکیب MDASH، مدل MAI-Cyber-1-Flash و GPT-5.4 نتایج زیر را گزارش کرده است: شاخص نتیجه اعلام‌شده امتیاز در CyberGym حدود ۹۶ درصد فاصله با Mythos حدود ۱۲ امتیاز بیشتر کاهش هزینه نزدیک به ۵۰ درصد سهم وظایف مدل Flash تا ۹۰ درصد تعداد ایجنت‌های MDASH بیش از ۱۰۰ ایجنت در نمودار رسمی Microsoft AI، ترکیب MDASH با MAI-Cyber-1-Flash و GPT-5.4 به نرخ موفقیت ۹۵.۹۵ درصد رسیده است. مایکروسافت می‌گوید این ترکیب در CyberGym از پیکربندی‌های مبتنی بر Mythos، Gemini و GPT عملکرد بهتری داشته است. CyberGym برای ارزیابی توانایی سیستم‌ها در بررسی مخزن‌های بزرگ کد و پیدا کردن آسیب‌پذیری‌های واقعی استفاده می‌شود. بااین‌حال، این نتایج باید محتاطانه تفسیر شوند. اعداد فعلی توسط خود مایکروسافت اعلام شده‌اند و هنوز برای قضاوت نهایی به ارزیابی‌های مستقل بیشتری نیاز است. همچنین عملکرد یک سیستم در محیط واقعی سازمان می‌تواند تحت‌تأثیر عواملی مانند کیفیت کد، سطح دسترسی، پیچیدگی زیرساخت و تنظیمات امنیتی قرار بگیرد. هوش مصنوعی چگونه آسیب‌پذیری را اصلاح می‌کند؟ پس از شناسایی یک ضعف، سیستم می‌تواند محل آسیب‌پذیری را

...

معرفی Qwen3.8-Max: بررسی مدل ۲.۴ تریلیون پارامتری Alibaba

رقابت در بازار هوش مصنوعی دیگر فقط بر سر پاسخ‌های بهتر یا سرعت بیشتر نیست. شرکت‌ها اکنون با اعداد عظیمی مانند «تریلیون‌ها پارامتر»، «پنجره زمینه یک میلیون توکنی» و «مدل‌های چندوجهی» تلاش می‌کنند نشان دهند نسل تازه‌ای از هوش مصنوعی را ساخته‌اند. اما این اعداد می‌توانند گمراه‌کننده باشند. وقتی Alibaba اعلام می‌کند مدل جدید Qwen3.8-Max دارای ۲.۴ تریلیون پارامتر است، ممکن است در نگاه اول تصور کنیم این مدل الزاماً از GPT یا Claude قدرتمندتر است. درحالی‌که تعداد کل پارامترها فقط یکی از عوامل تعیین‌کننده کیفیت مدل است. Qwen3.8-Max بزرگ‌ترین و قدرتمندترین مدل معرفی‌شده در خانواده Qwen محسوب می‌شود. اهمیت آن فقط به ابعاد بسیار بزرگ محدود نیست؛ معماری Mixture of Experts، قابلیت پردازش ورودی‌های چندوجهی، پنجره زمینه طولانی و برنامه Alibaba برای انتشار وزن‌های مدل، این محصول را به یکی از مهم‌ترین مدل‌های چینی سال ۲۰۲۶ تبدیل کرده است. Qwen3.8-Max چیست؟ Qwen3.8-Max مدل پرچم‌دار جدید Alibaba در خانواده Qwen است که برای کدنویسی، وظایف پیچیده، تحلیل ورودی‌های چندوجهی و اجرای ایجنت‌های هوش مصنوعی طراحی شده است. نسخه پیش‌نمایش آن با نام Qwen3.8-Max-Preview ابتدا از طریق برخی سرویس‌های Alibaba مانند Token Plan، Qoder و QoderWork در دسترس قرار گرفت. سپس Alibaba مدل را به‌عنوان پیشرفته‌ترین محصول Qwen معرفی کرد و وعده داد وزن‌های آن را نیز در اختیار توسعه‌دهندگان قرار دهد. براساس اطلاعات منتشرشده، این مدل از ورودی‌های مختلف پشتیبانی می‌کند: Qwen3.8-Max همچنین می‌تواند تا حدود یک میلیون توکن را در یک نشست پردازش کند؛ ظرفیتی که برای تحلیل گزارش‌های بزرگ، کتاب‌ها، اسناد سازمانی و پروژه‌های پیچیده برنامه‌نویسی اهمیت دارد. مشخصات Qwen3.8-Max در یک نگاه ویژگی مشخصات اعلام‌شده تعداد کل پارامترها ۲.۴ تریلیون پارامترهای فعال حدود ۹۵ میلیارد در هر درخواست معماری Mixture of Experts پنجره زمینه تا یک میلیون توکن ورودی‌ها متن، تصویر، ویدئو و اسناد کاربرد اصلی کدنویسی، ایجنت‌ها و وظایف حرفه‌ای وضعیت مدل پیش‌نمایش و وعده انتشار Open Weight عدد ۲.۴ تریلیون، Qwen3.8-Max را به یکی از بزرگ‌ترین مدل‌های هوش مصنوعی معرفی‌شده تبدیل می‌کند؛ اما این مدل بزرگ‌ترین نمونه موجود نیست. برای مثال، مدل Kimi K3 از Moonshot AI با ۲.۸ تریلیون پارامتر معرفی شده است. عدد ۲.۴ تریلیون پارامتر چه معنایی دارد؟ پارامترها را می‌توان وزن‌های عددی درون شبکه عصبی دانست که مدل طی فرایند آموزش آن‌ها را تنظیم می‌کند. این وزن‌ها به مدل کمک می‌کنند روابط میان کلمات، تصاویر، مفاهیم و الگوهای مختلف را یاد بگیرد. اما Qwen3.8-Max برای پردازش هر درخواست، تمام ۲.۴ تریلیون پارامتر خود را فعال نمی‌کند. براساس گزارش رویترز، تنها حدود ۹۵ میلیارد پارامتر برای هر درخواست وارد محاسبه می‌شوند. دلیل این تفاوت، استفاده از معماری Mixture of Experts یا MoE است. در این معماری، مدل از چندین بخش تخصصی یا «خبره» تشکیل شده است. یک سیستم مسیریاب تشخیص می‌دهد هر ورودی باید توسط کدام بخش‌ها پردازش شود. بنابراین برای یک سؤال برنامه‌نویسی، مجموعه‌ای از خبره‌ها فعال می‌شوند و برای تحلیل تصویر یا متن، مجموعه دیگری وارد عمل می‌شود. این روش چند مزیت دارد: پژوهش‌های قبلی درباره مدل‌های MoE نیز نشان داده‌اند که فعال‌سازی پراکنده می‌تواند تعداد پارامترهای مدل را به مقیاس تریلیونی برساند، بدون آنکه هزینه محاسباتی هر ورودی به همان نسبت افزایش پیدا کند. آیا پارامتر بیشتر به معنی مدل قوی‌تر است؟ خیر. تعداد پارامترها به‌تنهایی معیار قابل اعتمادی برای رتبه‌بندی مدل‌های هوش مصنوعی نیست. عملکرد یک مدل به عوامل متعددی بستگی دارد: یک مدل کوچک‌تر با داده‌های بهتر و معماری بهینه‌تر می‌تواند در برخی وظایف از مدلی با پارامترهای بیشتر بهتر عمل کند. علاوه بر این، مقایسه تعداد کل پارامترهای یک مدل MoE با یک مدل Dense چندان دقیق نیست. در مدل Dense تقریباً تمام پارامترها برای هر درخواست درگیر می‌شوند، اما در مدل MoE فقط بخشی از آن‌ها فعال هستند. بنابراین عدد ۲.۴ تریلیون بیشتر نشان‌دهنده ظرفیت کلی شبکه است، نه هزینه یا قدرت واقعی هر پاسخ. مدل‌هایی مانند Gemini 3 Flash نشان می‌دهند که سرعت، هزینه و بهینه‌سازی معماری نیز می‌توانند به‌اندازه تعداد پارامترها در انتخاب یک مدل هوش مصنوعی اهمیت داشته باشند. قابلیت‌های مهم Qwen3.8-Max چیست؟ پردازش چندوجهی Qwen3.8-Max فقط یک مدل متنی نیست. Alibaba اعلام کرده این مدل می‌تواند متن، تصویر، ویدئو و اسناد را پردازش کند. این قابلیت امکان ساخت ابزارهایی را فراهم می‌کند که به‌طور هم‌زمان چند نوع داده را بررسی می‌کنند. برای مثال، مدل می‌تواند: پنجره زمینه یک میلیون توکنی پنجره زمینه مشخص می‌کند مدل در یک نشست چه مقدار اطلاعات را می‌تواند به‌صورت هم‌زمان در نظر بگیرد. یک میلیون توکن می‌تواند برای کاربردهای زیر مفید باشد: البته اعلام یک پنجره زمینه طولانی لزوماً به این معنا نیست که مدل در تمام بخش‌های آن دقت یکسانی دارد. کیفیت بازیابی اطلاعات از ابتدا، میانه و انتهای زمینه باید در آزمون‌های مستقل بررسی شود. کدنویسی و ایجنت‌های هوش مصنوعی Alibaba مدل جدید را برای Agentic Coding و وظایف چندمرحله‌ای معرفی کرده است. در کدنویسی ایجنتی، مدل فقط یک قطعه کد تولید نمی‌کند؛ بلکه می‌تواند: این کاربردها به زمینه طولانی، ابزارخوانی دقیق و توانایی حفظ هدف در چندین مرحله نیاز دارند. آیا Qwen3.8-Max از GPT و Claude قوی‌تر است؟ Alibaba ادعا کرده Qwen3.8-Max در برخی ارزیابی‌ها در سطح مدل‌های پیشرفته آمریکایی قرار می‌گیرد و تنها از تعداد محدودی از مدل‌های Anthropic عقب‌تر است. برخی گزارش‌ها نیز به جایگاه بالای آن در رتبه‌بندی‌های مبتنی بر ترجیح کاربران اشاره کرده‌اند. بااین‌حال، هنوز نباید یک برنده قطعی اعلام کرد. بخش قابل‌توجهی از ادعاهای اولیه توسط خود Alibaba منتشر شده و در زمان معرفی، گزارش فنی کامل، مدل‌کارت جامع و جدول دقیق بنچمارک‌ها در دسترس نبود. برای مقایسه منصفانه باید این موارد بررسی شوند: بنابراین پاسخ فعلی این است: Qwen3.8-Max احتمالاً یکی از قدرتمندترین مدل‌های چینی است، اما هنوز شواهد مستقل کافی برای اثبات برتری کلی آن نسبت به GPT یا Claude وجود ندارد. آیا Qwen3.8-Max متن‌باز است؟ Alibaba وعده داده وزن‌های Qwen3.8-Max را منتشر کند؛ اما عبارت Open Weight با «متن‌باز کامل» یکسان نیست. در مدل Open Weight، توسعه‌دهندگان می‌توانند وزن‌های آموزش‌دیده را دانلود و در صورت اجازه مجوز، آن را اجرا یا شخصی‌سازی کنند. اما ممکن است موارد زیر منتشر نشوند: تا زمانی که مجوز نهایی، مدل‌کارت و فایل‌های رسمی منتشر نشوند، بهتر است Qwen3.8-Max را مدلی با وعده انتشار وزن‌ها بنامیم، نه یک مدل کاملاً متن‌باز. انتشار وزن‌های مدل چه اهمیتی دارد؟ اگر Alibaba

...

DeepSeek V4-Flash چیست؟ بررسی مدل فوق‌ارزان جدید هوش مصنوعی

استفاده از مدل‌های قدرتمند هوش مصنوعی دیگر فقط به خرید اشتراک یک چت‌بات محدود نمی‌شود. وقتی یک کسب‌وکار بخواهد هوش مصنوعی را در چت پشتیبانی، تولید محتوا، تحلیل اسناد یا ایجنت‌های خودکار به کار بگیرد، باید بابت میلیون‌ها توکن ورودی و خروجی هزینه پرداخت کند. این هزینه در مقیاس بالا می‌تواند به یکی از موانع اصلی توسعه محصولات هوش مصنوعی تبدیل شود. حتی اختلاف چند دلار در قیمت هر میلیون توکن، برای سرویسی که روزانه میلیون‌ها درخواست پردازش می‌کند، رقم بزرگی خواهد بود. DeepSeek با مدل V4-Flash تلاش کرده این معادله را تغییر دهد. گزارش رویترز براساس ارزیابی Artificial Analysis نشان می‌دهد هزینه اجرای این مدل از تعدادی از مدل‌های شناخته‌شده بازار به‌مراتب پایین‌تر است؛ موضوعی که می‌تواند رقابت شرکت‌های هوش مصنوعی را از «قوی‌ترین مدل» به سمت «بهترین نسبت قیمت به عملکرد» سوق دهد. DeepSeek V4-Flash چیست؟ DeepSeek V4-Flash یک مدل زبانی متن‌باز با تمرکز بر سرعت، زمینه طولانی و هزینه پایین است. این مدل ورودی متنی دریافت می‌کند، خروجی متنی تولید می‌کند و از پنجره زمینه‌ای تا یک میلیون توکن پشتیبانی می‌کند. براساس مشخصات Artificial Analysis، نسخه بررسی‌شده این مدل در مجموع ۲۸۴ میلیارد پارامتر دارد، اما در هر توکن فقط حدود ۱۳ میلیارد پارامتر آن فعال می‌شوند. این ساختار به مدل اجازه می‌دهد بدون فعال کردن تمام ظرفیت شبکه در هر درخواست، هزینه محاسباتی را کاهش دهد. مدل همچنین با مجوز MIT و به‌صورت Open Weights ارائه شده است. V4-Flash در دو حالت اصلی ارزیابی شده است: عبارت Flash نیز معمولاً در نام مدل‌هایی استفاده می‌شود که برای سرعت و هزینه کمتر نسبت به نسخه‌های پرچم‌دار بهینه شده‌اند. بااین‌حال، DeepSeek V4-Flash صرفاً یک مدل کوچک و ساده نیست؛ بلکه مدلی بزرگ با معماری بهینه برای استنتاج اقتصادی است. قیمت DeepSeek V4-Flash چقدر است؟ براساس قیمت ثبت‌شده برای API رسمی DeepSeek، هزینه استفاده از V4-Flash به این صورت است: Artificial Analysis نرخ ترکیبی این مدل را با فرض استفاده گسترده از کش، حدود ۰٫۰۶ دلار به‌ازای یک میلیون توکن محاسبه کرده است. قیمت نهایی ممکن است با توجه به ارائه‌دهنده API و نوع استفاده متفاوت باشد. چرا قیمت توکن اهمیت دارد؟ توکن واحد تقریبی محاسبه متن در مدل‌های زبانی است. هر پیام، سند یا پاسخ به تعدادی توکن تبدیل می‌شود و توسعه‌دهنده متناسب با حجم ورودی و خروجی هزینه می‌پردازد. قیمت پایین‌تر می‌تواند هزینه این کاربردها را کاهش دهد: برای یک کاربر عادی، اختلاف چند سنت شاید مهم به نظر نرسد؛ اما برای یک محصول بزرگ، همین تفاوت می‌تواند هزینه ماهانه زیرساخت را به‌طور چشمگیری تغییر دهد. مقایسه هزینه DeepSeek V4-Flash با رقبا رویترز با استناد به Artificial Analysis گزارش داده است که هزینه متوسط اجرای هر وظیفه ارزیابی برای V4-Flash حدود ۳ سنت بوده است. این رقم برای تعدادی از مدل‌های مطرح به شکل زیر گزارش شد: مدل هوش مصنوعی هزینه متوسط هر وظیفه ارزیابی DeepSeek V4-Flash حدود ۰٫۰۳ دلار Kimi K3 حدود ۰٫۸۶ دلار GPT-5.6 Sol حدود ۱٫۸۶ دلار Claude Fable 5 حدود ۳٫۱۵ دلار این جدول قیمت مستقیم API را مقایسه نمی‌کند؛ بلکه هزینه واقعی تولید خروجی در مجموعه آزمون‌های Artificial Analysis را نشان می‌دهد. طول پاسخ، تعداد توکن مصرفی و میزان تلاش استدلالی می‌تواند روی هزینه هر وظیفه اثر بگذارد. بر همین مبنا، هزینه اجرای V4-Flash در این ارزیابی حدود ۲۹ برابر کمتر از Kimi K3، حدود ۶۲ برابر کمتر از GPT-5.6 Sol و بیش از ۱۰۰ برابر کمتر از Claude Fable 5 بوده است. این اختلاف به معنی آن نیست که DeepSeek در همه وظایف بهتر از رقبا عمل می‌کند. نتیجه اصلی این است که این مدل می‌تواند سطح قابل‌توجهی از توانایی را با هزینه بسیار کمتری ارائه دهد. آیا DeepSeek V4-Flash واقعاً قدرتمند است؟ قیمت پایین تنها زمانی اهمیت دارد که مدل بتواند کیفیت قابل‌قبولی نیز ارائه دهد. صفحه فعلی Artificial Analysis برای نسخه استدلالی با حداکثر تلاش، امتیاز ۴۰ را در Intelligence Index ثبت کرده است. این مدل در میان مدل‌های هم‌رده خود بالاتر از میانگین قرار دارد و سرعت تولید آن نیز حدود ۱۱۵ تا ۱۱۸ توکن در ثانیه گزارش شده است. نسخه غیر استدلالی امتیاز ۲۹ و سرعتی نزدیک به ۱۱۷ توکن در ثانیه دارد. البته یک نکته مهم وجود دارد: امتیازهای بنچمارک ممکن است با تغییر نسخه آزمون، تنظیمات میزان تلاش و به‌روزرسانی روش ارزیابی تغییر کنند. به همین دلیل نباید تنها با یک عدد درباره کیفیت نهایی مدل تصمیم گرفت. Artificial Analysis همچنین V4-Flash را مدلی نسبتاً پرحرف توصیف کرده است. نسخه Max Effort در ارزیابی این مؤسسه ۲۳۰ میلیون توکن خروجی تولید کرده که از میانه مدل‌های قابل مقایسه بیشتر بوده است. پرحرف بودن می‌تواند بخشی از مزیت قیمت پایین را در بعضی کاربردها کاهش دهد؛ زیرا هزینه نهایی فقط به نرخ هر توکن وابسته نیست، بلکه تعداد توکن‌های تولیدشده نیز مهم است. چرا DeepSeek V4-Flash ارزان است؟ کاهش هزینه این مدل را می‌توان به چند عامل مرتبط دانست. نخست، معماری آن به‌گونه‌ای طراحی شده که فقط بخشی از پارامترها برای هر توکن فعال شوند. این رویکرد شبیه معماری Mixture of Experts است و می‌تواند مصرف محاسباتی را نسبت به فعال‌سازی کامل مدل کاهش دهد. دوم، DeepSeek روی بهینه‌سازی استنتاج و استفاده از کش تمرکز کرده است. قیمت ورودی کش‌شده این مدل تا ۹۸ درصد کمتر از ورودی عادی گزارش شده است. این ویژگی برای گفت‌وگوهای طولانی، اسناد تکراری و ایجنت‌هایی که بارها از یک زمینه مشترک استفاده می‌کنند، اهمیت زیادی دارد. همچنین پژوهش‌های مرتبط با معماری DeepSeek V4 نشان داده‌اند که می‌توان با روش‌های توجه پراکنده، مقدار حافظه لازم برای نگهداری زمینه‌های بسیار طولانی را به‌شدت کاهش داد. البته این پژوهش را نباید لزوماً معادل دقیق زیرساخت تجاری V4-Flash دانست، اما نشان‌دهنده تمرکز فنی اکوسیستم DeepSeek بر کاهش هزینه پردازش زمینه‌های طولانی است. جنگ قیمت مدل‌های هوش مصنوعی چیست؟ تا چند سال پیش، رقابت شرکت‌های هوش مصنوعی بیشتر حول اندازه مدل، تعداد پارامترها و امتیاز بنچمارک‌ها شکل می‌گرفت. اکنون هزینه اجرای مدل نیز به یک معیار اصلی تبدیل شده است. DeepSeek، Moonshot AI، Alibaba، Google، OpenAI و Anthropic برای جذب توسعه‌دهندگان و مشتریان سازمانی رقابت می‌کنند. مدل‌های ارزان‌تر می‌توانند حجم بیشتری از درخواست‌ها را پردازش کنند و ورود استارتاپ‌ها به بازار را آسان‌تر سازند. Axios این روند را «رقابت به سمت صفر» توصیف کرده

...

پیشرفت‌های انقلابی هوش مصنوعی در ریاضیات: بررسی ۱۰ دستاورد جدید مدل Astra

هوش مصنوعی مدل Astra متعلق به OpenAI توانسته است در حل ۱۰ مسئله بنیادین و تاریخی ریاضیات و علوم کامپیوتر نظری پیشرفت‌های چشمگیری ایجاد کند....

آیا هوش مصنوعی در تشخیص پزشکی قابل اعتماد است؟ یافته‌های جدید پژوهش MIT

ابزارهای هوش مصنوعی می‌توانند تصاویر پزشکی را تحلیل کنند، بیماری‌های احتمالی را پیشنهاد دهند و حتی دلیل تشخیص خود را با زبانی ساده توضیح دهند. این قابلیت‌ها ممکن است در نگاه اول استفاده از هوش مصنوعی برای تشخیص بیماری را کاملاً منطقی و مطمئن نشان دهند. اما مشکل زمانی آغاز می‌شود که پاسخ هوش مصنوعی اشتباه باشد. یک توضیح روان، علمی‌نما و با اعتمادبه‌نفس می‌تواند باعث شود کاربر پاسخ نادرست مدل را بپذیرد؛ به‌خصوص اگر دانش پزشکی کافی برای ارزیابی آن نداشته باشد. پژوهش جدیدی از محققان MIT و چند دانشگاه دیگر نشان می‌دهد هوش مصنوعی در تشخیص پزشکی برای همه کاربران به یک اندازه مفید نیست. پزشکان و افراد غیرمتخصص از یک پیشنهاد مشابه AI برداشت متفاوتی دارند و توضیحات بیشتر نیز همیشه به تصمیم دقیق‌تر منجر نمی‌شوند. پژوهش جدید MIT درباره هوش مصنوعی پزشکی چه چیزی را بررسی کرد؟ این پژوهش با هدف بررسی تأثیر سطح تخصص کاربران بر استفاده از ابزارهای هوش مصنوعی پزشکی انجام شد. محققان می‌خواستند بدانند آیا توضیح‌پذیر کردن پاسخ‌های AI می‌تواند به افراد کمک کند تشخیص درست‌تری داشته باشند و خطاهای مدل را بهتر شناسایی کنند. در این مطالعه، دو گروه مورد بررسی قرار گرفتند: افراد غیرمتخصص باید با مشاهده تصویر یک خال پوستی تشخیص می‌دادند که آیا احتمال سرطانی بودن آن وجود دارد یا خیر. پزشکان وظیفه دشوارتری داشتند و باید برای تصاویر بیماری‌های پوستی، تشخیص افتراقی ارائه می‌کردند. شرکت‌کنندگان ابتدا در برخی موارد بدون کمک هوش مصنوعی تصمیم گرفتند و در موارد دیگر، یکی از چند نوع راهنمایی AI را دریافت کردند. هوش مصنوعی چگونه به شرکت‌کنندگان کمک کرد؟ پژوهشگران چهار شیوه ارائه اطلاعات را با یکدیگر مقایسه کردند: هدف از این روش‌ها آن بود که کاربر فقط یک پاسخ نهایی دریافت نکند و بتواند شواهد یا توضیحی درباره تصمیم مدل ببیند. این دسته از روش‌ها معمولاً با عنوان هوش مصنوعی توضیح‌پذیر یا Explainable AI شناخته می‌شوند. فرض اصلی این است که اگر مدل دلیل تصمیم خود را توضیح دهد، کاربر بهتر می‌تواند تشخیص دهد چه زمانی باید به آن اعتماد کند. نتایج این پژوهش نشان داد این فرض همیشه درست نیست. نتیجه پژوهش MIT؛ هوش مصنوعی برای همه کاربران یکسان عمل نمی‌کند کمک هوش مصنوعی به‌طور کلی دقت هر دو گروه را افزایش داد، اما دلیل این بهبود در پزشکان و افراد غیرمتخصص متفاوت بود. افراد غیرمتخصص بیشتر به این دلیل عملکرد بهتری داشتند که از پیشنهاد هوش مصنوعی پیروی می‌کردند. از آنجا که مدل مورد استفاده در بسیاری از نمونه‌ها تشخیص درستی داشت، این وابستگی در مجموع باعث افزایش دقت آن‌ها شد. اما همین رفتار هنگام اشتباه بودن مدل به یک نقطه‌ضعف جدی تبدیل شد. افراد غیرمتخصص معمولاً توانایی کمتری برای تشخیص خطای سیستم داشتند و حتی زمانی که هوش مصنوعی پاسخ نادرستی ارائه می‌کرد، احتمال داشت نظر خود را با پیشنهاد مدل هماهنگ کنند. محققان این رفتار را نوعی تبعیت از الگوریتم دانستند. در مقابل، پزشکان معمولاً پیش از مشاهده پاسخ AI، یک نظر اولیه بر اساس آموزش و تجربه خود داشتند. آن‌ها پیشنهاد مدل را با دانش پزشکی‌شان مقایسه می‌کردند و در نتیجه بهتر می‌توانستند خطاهای آن را تشخیص دهند. چرا توضیحات هوش مصنوعی همیشه مفید نیستند؟ یکی از مهم‌ترین یافته‌های پژوهش، تأثیر توضیحات متنی تولیدشده توسط مدل‌های زبانی بود. افراد غیرمتخصص توضیحات مدل زبانی را هم در زمان درست بودن و هم هنگام اشتباه بودن پاسخ، قابل‌اعتماد می‌دانستند. حتی توضیحاتی که مبهم، کلی یا عمومی بودند، گاهی برای آن‌ها متقاعدکننده‌تر به نظر می‌رسیدند. این مسئله نشان می‌دهد یک پاسخ دارای توضیح الزاماً پاسخ مطمئن‌تری نیست. مدل زبانی می‌تواند برای یک تشخیص نادرست نیز متنی منسجم و ظاهراً منطقی تولید کند. خطر اصلی این است که کاربر ممکن است کیفیت نگارش توضیح را با صحت پزشکی آن اشتباه بگیرد. در این پژوهش، اثر تبعیت از هوش مصنوعی هنگام استفاده از توضیحات مدل زبانی بیشتر بود و افراد غیرمتخصص حتی نسبت به پاسخ‌های غلط خود اطمینان بیشتری پیدا می‌کردند. این پدیده به سوگیری اتوماسیون مربوط است؛ یعنی تمایل افراد به اعتماد بیش از حد به پیشنهادهای سیستم‌های خودکار، حتی زمانی که احتمال اشتباه وجود دارد. مسئله شفافیت فقط به پزشکی محدود نیست و پژوهشگران در حوزه شفافیت عصبی مدل‌های هوش مصنوعی نیز تلاش می‌کنند بفهمند این سامانه‌ها چگونه به پاسخ نهایی می‌رسند. تفاوت استفاده پزشکان و افراد عادی از هوش مصنوعی پزشکی ویژگی افراد غیرمتخصص پزشکان نظر اولیه پیش از مشاهده پاسخ AI معمولاً ضعیف‌تر مبتنی بر آموزش و تجربه اعتماد به پیشنهاد مدل بیشتر محتاطانه‌تر توانایی تشخیص خطای مدل کمتر بیشتر تأثیر توضیحات مدل زبانی بسیار زیاد محدودتر بهترین نوع کمک AI نیازمند طراحی محافظتی پیش‌بینی ساده مدل پزشکان در این پژوهش در برابر توضیحات اشتباه هوش مصنوعی مقاوم‌تر بودند. جالب‌تر اینکه بهترین عملکرد آن‌ها زمانی ثبت شد که فقط پیش‌بینی مدل را بدون توضیحات اضافه دریافت کردند. توضیحات مدل زبانی کمترین بهبود را برای پزشکان ایجاد کرد. این نتیجه نشان می‌دهد افزودن اطلاعات بیشتر به رابط کاربری همیشه به تصمیم بهتر منجر نمی‌شود. گاهی توضیح اضافی می‌تواند باعث حواس‌پرتی، سوگیری یا پیچیده شدن تصمیم‌گیری شود. زمان نمایش پیشنهاد هوش مصنوعی نیز مهم است محققان دریافتند زمان ارائه توضیحات AI بر میزان اعتماد کاربران اثر می‌گذارد. وقتی توضیح هوش مصنوعی پیش از آنکه فرد فرصت کند نظر خودش را شکل دهد نمایش داده می‌شد، کاربران وابستگی بیشتری به مدل پیدا می‌کردند. در مقابل، اگر ابتدا از کاربر خواسته شود فرضیه یا تشخیص اولیه خود را بیان کند و سپس پیشنهاد AI را ببیند، احتمال بیشتری وجود دارد که پاسخ مدل را به‌صورت انتقادی بررسی کند. بر همین اساس، پژوهشگران پیشنهاد می‌کنند سیستم‌های پزشکی به‌جای آنکه بلافاصله یک پاسخ کامل و متقاعدکننده ارائه دهند، ابتدا کاربر را وادار به تفکر مستقل کنند و سپس گزینه‌های احتمالی دیگری را نشان دهند. آیا هوش مصنوعی در تشخیص پزشکی قابل اعتماد است؟ پاسخ به این سؤال به نحوه استفاده از هوش مصنوعی بستگی دارد. AI می‌تواند در برخی وظایف پزشکی بسیار مفید باشد؛ از جمله: در پژوهش MIT، مدل‌های هوش مصنوعی در مواردی که نشانه‌های بیماری ظریف بودند، عملکرد بهتری از انسان داشتند. با این حال، انسان‌ها هنگام وجود علائم غیرمعمول یا ویژگی‌های نامرتبط در تصویر، بهتر از مدل عمل کردند. این تفاوت نشان می‌دهد هوش مصنوعی و انسان نقاط

...

GPT-Live چیست؟ آشنایی با سیستم جدید مکالمه صوتی OpenAI

مکالمه صوتی با هوش مصنوعی در سال‌های اخیر پیشرفت زیادی کرده است، اما هنوز یک مشکل مهم باقی مانده: تأخیر و مکث‌های غیرطبیعی در گفت‌وگو. کاربر باید صحبتش را تمام کند، سیستم پایان جمله را تشخیص دهد و سپس مدل شروع به پردازش و پاسخ‌گویی کند. اگر این تشخیص زود انجام شود، صحبت کاربر قطع می‌شود و اگر دیر انجام شود، گفت‌وگو کند و مصنوعی به نظر می‌رسد. OpenAI برای حل این مشکل از سیستم جدیدی به نام GPT-Live رونمایی کرده است؛ فناوری‌ای که می‌تواند هم‌زمان صدای کاربر را دریافت کند و پاسخ صوتی ارائه دهد. هدف این سیستم، نزدیک کردن مکالمه با هوش مصنوعی به ریتم طبیعی گفت‌وگوی انسان‌هاست. GPT-Live چیست؟ GPT-Live نسل سوم سیستم صوتی OpenAI برای ایجاد مکالمه‌های سریع، پیوسته و بلادرنگ است. این فناوری به مدل اجازه می‌دهد بدون منتظر ماندن برای پایان کامل صحبت کاربر، جریان صدا را پردازش کند و در زمان مناسب پاسخ دهد. در سیستم‌های صوتی قدیمی، یک مدل کوچک به نام Turn Detector وظیفه داشت تشخیص دهد کاربر چه زمانی صحبتش را تمام کرده است. تنها پس از تصمیم این سیستم، مدل زبانی اصلی می‌توانست پردازش درخواست را آغاز کند. GPT-Live این تشخیص‌دهنده جداگانه را از مسیر اصلی صدا حذف کرده و کنترل جریان مکالمه را به خود مدل صوتی سپرده است. در نتیجه، مدل بهتر می‌تواند تشخیص دهد چه زمانی گوش دهد، چه زمانی صحبت کند و چه زمانی اجازه دهد کاربر پاسخ را قطع کند. OpenAI این سیستم را در تاریخ ۳ اوت ۲۰۲۶ معرفی کرد و اعلام کرد که توسعه زیرساخت آن حدود شش ماه زمان برده است. این فناوری در حال حاضر پایه بخشی از قابلیت‌های ChatGPT Voice را تشکیل می‌دهد. GPT-Live چگونه کار می‌کند؟ مهم‌ترین ویژگی GPT-Live، استفاده از معماری Full-Duplex یا ارتباط دوطرفه هم‌زمان است. در یک مکالمه صوتی معمولی با هوش مصنوعی، ارتباط اغلب نوبتی است: اما در GPT-Live، ورودی و خروجی صوتی می‌توانند به‌صورت هم‌زمان جریان داشته باشند. مدل در حالی که صدای کاربر را دریافت می‌کند، می‌تواند صحبت کند، مکث کند یا واکنش کوتاهی نشان دهد. این موضوع باعث می‌شود تعامل‌هایی مانند موارد زیر طبیعی‌تر شوند: OpenAI می‌گوید وظیفه اصلی معماری جدید، حفظ یک جریان صوتی بدون وقفه است. پردازش صدا در مسیر اصلی انجام می‌شود و کارهای سنگین‌تر مانند استفاده از ابزارها یا استدلال پیچیده، به مسیرهای جداگانه انتقال پیدا می‌کنند. تفاوت GPT-Live با حالت صوتی قبلی ChatGPT چیست؟ نسل‌های قبلی قابلیت صوتی ChatGPT نیز امکان گفت‌وگوی مستقیم را فراهم می‌کردند، اما معماری آن‌ها همچنان تا حد زیادی به مکالمه نوبتی وابسته بود. تفاوت اصلی GPT-Live را می‌توان در جدول زیر مشاهده کرد: ویژگی سیستم صوتی قبلی GPT-Live شیوه مکالمه نوبتی پیوسته و هم‌زمان تشخیص پایان صحبت متکی به Turn Detector کنترل‌شده توسط مدل امکان قطع پاسخ محدودتر طبیعی‌تر و سریع‌تر پردازش صوت مرحله‌ای جریان دائمی صوت استفاده از مدل‌های دیگر ممکن است باعث مکث شود در مسیر جداگانه انجام می‌شود حس مکالمه شبیه پرسش و پاسخ نزدیک‌تر به گفت‌وگوی انسانی در روش‌های قدیمی‌تر، حتی مدل‌های Speech-to-Speech نیز برای شروع پردازش منتظر تصمیم تشخیص‌دهنده پایان صحبت می‌ماندند. GPT-Live این محدودیت را کاهش می‌دهد و اجازه می‌دهد خود مدل صوتی مدیریت مکالمه را بر عهده بگیرد. OpenAI چگونه تأخیر مکالمه صوتی را کاهش داده است؟ طبیعی بودن مکالمه فقط به قدرت مدل وابسته نیست. انتقال صدا، وضعیت شبکه، اجرای ابزارها و مدیریت سابقه مکالمه نیز می‌توانند باعث ایجاد تأخیر شوند. OpenAI برای کاهش این تأخیر، مسیر انتقال صدا را از منطق برنامه جدا کرده است. صوت میان دستگاه کاربر و مدل از یک مسیر سریع و اختصاصی عبور می‌کند؛ در حالی که کارهایی مانند جست‌وجو، فراخوانی ابزار یا اجرای سرویس‌های جانبی در یک مسیر غیرهم‌زمان انجام می‌شوند. بنابراین اگر یک ابزار یا سرویس خارجی با تأخیر پاسخ دهد، جریان صوتی مکالمه متوقف نمی‌شود. همچنین OpenAI بخشی از زیرساخت قبلی مبتنی بر Python asyncio را با زبان Go بازنویسی کرده است. بر اساس توضیحات این شرکت، این تغییر باعث شده انتقال فریم‌های صوتی روان‌تر و پایدارتر شود. نقش WebRTC در GPT-Live GPT-Live برای انتقال صوت از WebRTC استفاده می‌کند؛ فناوری‌ای که برای ارتباطات صوتی و تصویری بلادرنگ طراحی شده است. WebRTC می‌تواند در شرایطی مانند افت بسته‌های شبکه، تغییر اتصال یا ناهماهنگی زمان‌بندی همچنان ارتباط را حفظ کند. برای مثال، اگر بخشی از صدا دیر برسد، سیستم می‌تواند پخش آن را کمی تنظیم کند تا از ایجاد سکوت یا پرش صوتی جلوگیری شود. پروتکل WARP چیست؟ راه‌اندازی معمولی WebRTC نیازمند چندین مرحله ارتباط میان کاربر و سرور است. این مراحل می‌توانند شروع مکالمه را به تأخیر بیندازند. OpenAI برای حل این مشکل، پروتکلی به نام WebRTC Abridged Roundtrip Protocol یا WARP توسعه داده است. این پروتکل تعداد رفت‌وبرگشت‌های شبکه برای شروع انتقال صدا و داده را از شش مرحله به یک مرحله کاهش می‌دهد. در کنار WARP، قابلیتی به نام Instant Connect نیز پارامترهای لازم برای اتصال را پیشاپیش آماده می‌کند. به این ترتیب، کاربر می‌تواند سریع‌تر وارد مکالمه صوتی شود. نقش GPT-5.5 در GPT-Live چیست؟ GPT-Live برای پاسخ‌های سریع و مکالمه طبیعی طراحی شده است، اما همه درخواست‌ها را به‌تنهایی پردازش نمی‌کند. اگر کاربر پرسشی مطرح کند که به استدلال عمیق، جست‌وجو یا استفاده از ابزار نیاز داشته باشد، GPT-Live می‌تواند از مدل‌های قدرتمندتری مانند GPT-5.6 کمک بگیرد. این فرایند در یک مسیر جداگانه انجام می‌شود. مدل صوتی می‌تواند در زمان پردازش درخواست، جریان گفت‌وگو را حفظ کند و پس از آماده شدن نتیجه، آن را وارد پاسخ کند. OpenAI این معماری را جداسازی «صحبت کردن» از «تفکر عمیق‌تر» توصیف می‌کند. هدف این است که استفاده از مدل‌های قدرتمند و ابزارها، باعث سکوت طولانی یا قطع مکالمه نشود. GPT-Live چه کاربردهایی دارد؟ معماری GPT-Live می‌تواند زمینه‌ساز نسل جدیدی از محصولات صوتی باشد. برخی از مهم‌ترین کاربردهای آن عبارت‌اند از: OpenAI اعلام کرده است که این زیرساخت در ChatGPT Voice برای قابلیت‌هایی مانند کنترل رایانه و هماهنگ کردن ایجنت‌ها در اپلیکیشن دسکتاپ ChatGPT نیز مورد استفاده قرار می‌گیرد. آیا GPT-Live اکنون در دسترس کاربران است؟ فناوری پشت GPT-Live در حال حاضر بخشی از زیرساخت ChatGPT Voice است، اما OpenAI هنوز GPT-Live API را به‌صورت عمومی منتشر نکرده است. این شرکت اعلام کرده که معماری جدید، زیربنای API آینده GPT-Live خواهد بود. با

...

زنگ خطر جدید برای بازار کار: هوش مصنوعی شغل‌ ها را نمی‌گیرد، جیب‌ها را خالی می‌کند!

از زمان معرفی عمومی چت‌بات‌های هوشمند و آغاز عصر جدید تکنولوژی، یک ترس مشترک و سایه‌ای سنگین بر جوامع بشری ریشه دواند: «ربات‌ها قرار است ما را اخراج کنند». در دو سال گذشته، تیتر اخبار پر از پیش‌بینی‌های آخرالزمانی درباره جایگزینی کامل نیروی کار انسانی با ماشین‌ها بود. اما اکنون که زمان کافی برای بررسی داده‌های واقعی اقتصاد سپری شده است، واقعیت کف بازار کار مسیر کاملاً متفاوتی را نشان می‌دهد. بر اساس یک گزارش جامع، تکان‌دهنده و ساختارشکن که اخیراً توسط موسسه Apollo (یکی از بزرگترین شرکت‌های مدیریت سرمایه در جهان) منتشر شده است، خطر اصلی و فوری در بازار کار، اخراج‌های دسته‌جمعی نیست؛ بلکه پدیده‌ای خاموش‌تر اما به همان اندازه مخرب در جریان است: شرکت‌ها در حال مصادره سود حاصل از بهره‌وری هوش مصنوعی از طریق سرکوب و کاهش رشد دستمزدها (Wage Compression) هستند. داده‌های این تحقیق به صراحت نشان می‌دهند مشاغلی که به شدت با ابزارهای هوش مصنوعی درگیر شده‌اند، پس از سال ۲۰۲۳ میلادی با کاهش ۶.۷ درصدی در رشد دستمزدهای واقعی خود مواجه بوده‌اند، در حالی که نرخ اشتغال آن‌ها تغییر منفی معناداری نکرده است. این پدیده، درک کلاسیک ما را از آینده شغلی با هوش مصنوعی کاملاً دگرگون می‌کند؛ آینده‌ای که در آن حفظ کردن صندلی و داشتن یک شغل، دیگر به معنای تضمین یک درآمد ایده‌آل، رو به رشد و متناسب با تورم نخواهد بود. عبور از پیش‌بینی‌های تئوری به واقعیت کف بازار برای درک اهمیت این گزارش، باید به نحوه ارزیابی تاثیر هوش مصنوعی در سال‌های گذشته نگاه کنیم. تا پیش از این، ادبیات تحقیق درباره تاثیر هوش مصنوعی بر نیروی کار به شدت بر «تئوری» و «احتمالات» متکی بود. محققان با استفاده از پایگاه‌های داده‌ای مانند O*NET (پایگاه اطلاعات مشاغل وزارت کار آمریکا)، شرح وظایف روی کاغذِ مشاغل را بررسی می‌کردند تا حدس بزنند کدام کارها ممکن است توسط ماشین‌ها انجام شوند. در این گزارش به وضوح اشاره شده است که تحقیقات قبلی (نسل اول تحقیقات هوش مصنوعی) تنها نشان می‌دادند که هوش مصنوعی «چه کارهایی را می‌تواند انجام دهد»، نه اینکه «مردم در واقعیت چگونه از آن استفاده می‌کنند». اما نقطه قوت و تمایز بی‌نظیر گزارش Apollo، تکیه بر داده‌های استفاده واقعی (Observed Usage) است. این موسسه با بهره‌گیری از شاخص اقتصادی شرکت Anthropic (شرکت سازنده هوش مصنوعی کلود که یکی از رقبا و شرکای کلیدی در توسعه بهترین ابزارهای هوش مصنوعی ۲۰۲۶ است) و تحلیل لاگ‌های واقعی مکالمات کاربران، تاثیر ملموس این ابزارها را اندازه‌گیری کرده است. نتایج نشان می‌دهد وقتی کارمندان در عمل از این سیستم‌ها برای انجام کارهایشان استفاده می‌کنند، ارزش افزوده این کار مستقیماً به جیب کارفرما می‌رود، نه کارمند. کارفرمایان متوجه شده‌اند که با کمک هوش مصنوعی، کارهای پیچیده توسط افراد با مهارت کمتر نیز قابل انجام است، در نتیجه قدرت چانه‌زنی کارمندان برای افزایش حقوق به شدت افت می‌کند. متدولوژی تحقیق: اثبات کاهش دستمزد بدون افت اشتغال موسسه Apollo برای رسیدن به این نتایج، از یک مدل اقتصادسنجی دقیق به نام «تفاضل در تفاضل» (Difference-in-Differences یا DiD) استفاده کرده است. آن‌ها داده‌های اشتغال و دستمزد ۳۲۱ شغل مختلف را از سال ۲۰۱۵ تا ۲۰۲۵ مورد بررسی قرار دادند و سال ۲۰۲۳ (سال پس از عرضه عمومی چت‌بات‌های پیشرفته) را به عنوان نقطه شکست ساختاری (Structural Break) در نظر گرفتند. یافته‌های این مدل آماری به صورت زیر خلاصه می‌شود: شکاف طبقاتی: اقتصاد هوش مصنوعی با چه کسانی بی‌رحم‌تر است؟ عمیق‌ترین و شاید تاریک‌ترین بخش این گزارش، بررسی تاثیر این پدیده بر دهک‌های مختلف درآمدی و حوزه‌های کاری متفاوت است. داده‌ها به وضوح اثبات می‌کنند که اقتصاد هوش مصنوعی به هیچ وجه عادلانه رفتار نمی‌کند و بار اصلی این تحول، بر دوش آسیب‌پذیرترین اقشار جامعه افتاده است. برای درک بهتر این شکاف طبقاتی، جدول زیر میزان تاثیرپذیری دستمزدهای واقعی را در گروه‌های مختلف نشان می‌دهد: گروه شغلی / دهک درآمدی میزان تاثیر بر رشد دستمزد وضعیت اشتغال تحلیل وضعیت کارمندان بخش خدمات (Service) -۲۴.۳٪ (کاهش شدید) بدون تغییر معنادار بیشترین آسیب به دلیل اتوماسیونِ آسانِ وظایف پایه‌ای و خدماتی. پایین‌ترین دهک درآمدی (Q1) -۱۰.۷٪ (کاهش بالا) بدون تغییر معنادار کاهش شدید قدرت چانه‌زنی کارگران ساده در برابر کارفرمایان. مشاغل اداری و فروش (Sales/Office) -۷.۳٪ (کاهش متوسط) بدون تغییر معنادار جایگزینی بخشی از وظایف تحلیلی با ابزارهای هوش مصنوعی متنی. دهک بالای درآمدی (Top Quartile) بدون تغییر معنادار بدون تغییر معنادار استفاده از هوش مصنوعی به عنوان اهرم قدرت برای ارتقای جایگاه. کارگران یقه آبی (فیزیکی) بدون تغییر معنادار بدون تغییر معنادار عدم توانایی هوش مصنوعی در انجام کارهای فیزیکی و مهارتی در دنیای واقعی. مصونیت کامل پردرآمدها و مدیران ارشد همان‌طور که در جدول مشخص است، پردرآمدترین افراد جامعه (یک‌چهارم بالای توزیع درآمدی یا Top Quartile) هیچ تاثیر منفی و معناداری را روی دستمزدهای خود تجربه نکرده‌اند. این بدان معناست که مدیران ارشد، متخصصان رده‌بالا و تصمیم‌گیرندگان کلان با تسلط بر اقتصاد هوش مصنوعی در سازمان‌ها، نه‌تنها موقعیت خود را از دست نداده‌اند، بلکه این فناوری را به یک اهرم قدرت برای افزایش بهره‌وری شخصی و سازمانی خود تبدیل کرده‌اند. جالب اینجاست که کارگران یقه آبی (Blue-collar) و مشاغل کاملاً فیزیکی نظیر لوله‌کش‌ها یا کارگران ساختمانی نیز فعلاً از این ترکش‌ها کاملاً در امان مانده‌اند، زیرا هوش مصنوعی هنوز توانایی ورود به دنیای فیزیکی و انجام کارهای دستی پیچیده را پیدا نکرده است. آمار شوکه‌کننده: ۵.۸ میلیون کارگر و خسارت ۲۸ میلیارد دلاری این تغییرات تنها روی کاغذ نیستند. در حال حاضر، حدود ۵.۸ میلیون کارگر در ایالات متحده (معادل ۳.۷ درصد از کل نیروی کار) در مشاغلی با میزان درگیری بالا با هوش مصنوعی (نمره بالای ۰.۵ در شاخص آنتروپیک) مشغول به کار هستند. گزارش Apollo تخمین می‌زند که این فشردگی و سرکوب دستمزدها، سالانه منجر به ۲۸ میلیارد دلار خسارت و کاهش درآمد نیروی کار تنها در همین گروه ۵.۸ میلیون نفری می‌شود. این ۲۸ میلیارد دلار در واقع ثروتی است که از جیب نیروی کار خارج شده و مستقیماً به حاشیه سود شرکت‌ها و کارفرمایان افزوده می‌شود. نوک پیکان به سمت کدام مشاغل است؟ در این ارزیابی، مشاغلی مانند برنامه‌نویسان کامپیوتر (با نمره درگیری ۰.۷۵)، نمایندگان پشتیبانی مشتری (نمره ۰.۷۰)، متخصصان ورود اطلاعات (نمره ۰.۶۷) و تحلیل‌گران تحقیقات بازار در صدر لیست مشاغل در معرض خطر قرار دارند. با روی کار آمدن

...

معرفی هوش مصنوعی Lyria 3.5 گوگل؛ تحول تولید موسیقی با Google Flow

مدل Lyria 3.5 گوگل دیپ‌مایند با ادغام در پلتفرم Google Flow Music، کیفیت تولید موسیقی، وکال و کنترل خلاقانه توسط هوش مصنوعی را به سطح جدیدی ارتقا داده است....

ورود هوش مصنوعی به زیرساخت‌های کلان علمی؛ بررسی استراتژی توسعه علوم ملی

ادغام مدل‌های پیشرفته‌ی هوش مصنوعی با زیرساخت‌های کلان علمی و ابررایانه‌ها، با هدف تسریع کشفیات و دوبرابر کردن بهره‌وری پژوهش‌ها در دهه‌ی آینده در حال انجام است....

انقلاب دیپ‌مایند در امنیت سایبری؛ هوش مصنوعی پیش‌دستانه چگونه دولت‌ها و سازمان‌ها را نجات می‌دهد؟

گوگل دیپ‌مایند با رونمایی از فناوری دفاع سایبری پیش‌دستانه مبتنی بر هوش مصنوعی، تحولی بنیادین در کشف و ترمیم خودکار آسیب‌پذیری‌های امنیتی برای دولت‌ها و سازمان‌های بزرگ ایجاد کرده است....

ممنوعیت استفاده از هوش مصنوعی برای دانش‌آموزان در نیویورک؛ زنگ خطر برای یادگیری نسل جدید

مدارس دولتی شهر نیویورک استفاده از هوش مصنوعی را برای دانش‌آموزان تا پیش از ورود به مقطع دبیرستان به منظور حفاظت از مهارت‌های شناختی پایه ممنوع می‌کنند....

انویدیا از معماری ورا روبین رونمایی کرد؛ جهش ۳.۷ برابری پردازش هوش مصنوعی در MLPerf

انویدیا در بنچمارک MLPerf v6.1 با سیستم جدید Vera Rubin NVL72 موفق به ثبت جهش ۳.۷ برابری در استنتاج هوش مصنوعی و رشد ۳۰ برابری در پردازش عامل‌های هوشمند شد....

انقلابی که جهان ریاضیات و محاسبات را متحول کرد؛ از قضایای تاریخی تا الگوریتم‌های مدرن هوش مصنوعی

تحلیل دگرگونی‌های تاریخی و مدرن در علم ریاضیات و چگونگی تأثیرگذاری مستقیم اثبات‌های پیچیده بر هوش مصنوعی، امنیت داده‌ها و توسعه فناوری‌های محاسباتی آینده....

فرمان اجرایی جدید کالیفرنیا برای مهار هوش مصنوعی؛ از نظارت مستقل تا ایده کلید خاموشی اضطراری

فرماندار کالیفرنیا در فرمانی اجرایی، نظارت‌های مستقل بر مدل‌های بزرگ هوش مصنوعی و توسعه سازوکار دکمه توقف اضطراری (Kill Switch) را وارد فاز اجرایی کرد....

تاکید جنجالی مدیرعامل انویدیا: هوش مصنوعی باید با حداکثر سرعت ممکن توسعه یابد

جنسن هوانگ، مدیرعامل انویدیا، در تازه‌ترین اظهارات خود با رد ایده کندسازی هوش مصنوعی، خواستار شتاب حداکثری در توسعه این فناوری برای دستیابی به ایمنی و کارایی بالاتر شد....

گرمایش خانه‌ها با قدرت دیتاسنترها؛ هم‌افزایی هوش مصنوعی و بهینه‌سازی انرژی

دیتاسنترهای حرارتی با بازیافت گرمای حاصل از پردازش‌های سنگین ابری و هوش مصنوعی، آب گرم و گرمایش خانه‌ها را با هزینه‌ای نزدیک به صفر تأمین می‌کنند....

پاسخ قاطع مدیرعامل انویدیا به فرضیه آخرالزمان؛ احتمال نابودی جهان توسط هوش مصنوعی تا ۲۰۳۰ صفر درصد است!

جنسن هوانگ، مدیرعامل انویدیا، با رد ادعاهای ترسناک درباره خطرات وجودی هوش مصنوعی تا سال ۲۰۳۰، اعلام کرد که این فناوری تهدیدی برای بقای انسان نیست و احتمال نابودی دنیا صفر است....

انقلاب هوش مصنوعی در اسپاتیفای؛ ایجنت‌های مکالمه‌ای و داده‌های سنتتیک چگونه پیشنهاد موسیقی را متحول می‌کنند؟

اسپاتیفای از سیستم توصیه‌گر مکالمه‌ای نوینی رونمایی کرد که با داده‌های سنتتیک و حلقه‌های خوداصلاح‌گر، مدت گوش دادن کاربران را ۱۴ درصد افزایش داده است....

ابزارهای خاص و خلاقانه هوش مصنوعی که باید بشناسید!

ی توانستی بدون مهارت‌های پیچیده برنامه‌نویسی، یک انیمیشن حرفه‌ای بسازی! یا آهنگ هایی بسازی که حتی نرم‌افزارهای حرفه‌ای هم نتوانند آن را تولید کنند! اگر از آن دسته آدم‌هایی هستی که عاشق پیدا کردن اپلیکیشن‌ها و ابزارهای عجیب‌وغریب هستی که وقتی به دوستت نشان می‌دهی چشمانش برق می‌زند این مقاله برای تو نوشته شده! در این مقاله ابزارهای خاص و خلاقانه هوش مصنوعی که باید بشناسید را معرفی می کنم که خودم بیشتر آنها را استفاده کرده ام، پس برویم سراغ اصل مطلب! نام ابزار کاربرد اصلی سهولت استفاده قیمت‌گذاری Descript ویرایش صوت و ویدئو مبتنی بر متن، تولید پادکست و ویدئوهای حرفه‌ای بسیار کاربرپسند، رابط دیداری ساده رایگان (با محدودیت)، پریمیوم از 12 دلار/ماه Wonder Dynamics انیمیشن‌سازی و جلوه‌های ویژه، ادغام شخصیت‌های CG در ویدئوهای واقعی رابط نسبتاً پیچیده و نیاز به دانش فنی اشتراک پریمیوم (قیمت دقیق نامشخص، نیاز به بررسی سایت رسمی) Pictory تبدیل متن به ویدئو، تولید محتوای ویدئویی برای بازاریابی و شبکه‌های اجتماعی بسیار ساده است و مناسب برای غیرحرفه‌ای‌ها رایگان (محدود)، پریمیوم از 19 دلار/ماه Luma AI Genie تولید مدل‌ها و محیط‌های سه‌بعدی از متن یا تصویر، مناسب برای طراحی و انیمیشن نسبتاً ساده، اما نیاز به صبر برای پردازش رایگان (با محدودیت)، نسخه پریمیوم (قیمت دقیق نامشخص) Runway تولید و ویرایش ویدئو، تصویر و انیمیشن با هوش مصنوعی، ابزارهای خلاقانه چندمنظوره کاربرپسند، مناسب برای حرفه‌ای‌ها و مبتدیان رایگان (محدود)، پریمیوم از 15 دلار/ماه Descript اولین ابزاری که به شخصه تست کردم و از زبان فارسی هم به خوبی پشتیبانی می کند، هوش مصنوعی descript است. این هوش مصنوعی در واقع یک پلتفرم ویرایش صوتی و ویدیویی مبتنی بر هوش مصنوعی است که به شما کمک می کند تولید و ویرایش محتوا را راحت تر انجام دهید. مثلا می توانید فایل های صوتی یا ویدیویی خودتان را آپلود کرده و آن را به صورت متنی تحویل بگیرید! چی بهتر از این! یادم است چند وقت پیش به شدت دنبال چنین ابزاری بودم ولی نه ورژن فارسی پیدا می شد نه ورژنی که نسخه رایگان مناسبی داشته باشد. حالا این ابزار هر دو را یکجا دارد! البته ورژن رایگان آن محدود است و اگر می خواهید حرفه ای تر کار کنید، پیشنهاد میکنم ورژن پولی آن را خریداری کنید.خصوصیات کلیدی آن شامل تبدیل گفتار به متن (Speech-to-Text)، ویرایش صوتی و ویدیویی مبتنی بر متن، حذف نویز، افزودن زیرنویس، و ابزارهای همکاری تیمی است. به طور خلاصه اگر جزو افراد زیر هستید، حسابی به کارتان می آید: ویژگی‌های اصلی Descript: نکته: توجه کنید که دقت تبدیل گفتار به متن در زبان فارسی ممکن است به اندازه زبان انگلیسی بالا نباشد به این دلیل که هوش مصنوعی Descript در درجه اول برای زبان‌های پراستفاده مانند انگلیسی بهینه‌سازی شده است. برای پروژه‌هایی که نیاز به دقت بالا در زبان فارسی دارند، ممکن است نیاز به ویرایش دستی متن داشته باشید. قیمت و پلن ها پلن رایگان بودن ویژگی‌ها قیمت (ماهانه) قیمت (سالانه) Free بله – تبدیل گفتار به متن (محدود) – 1 ساعت رونوشت در ماه – ویرایش اولیه صوتی و ویدیویی – بدون Overdub – محدودیت‌های صادر کردن فایل رایگان رایگان Hobbyist خیر – 10 ساعت رونوشت در ماه – دسترسی به Overdub – ابزارهای ویرایش پیشرفته – حذف نویز پیشرفته – صادر کردن با کیفیت بالا 12 دلار 144 دلار (معادل 12 دلار/ماه) Pro خیر – 30 ساعت رونوشت در ماه – ویژگی‌های کامل Overdub – ابزارهای همکاری تیمی پیشرفته – پشتیبانی از زیرنویس چندزبانه – قابلیت‌های استودیویی 24 دلار 288 دلار (معادل 24 دلار/ماه) Enterprise خیر – ساعات رونوشت نامحدود – پشتیبانی اختصاصی – امنیت پیشرفته – ابزارهای سفارشی برای تیم‌های بزرگ – آموزش و پشتیبانی ویژه قیمت سفارشی قیمت سفارشی مزایا: معایب: Wonder dynamics این هوش مصنوعی که به آن wonder studio هم گفته می شود و تولید شرکت Autodesk است، برای ساده‌سازی فرآیند جلوه‌های بصری (VFX) و انیمیشن طراحی شده است. مثلا قبلا برای اینکه یک شخصیت کارتونی را داخل یک فیلم قرار دهیم، باید از کلی تجهیزات گران مثل موشن کپچر و نرم افزار های سنگین سه بعدی استفاده می کردیم. ولی حالا با Wonder dynamics فقط با یک دوربین ساده می‌توانی بازیگر را فیلم‌برداری کنی، و این ابزار خودش به‌طور خودکار آن حرکت‌ها را به شخصیت کارتونی یا دیجیتالی منتقل می‌کنn. (یعنی انیمیشن، نورپردازی و ترکیب‌بندی را به‌صورت خودکار انجام می‌دهد.) پس اگر جزو فیلم‌سازها، انیمیشن‌سازها، طراحان بازی، و حتی شرکت‌های تبلیغاتی این هوش مصنوعی خوراک خودت است! برخی ویژگی های آن شامل موارد زیر هستند: پشتیبانی از زبان فارسی دارد؟ طبق بررسی هایی که انجام دادم، Wonder dynamicsبه‌طور خاص از زبان انگلیسی پشتیبانی می‌کند و هیچ اشاره‌ای به پشتیبانی مستقیم از زبان فارسی در رابط کاربری یا فرآیندهای آن (مانند زیرنویس خودکار یا تشخیص گفتار) نشده. البته این ابزار عمدتاً بر پردازش ویدیوهای تک‌دوربینه و انیمیشن تمرکز دارد و نیازی به پردازش زبان در اکثر ویژگی‌های خود ندارد.  به طور خلاصه به‌شرطی که کاراکترها و صحنه‌ها نیازی به پردازش زبان نداشته باشند می توانید از این هوش مصنوعی استفاده خوبی داشته باشید.  پلن ها و قیمت ها با بررسی هایی که انجام دادم این هوش مصنوعی هیچگونه پلن رایگانی ندارد و پلن Pro آن از 19 دلار در ماه شروع می شود. پلن رایگان بودن ویژگی‌ها قیمت (ماهانه) Pro خیر 3000 اعتبار (معادل 150 ثانیه انیمیشن/لایو اکشن یا 750 ثانیه MoCap) – رزولوشن خروجی محدود – ذخیره‌سازی ابری محدود – حداکثر 1 کاراکتر سفارشی در ماه – حداکثر 1 بازیگر در پروژه 19 دلار Pro خیر 12000 اعتبار (معادل 600 ثانیه انیمیشن/لایو اکشن یا 3000 ثانیه MoCap) – رزولوشن خروجی بالاتر – ذخیره‌سازی ابری بیشتر – حداکثر 5 کاراکتر سفارشی در ماه – حداکثر 3 بازیگر در پروژه – خروجی ماسک آلفا و تصویر PNG – پروژه‌های پیشرفته لایو اکشن 99 دلار مزایا: معایب: Pictory اگر قصد ساخت ویدیو با هوش مصنوعی را دارید، Pictory یکی از بهترین گزینه ها برای شماست! در واقع یک پلتفرم آنلاین و هوش مصنوعی است که به شما این امکان را می‌دهد متن، وب‌سایت یا پاورپوینت را به‌سرعت به ویدیو تبدیل کنید. علاوه بر این، ویژگی هایی مانند استخراج زیرنویس خودکار، خلاصه‌سازی ویدیوهای طولانی، تولید Voice-over با صدای AI، و استفاده از تصاویر

...

رقابت جهانی هوش مصنوعی؛ چرا چین روی «حاکمیت دیجیتال» پافشاری می‌کند؟

چین با تاکید بر «حاکمیت دیجیتال» در رقابت هوش مصنوعی، به دنبال استقلال از فناوری‌های غربی و مقابله با تحریم‌های آمریکاست؛ رویکردی که جهان را به سمت دوپاره شدن اکوسیستم‌های فناوری پیش می‌برد....

معرفی پروژه AI Futures اوپن‌ای‌آی؛ آیا هوش مصنوعی به تمرکز مطلق قدرت منجر می‌شود؟

پروژه جدید AI Futures از OpenAI هشدار می‌دهد که سیستم‌های خودمختار ممکن است با حذف نیاز به نیروی انسانی، به تمرکز بی‌سابقه قدرت در دست دولت‌ها منجر شوند....

دمیس حسابیس کیست؟ تغییر بزرگ در DeepMind و آینده هوش مصنوعی گوگل

رقابت در دنیای هوش مصنوعی دیگر فقط به ساخت مدل‌های قدرتمندتر محدود نمی‌شود؛ ساختار سازمانی، رهبران علمی و نحوه تصمیم‌گیری شرکت‌ها نیز نقش مهمی در تعیین آینده این صنعت دارند. در سال‌های اخیر، شرکت‌هایی مانند OpenAI، Anthropic و Google DeepMind تلاش کرده‌اند علاوه بر توسعه مدل‌های پیشرفته، مسیر رسیدن به نسل بعدی هوش مصنوعی را نیز مشخص کنند. در همین شرایط، تغییر نقش دمیس حسابیس (Demis Hassabis)، یکی از مهم‌ترین چهره‌های تاریخ هوش مصنوعی، در Google DeepMind توجه زیادی را به خود جلب کرده است. حسابیس از مدیریت اجرایی روزمره فاصله گرفته، اما همچنان در ساختار DeepMind و Alphabet باقی می‌ماند و قرار است تمرکز بیشتری روی تحقیقات بلندمدت و مسیرهایی مانند هوش عمومی مصنوعی (AGI) داشته باشد. این تغییر یک سؤال مهم ایجاد کرده است: آیا گوگل در حال تغییر استراتژی خود در رقابت هوش مصنوعی است یا این تصمیم به حسابیس اجازه می‌دهد روی آینده بلندمدت AI تمرکز بیشتری داشته باشد؟ دمیس حسابیس کیست؟ دمیس حسابیس یکی از شناخته‌شده‌ترین پژوهشگران حوزه هوش مصنوعی و بنیان‌گذار DeepMind است. او پیش از ورود جدی به دنیای AI، در حوزه علوم کامپیوتر، علوم شناختی و علوم اعصاب فعالیت داشت و علاقه‌اش به ساخت سیستم‌هایی با توانایی یادگیری و حل مسئله، مسیر حرفه‌ای او را شکل داد. حسابیس در سال ۲۰۱۰ شرکت DeepMind را همراه با چند همکار دیگر تأسیس کرد. هدف اولیه این شرکت توسعه سیستم‌های هوش مصنوعی عمومی بود؛ سیستم‌هایی که بتوانند مانند انسان از تجربه یاد بگیرند و مسائل پیچیده را حل کنند. در سال ۲۰۱۴، گوگل DeepMind را خریداری کرد و این آزمایشگاه به یکی از مهم‌ترین مراکز تحقیقاتی هوش مصنوعی در جهان تبدیل شد. یکی از ویژگی‌های مهم DeepMind این بود که برخلاف بسیاری از شرکت‌های فناوری، تمرکز اصلی خود را روی تحقیقات بنیادی قرار داد؛ موضوعی که بعدها باعث شکل‌گیری پروژه‌هایی شد که فراتر از کاربردهای تجاری معمول بودند. مهم‌ترین دستاوردهای دمیس حسابیس و DeepMind DeepMind تحت مدیریت حسابیس چند پروژه تاریخی را توسعه داد که تأثیر زیادی بر مسیر هوش مصنوعی گذاشتند. پروژه اهمیت AlphaGo نشان داد هوش مصنوعی می‌تواند در یک بازی پیچیده مانند Go از انسان‌های برتر عبور کند AlphaFold پیش‌بینی ساختار پروتئین‌ها را با کمک AI متحول کرد Gemini تلاش گوگل برای رقابت مستقیم با مدل‌های پیشرفته شرکت‌هایی مانند OpenAI AlphaGo؛ لحظه‌ای که AI جهان را شگفت‌زده کرد در سال ۲۰۱۶، سیستم AlphaGo توانست لی سِدول، قهرمان مشهور بازی Go، را شکست دهد. این اتفاق اهمیت زیادی داشت، زیرا بازی Go برخلاف شطرنج دارای تعداد بسیار زیادی حالت ممکن است و مدت‌ها تصور می‌شد برای هوش مصنوعی بسیار دشوار باشد. موفقیت AlphaGo نشان داد الگوریتم‌های یادگیری عمیق و یادگیری تقویتی می‌توانند در مسائل پیچیده تصمیم‌گیری عملکردی فراتر از انتظار داشته باشند. AlphaFold؛ زمانی که AI وارد علوم زیستی شد یکی دیگر از بزرگ‌ترین موفقیت‌های DeepMind، پروژه AlphaFold بود. این سیستم توانست یکی از مسائل قدیمی زیست‌شناسی یعنی پیش‌بینی ساختار سه‌بعدی پروتئین‌ها را با دقت بالا حل کند. تأثیر AlphaFold فقط محدود به هوش مصنوعی نبود؛ این فناوری می‌تواند در حوزه‌هایی مانند: کاربرد داشته باشد. این پروژه نشان داد DeepMind تنها یک شرکت تولیدکننده مدل‌های زبانی نیست، بلکه تلاش می‌کند از AI برای حل مسائل علمی بزرگ استفاده کند. چه تغییری در نقش دمیس حسابیس اتفاق افتاده است؟ برخلاف برخی برداشت‌ها، دمیس حسابیس از DeepMind جدا نشده است. تغییر اصلی این است که او از مدیریت روزانه فاصله می‌گیرد و بیشتر روی نقش علمی و استراتژیک تمرکز خواهد کرد. هدف این تغییر می‌تواند چند موضوع باشد: در مقابل، Koray Kavukcuoglu که یکی از مدیران باسابقه DeepMind است، مسئولیت اجرایی بیشتری در مدیریت تیم‌ها و توسعه فناوری‌ها خواهد داشت. این مدل تقسیم نقش در شرکت‌های بزرگ فناوری معمول است؛ یک نفر روی چشم‌انداز بلندمدت و تحقیقات تمرکز می‌کند و تیم اجرایی، توسعه محصول و عملیات روزانه را پیش می‌برد. چرا گوگل چنین تغییری ایجاد کرده است؟ یکی از مهم‌ترین دلایل احتمالی این تغییر، فشار رقابت در بازار هوش مصنوعی است. در سال‌های اخیر، گوگل با رقبایی مانند: رقابت مستقیمی داشته است. در این رقابت، تنها داشتن تحقیقات علمی قوی کافی نیست؛ شرکت‌ها باید بتوانند فناوری خود را سریع‌تر به محصول تبدیل کنند. به همین دلیل، گوگل باید بین دو مسیر تعادل ایجاد کند: مسیر تحقیقاتی مسیر تجاری توسعه AGI و تحقیقات بنیادی عرضه سریع محصولات AI پروژه‌های علمی بلندمدت رقابت با محصولات OpenAI کشف فناوری‌های جدید جذب کاربران و کسب درآمد تغییر نقش حسابیس می‌تواند تلاشی برای حفظ هر دو مسیر باشد؛ یعنی DeepMind همچنان آزمایشگاه تحقیقاتی قدرتمند باقی بماند، اما محصولات هوش مصنوعی گوگل نیز با سرعت بیشتری توسعه پیدا کنند. آینده Google DeepMind بعد از دمیس حسابیس چه خواهد بود؟ یکی از مهم‌ترین پرسش‌ها این است که آیا این تغییر باعث دور شدن DeepMind از تحقیقات بنیادی می‌شود یا خیر. از یک طرف، گوگل به توسعه محصولاتی مانند Gemini نیاز دارد تا بتواند در بازار رقابتی امروز حضور قدرتمندی داشته باشد. از طرف دیگر، مزیت تاریخی DeepMind همیشه تحقیقات بلندمدت و پروژه‌های علمی بزرگ بوده است. آینده DeepMind احتمالاً به توانایی گوگل در ترکیب این دو مسیر بستگی دارد: در واقع، موفقیت گوگل فقط به کیفیت مدل‌هایش وابسته نیست؛ بلکه به این بستگی دارد که بتواند میان سرعت تجاری‌سازی و عمق تحقیقات علمی تعادل ایجاد کند. تغییرات DeepMind چه معنایی برای رقابت جهانی هوش مصنوعی دارد؟ رقابت هوش مصنوعی امروز فقط رقابت بین مدل‌ها نیست؛ بلکه رقابت بین استراتژی‌ها، استعدادها و ساختارهای سازمانی است. مقایسه رویکرد شرکت‌های بزرگ: شرکت تمرکز اصلی Google DeepMind تحقیقات بنیادی + توسعه Gemini OpenAI مدل‌های عمومی و محصولات مصرفی Anthropic مدل‌های ایمن و کاربردهای سازمانی دمیس حسابیس همچنان یکی از چهره‌های کلیدی این رقابت باقی خواهد ماند. تغییر نقش او بیشتر نشان‌دهنده تلاش گوگل برای استفاده بهتر از تجربه علمی اوست، نه پایان حضورش در مسیر توسعه هوش مصنوعی. جمع‌بندی تغییر نقش دمیس حسابیس در Google DeepMind یکی از مهم‌ترین اتفاقات مدیریتی اخیر در صنعت هوش مصنوعی است. او از مدیریت اجرایی روزمره فاصله گرفته، اما همچنان به‌عنوان یکی از رهبران علمی Alphabet فعالیت خواهد داشت. با توجه به سابقه حسابیس در پروژه‌هایی مانند AlphaGo و AlphaFold، تمرکز دوباره او روی تحقیقات بلندمدت می‌تواند برای آینده هوش مصنوعی گوگل اهمیت زیادی داشته باشد. در عین حال،

...

آپدیت جدید چت‌جی‌پی‌تی: ارتقای GPT-5.6 Sol و دسترسی رایگان به مدل Luna

اوپن‌ای‌آی با معرفی آپدیت‌های جدید، مدل GPT-5.6 Sol را با قابلیت‌های کنترل استدلال برای کاربران پولی ارتقا داد و مدل GPT-5.6 Luna را با چت متنی نامحدود برای کاربران رایگان عرضه کرد....

مدل هوش مصنوعی WeatherNext؛ انقلاب گوگل دیپ‌مایند در پیش‌بینی دقیق طوفان‌ها

مدل هوش مصنوعی WeatherNext، توسعه‌یافته توسط گوگل دیپ‌مایند، با سرعت و دقتی بی‌نظیر، پیش‌بینی طوفان‌های مخرب را متحول کرده و به ابزاری حیاتی برای مدیریت بحران تبدیل شده است....

Project Perception چیست؟ سیستم دفاع سایبری هوشمند مایکروسافت

تیم‌های امنیت سایبری هر روز با حجم عظیمی از هشدارها، آسیب‌پذیری‌ها، کدهای مشکوک و حملات احتمالی روبه‌رو می‌شوند. مشکل فقط شناسایی تهدید نیست؛ فاصله میان کشف یک آسیب‌پذیری و اصلاح کامل آن می‌تواند فرصت ارزشمندی در اختیار مهاجمان قرار دهد. با گسترش استفاده مهاجمان از هوش مصنوعی، سرعت تولید کد مخرب، کشف ضعف‌های نرم‌افزاری و اجرای حملات نیز افزایش یافته است. ابزارهایی که برای دنیای حملات انسانی طراحی شده‌اند، ممکن است در برابر تهدیدهایی که با سرعت ماشین عمل می‌کنند کافی نباشند. مایکروسافت برای پاسخ به این چالش، سیستم جدیدی به نام Project Perception توسعه داده است. این سامانه با استفاده از چند ایجنت تخصصی، مدل‌های مختلف هوش مصنوعی و داده‌های امنیتی مایکروسافت تلاش می‌کند چرخه شناسایی، ارزیابی و اصلاح آسیب‌پذیری‌ها را سریع‌تر و پیوسته‌تر کند. Project Perception از ۳ اوت ۲۰۲۶ وارد مرحله پیش‌نمایش عمومی شده است. Project Perception چیست؟ Project Perception یک سیستم امنیت سایبری ایجنتی از مایکروسافت است که سیگنال‌های امنیتی، اطلاعات محیط سازمان، مدل‌های هوش مصنوعی و ایجنت‌های تخصصی را برای شناسایی و کاهش ریسک‌های سایبری با یکدیگر ترکیب می‌کند. مایکروسافت این سیستم را در ۲۷ ژوئیه ۲۰۲۶ معرفی کرد و اعلام کرد پیش‌نمایش عمومی آن از ۳ اوت آغاز می‌شود. هدف اصلی Project Perception این است که امنیت سازمانی از یک فرایند مقطعی و واکنشی، به سیستمی پیوسته برای مشاهده، تحلیل و اقدام تبدیل شود. در روش‌های سنتی، ابزارهای امنیتی معمولاً تعداد زیادی هشدار تولید می‌کنند و کارشناسان باید آن‌ها را به‌صورت دستی بررسی، اعتبارسنجی و اولویت‌بندی کنند. Project Perception قرار نیست صرفاً هشدار بیشتری ایجاد کند؛ بلکه باید بتواند تهدیدها را در بستر واقعی سازمان تحلیل کرده و برای کاهش آن‌ها اقدام مناسب پیشنهاد دهد. مایکروسافت تأکید کرده است که انسان همچنان باید کنترل نهایی را در اختیار داشته باشد. بنابراین این سیستم بیشتر به‌عنوان یک نیروی تقویتی برای تیم‌های امنیتی طراحی شده است، نه جایگزینی کامل برای متخصصان. Project Perception چگونه کار می‌کند؟ Project Perception چند نوع ایجنت تخصصی را در قالب یک چرخه دفاعی هماهنگ می‌کند. هر گروه از ایجنت‌ها وظیفه متفاوتی دارد و مسئله امنیت را از زاویه خاصی بررسی می‌کند. مایکروسافت این ایجنت‌ها را در سه گروه اصلی معرفی کرده است: این سه گروه یک چرخه بسته ایجاد می‌کنند. ابتدا ضعف احتمالی کشف می‌شود، سپس واقعی بودن و شدت آن مورد بررسی قرار می‌گیرد و در پایان راهکاری برای اصلاح یا کاهش خطر ارائه می‌شود. پس از اعمال تغییر نیز سیستم می‌تواند دوباره محیط را بررسی کند تا مطمئن شود مشکل برطرف شده است. Project Perception تنها به کد نرم‌افزار محدود نیست. معماری معرفی‌شده از سوی مایکروسافت قرار است اطلاعات مربوط به هویت‌ها، نقاط پایانی، برنامه‌ها، داده‌ها، سرویس‌های ابری و سامانه‌های هوش مصنوعی را در کنار هم بررسی کند. چرخه شناسایی تا اصلاح آسیب‌پذیری یک گردش کار احتمالی در Project Perception می‌تواند به این شکل باشد: مزیت این فرایند آن است که کشف، تحلیل و اصلاح به‌عنوان سه فعالیت جداگانه انجام نمی‌شوند؛ بلکه در یک جریان پیوسته به یکدیگر متصل هستند. MAI-Cyber-1-Flash چیست؟ یکی از اجزای مهم این راهکار، مدل MAI-Cyber-1-Flash است. مایکروسافت آن را نخستین مدل تخصصی امنیت سایبری Microsoft AI معرفی کرده که برای یافتن آسیب‌پذیری‌های دشوار در کدهای پیچیده ساخته شده است. MAI-Cyber-1-Flash یک مدل عمومی مشابه چت‌بات‌های معمولی نیست. این مدل به‌صورت تخصصی برای کارهایی مانند تحلیل کد، شناسایی ضعف‌های امنیتی و کمک به فرایند اصلاح آسیب‌پذیری طراحی شده است. مایکروسافت می‌گوید این مدل از خانواده MAI-Thinking-1 مشتق شده و با تمرکز زیاد بر داده‌ها و وظایف مرتبط با کد توسعه یافته است. همچنین براساس اعلام شرکت، مدل از صفر و در داخل مایکروسافت ساخته شده و برای استفاده دفاعی کالیبره شده است. چرا مایکروسافت از یک مدل تخصصی استفاده کرده است؟ استفاده دائمی از بزرگ‌ترین و گران‌ترین مدل‌ها برای تمام وظایف امنیتی از نظر اقتصادی منطقی نیست. بسیاری از فعالیت‌های روزمره مانند بررسی بخش‌های مشخصی از کد، دسته‌بندی یافته‌ها یا اجرای تحلیل‌های تکرارشونده را می‌توان با یک مدل کوچک‌تر و تخصصی انجام داد. مایکروسافت اعلام کرده MAI-Cyber-1-Flash می‌تواند تا حدود ۹۰ درصد وظایف MDASH را مدیریت کند. حدود ۱۰ درصد از مسائل بسیار دشوار به مدل‌های قدرتمندتر، از جمله GPT-5.4، ارجاع داده می‌شوند. این معماری دو مزیت مهم دارد: در نتیجه، به‌جای انتخاب یک مدل ثابت برای همه مسائل، سیستم براساس پیچیدگی و حساسیت هر وظیفه، مدل مناسب را انتخاب می‌کند. MDASH چیست؟ MDASH سامانه چندمدلی و چندایجنتی مایکروسافت برای شناسایی، اعتبارسنجی و اصلاح آسیب‌پذیری‌های نرم‌افزاری است. براساس اطلاعات رسمی Microsoft AI، این سامانه بیش از ۱۰۰ ایجنت ساخته‌شده با مدل‌های مختلف را هماهنگ می‌کند. این ایجنت‌ها برای پیدا کردن آسیب‌پذیری، اثبات قابل سوءاستفاده بودن آن، بررسی شدت مشکل و کمک به اصلاح کد با یکدیگر همکاری می‌کنند. تفاوت سه نام اصلی را می‌توان به شکل زیر خلاصه کرد: نام نوع وظیفه اصلی Project Perception سیستم دفاع سایبری ایجنتی ایجاد چرخه پیوسته مشاهده، تحلیل و اقدام MAI-Cyber-1-Flash مدل تخصصی امنیت سایبری تحلیل کد و یافتن آسیب‌پذیری‌ها MDASH سامانه چندمدلی و چندایجنتی هماهنگی ایجنت‌ها برای کشف و اصلاح ضعف‌ها MAI-Cyber-1-Flash داخل MDASH فعالیت می‌کند و MDASH نیز یکی از اجزایی است که قابلیت‌های Project Perception را در حوزه مدیریت آسیب‌پذیری نرم‌افزار تأمین می‌کند. عملکرد MAI-Cyber-1-Flash چقدر است؟ مایکروسافت برای ترکیب MDASH، مدل MAI-Cyber-1-Flash و GPT-5.4 نتایج زیر را گزارش کرده است: شاخص نتیجه اعلام‌شده امتیاز در CyberGym حدود ۹۶ درصد فاصله با Mythos حدود ۱۲ امتیاز بیشتر کاهش هزینه نزدیک به ۵۰ درصد سهم وظایف مدل Flash تا ۹۰ درصد تعداد ایجنت‌های MDASH بیش از ۱۰۰ ایجنت در نمودار رسمی Microsoft AI، ترکیب MDASH با MAI-Cyber-1-Flash و GPT-5.4 به نرخ موفقیت ۹۵.۹۵ درصد رسیده است. مایکروسافت می‌گوید این ترکیب در CyberGym از پیکربندی‌های مبتنی بر Mythos، Gemini و GPT عملکرد بهتری داشته است. CyberGym برای ارزیابی توانایی سیستم‌ها در بررسی مخزن‌های بزرگ کد و پیدا کردن آسیب‌پذیری‌های واقعی استفاده می‌شود. بااین‌حال، این نتایج باید محتاطانه تفسیر شوند. اعداد فعلی توسط خود مایکروسافت اعلام شده‌اند و هنوز برای قضاوت نهایی به ارزیابی‌های مستقل بیشتری نیاز است. همچنین عملکرد یک سیستم در محیط واقعی سازمان می‌تواند تحت‌تأثیر عواملی مانند کیفیت کد، سطح دسترسی، پیچیدگی زیرساخت و تنظیمات امنیتی قرار بگیرد. هوش مصنوعی چگونه آسیب‌پذیری را اصلاح می‌کند؟ پس از شناسایی یک ضعف، سیستم می‌تواند محل آسیب‌پذیری را

...

معرفی Qwen3.8-Max: بررسی مدل ۲.۴ تریلیون پارامتری Alibaba

رقابت در بازار هوش مصنوعی دیگر فقط بر سر پاسخ‌های بهتر یا سرعت بیشتر نیست. شرکت‌ها اکنون با اعداد عظیمی مانند «تریلیون‌ها پارامتر»، «پنجره زمینه یک میلیون توکنی» و «مدل‌های چندوجهی» تلاش می‌کنند نشان دهند نسل تازه‌ای از هوش مصنوعی را ساخته‌اند. اما این اعداد می‌توانند گمراه‌کننده باشند. وقتی Alibaba اعلام می‌کند مدل جدید Qwen3.8-Max دارای ۲.۴ تریلیون پارامتر است، ممکن است در نگاه اول تصور کنیم این مدل الزاماً از GPT یا Claude قدرتمندتر است. درحالی‌که تعداد کل پارامترها فقط یکی از عوامل تعیین‌کننده کیفیت مدل است. Qwen3.8-Max بزرگ‌ترین و قدرتمندترین مدل معرفی‌شده در خانواده Qwen محسوب می‌شود. اهمیت آن فقط به ابعاد بسیار بزرگ محدود نیست؛ معماری Mixture of Experts، قابلیت پردازش ورودی‌های چندوجهی، پنجره زمینه طولانی و برنامه Alibaba برای انتشار وزن‌های مدل، این محصول را به یکی از مهم‌ترین مدل‌های چینی سال ۲۰۲۶ تبدیل کرده است. Qwen3.8-Max چیست؟ Qwen3.8-Max مدل پرچم‌دار جدید Alibaba در خانواده Qwen است که برای کدنویسی، وظایف پیچیده، تحلیل ورودی‌های چندوجهی و اجرای ایجنت‌های هوش مصنوعی طراحی شده است. نسخه پیش‌نمایش آن با نام Qwen3.8-Max-Preview ابتدا از طریق برخی سرویس‌های Alibaba مانند Token Plan، Qoder و QoderWork در دسترس قرار گرفت. سپس Alibaba مدل را به‌عنوان پیشرفته‌ترین محصول Qwen معرفی کرد و وعده داد وزن‌های آن را نیز در اختیار توسعه‌دهندگان قرار دهد. براساس اطلاعات منتشرشده، این مدل از ورودی‌های مختلف پشتیبانی می‌کند: Qwen3.8-Max همچنین می‌تواند تا حدود یک میلیون توکن را در یک نشست پردازش کند؛ ظرفیتی که برای تحلیل گزارش‌های بزرگ، کتاب‌ها، اسناد سازمانی و پروژه‌های پیچیده برنامه‌نویسی اهمیت دارد. مشخصات Qwen3.8-Max در یک نگاه ویژگی مشخصات اعلام‌شده تعداد کل پارامترها ۲.۴ تریلیون پارامترهای فعال حدود ۹۵ میلیارد در هر درخواست معماری Mixture of Experts پنجره زمینه تا یک میلیون توکن ورودی‌ها متن، تصویر، ویدئو و اسناد کاربرد اصلی کدنویسی، ایجنت‌ها و وظایف حرفه‌ای وضعیت مدل پیش‌نمایش و وعده انتشار Open Weight عدد ۲.۴ تریلیون، Qwen3.8-Max را به یکی از بزرگ‌ترین مدل‌های هوش مصنوعی معرفی‌شده تبدیل می‌کند؛ اما این مدل بزرگ‌ترین نمونه موجود نیست. برای مثال، مدل Kimi K3 از Moonshot AI با ۲.۸ تریلیون پارامتر معرفی شده است. عدد ۲.۴ تریلیون پارامتر چه معنایی دارد؟ پارامترها را می‌توان وزن‌های عددی درون شبکه عصبی دانست که مدل طی فرایند آموزش آن‌ها را تنظیم می‌کند. این وزن‌ها به مدل کمک می‌کنند روابط میان کلمات، تصاویر، مفاهیم و الگوهای مختلف را یاد بگیرد. اما Qwen3.8-Max برای پردازش هر درخواست، تمام ۲.۴ تریلیون پارامتر خود را فعال نمی‌کند. براساس گزارش رویترز، تنها حدود ۹۵ میلیارد پارامتر برای هر درخواست وارد محاسبه می‌شوند. دلیل این تفاوت، استفاده از معماری Mixture of Experts یا MoE است. در این معماری، مدل از چندین بخش تخصصی یا «خبره» تشکیل شده است. یک سیستم مسیریاب تشخیص می‌دهد هر ورودی باید توسط کدام بخش‌ها پردازش شود. بنابراین برای یک سؤال برنامه‌نویسی، مجموعه‌ای از خبره‌ها فعال می‌شوند و برای تحلیل تصویر یا متن، مجموعه دیگری وارد عمل می‌شود. این روش چند مزیت دارد: پژوهش‌های قبلی درباره مدل‌های MoE نیز نشان داده‌اند که فعال‌سازی پراکنده می‌تواند تعداد پارامترهای مدل را به مقیاس تریلیونی برساند، بدون آنکه هزینه محاسباتی هر ورودی به همان نسبت افزایش پیدا کند. آیا پارامتر بیشتر به معنی مدل قوی‌تر است؟ خیر. تعداد پارامترها به‌تنهایی معیار قابل اعتمادی برای رتبه‌بندی مدل‌های هوش مصنوعی نیست. عملکرد یک مدل به عوامل متعددی بستگی دارد: یک مدل کوچک‌تر با داده‌های بهتر و معماری بهینه‌تر می‌تواند در برخی وظایف از مدلی با پارامترهای بیشتر بهتر عمل کند. علاوه بر این، مقایسه تعداد کل پارامترهای یک مدل MoE با یک مدل Dense چندان دقیق نیست. در مدل Dense تقریباً تمام پارامترها برای هر درخواست درگیر می‌شوند، اما در مدل MoE فقط بخشی از آن‌ها فعال هستند. بنابراین عدد ۲.۴ تریلیون بیشتر نشان‌دهنده ظرفیت کلی شبکه است، نه هزینه یا قدرت واقعی هر پاسخ. مدل‌هایی مانند Gemini 3 Flash نشان می‌دهند که سرعت، هزینه و بهینه‌سازی معماری نیز می‌توانند به‌اندازه تعداد پارامترها در انتخاب یک مدل هوش مصنوعی اهمیت داشته باشند. قابلیت‌های مهم Qwen3.8-Max چیست؟ پردازش چندوجهی Qwen3.8-Max فقط یک مدل متنی نیست. Alibaba اعلام کرده این مدل می‌تواند متن، تصویر، ویدئو و اسناد را پردازش کند. این قابلیت امکان ساخت ابزارهایی را فراهم می‌کند که به‌طور هم‌زمان چند نوع داده را بررسی می‌کنند. برای مثال، مدل می‌تواند: پنجره زمینه یک میلیون توکنی پنجره زمینه مشخص می‌کند مدل در یک نشست چه مقدار اطلاعات را می‌تواند به‌صورت هم‌زمان در نظر بگیرد. یک میلیون توکن می‌تواند برای کاربردهای زیر مفید باشد: البته اعلام یک پنجره زمینه طولانی لزوماً به این معنا نیست که مدل در تمام بخش‌های آن دقت یکسانی دارد. کیفیت بازیابی اطلاعات از ابتدا، میانه و انتهای زمینه باید در آزمون‌های مستقل بررسی شود. کدنویسی و ایجنت‌های هوش مصنوعی Alibaba مدل جدید را برای Agentic Coding و وظایف چندمرحله‌ای معرفی کرده است. در کدنویسی ایجنتی، مدل فقط یک قطعه کد تولید نمی‌کند؛ بلکه می‌تواند: این کاربردها به زمینه طولانی، ابزارخوانی دقیق و توانایی حفظ هدف در چندین مرحله نیاز دارند. آیا Qwen3.8-Max از GPT و Claude قوی‌تر است؟ Alibaba ادعا کرده Qwen3.8-Max در برخی ارزیابی‌ها در سطح مدل‌های پیشرفته آمریکایی قرار می‌گیرد و تنها از تعداد محدودی از مدل‌های Anthropic عقب‌تر است. برخی گزارش‌ها نیز به جایگاه بالای آن در رتبه‌بندی‌های مبتنی بر ترجیح کاربران اشاره کرده‌اند. بااین‌حال، هنوز نباید یک برنده قطعی اعلام کرد. بخش قابل‌توجهی از ادعاهای اولیه توسط خود Alibaba منتشر شده و در زمان معرفی، گزارش فنی کامل، مدل‌کارت جامع و جدول دقیق بنچمارک‌ها در دسترس نبود. برای مقایسه منصفانه باید این موارد بررسی شوند: بنابراین پاسخ فعلی این است: Qwen3.8-Max احتمالاً یکی از قدرتمندترین مدل‌های چینی است، اما هنوز شواهد مستقل کافی برای اثبات برتری کلی آن نسبت به GPT یا Claude وجود ندارد. آیا Qwen3.8-Max متن‌باز است؟ Alibaba وعده داده وزن‌های Qwen3.8-Max را منتشر کند؛ اما عبارت Open Weight با «متن‌باز کامل» یکسان نیست. در مدل Open Weight، توسعه‌دهندگان می‌توانند وزن‌های آموزش‌دیده را دانلود و در صورت اجازه مجوز، آن را اجرا یا شخصی‌سازی کنند. اما ممکن است موارد زیر منتشر نشوند: تا زمانی که مجوز نهایی، مدل‌کارت و فایل‌های رسمی منتشر نشوند، بهتر است Qwen3.8-Max را مدلی با وعده انتشار وزن‌ها بنامیم، نه یک مدل کاملاً متن‌باز. انتشار وزن‌های مدل چه اهمیتی دارد؟ اگر Alibaba

...

DeepSeek V4-Flash چیست؟ بررسی مدل فوق‌ارزان جدید هوش مصنوعی

استفاده از مدل‌های قدرتمند هوش مصنوعی دیگر فقط به خرید اشتراک یک چت‌بات محدود نمی‌شود. وقتی یک کسب‌وکار بخواهد هوش مصنوعی را در چت پشتیبانی، تولید محتوا، تحلیل اسناد یا ایجنت‌های خودکار به کار بگیرد، باید بابت میلیون‌ها توکن ورودی و خروجی هزینه پرداخت کند. این هزینه در مقیاس بالا می‌تواند به یکی از موانع اصلی توسعه محصولات هوش مصنوعی تبدیل شود. حتی اختلاف چند دلار در قیمت هر میلیون توکن، برای سرویسی که روزانه میلیون‌ها درخواست پردازش می‌کند، رقم بزرگی خواهد بود. DeepSeek با مدل V4-Flash تلاش کرده این معادله را تغییر دهد. گزارش رویترز براساس ارزیابی Artificial Analysis نشان می‌دهد هزینه اجرای این مدل از تعدادی از مدل‌های شناخته‌شده بازار به‌مراتب پایین‌تر است؛ موضوعی که می‌تواند رقابت شرکت‌های هوش مصنوعی را از «قوی‌ترین مدل» به سمت «بهترین نسبت قیمت به عملکرد» سوق دهد. DeepSeek V4-Flash چیست؟ DeepSeek V4-Flash یک مدل زبانی متن‌باز با تمرکز بر سرعت، زمینه طولانی و هزینه پایین است. این مدل ورودی متنی دریافت می‌کند، خروجی متنی تولید می‌کند و از پنجره زمینه‌ای تا یک میلیون توکن پشتیبانی می‌کند. براساس مشخصات Artificial Analysis، نسخه بررسی‌شده این مدل در مجموع ۲۸۴ میلیارد پارامتر دارد، اما در هر توکن فقط حدود ۱۳ میلیارد پارامتر آن فعال می‌شوند. این ساختار به مدل اجازه می‌دهد بدون فعال کردن تمام ظرفیت شبکه در هر درخواست، هزینه محاسباتی را کاهش دهد. مدل همچنین با مجوز MIT و به‌صورت Open Weights ارائه شده است. V4-Flash در دو حالت اصلی ارزیابی شده است: عبارت Flash نیز معمولاً در نام مدل‌هایی استفاده می‌شود که برای سرعت و هزینه کمتر نسبت به نسخه‌های پرچم‌دار بهینه شده‌اند. بااین‌حال، DeepSeek V4-Flash صرفاً یک مدل کوچک و ساده نیست؛ بلکه مدلی بزرگ با معماری بهینه برای استنتاج اقتصادی است. قیمت DeepSeek V4-Flash چقدر است؟ براساس قیمت ثبت‌شده برای API رسمی DeepSeek، هزینه استفاده از V4-Flash به این صورت است: Artificial Analysis نرخ ترکیبی این مدل را با فرض استفاده گسترده از کش، حدود ۰٫۰۶ دلار به‌ازای یک میلیون توکن محاسبه کرده است. قیمت نهایی ممکن است با توجه به ارائه‌دهنده API و نوع استفاده متفاوت باشد. چرا قیمت توکن اهمیت دارد؟ توکن واحد تقریبی محاسبه متن در مدل‌های زبانی است. هر پیام، سند یا پاسخ به تعدادی توکن تبدیل می‌شود و توسعه‌دهنده متناسب با حجم ورودی و خروجی هزینه می‌پردازد. قیمت پایین‌تر می‌تواند هزینه این کاربردها را کاهش دهد: برای یک کاربر عادی، اختلاف چند سنت شاید مهم به نظر نرسد؛ اما برای یک محصول بزرگ، همین تفاوت می‌تواند هزینه ماهانه زیرساخت را به‌طور چشمگیری تغییر دهد. مقایسه هزینه DeepSeek V4-Flash با رقبا رویترز با استناد به Artificial Analysis گزارش داده است که هزینه متوسط اجرای هر وظیفه ارزیابی برای V4-Flash حدود ۳ سنت بوده است. این رقم برای تعدادی از مدل‌های مطرح به شکل زیر گزارش شد: مدل هوش مصنوعی هزینه متوسط هر وظیفه ارزیابی DeepSeek V4-Flash حدود ۰٫۰۳ دلار Kimi K3 حدود ۰٫۸۶ دلار GPT-5.6 Sol حدود ۱٫۸۶ دلار Claude Fable 5 حدود ۳٫۱۵ دلار این جدول قیمت مستقیم API را مقایسه نمی‌کند؛ بلکه هزینه واقعی تولید خروجی در مجموعه آزمون‌های Artificial Analysis را نشان می‌دهد. طول پاسخ، تعداد توکن مصرفی و میزان تلاش استدلالی می‌تواند روی هزینه هر وظیفه اثر بگذارد. بر همین مبنا، هزینه اجرای V4-Flash در این ارزیابی حدود ۲۹ برابر کمتر از Kimi K3، حدود ۶۲ برابر کمتر از GPT-5.6 Sol و بیش از ۱۰۰ برابر کمتر از Claude Fable 5 بوده است. این اختلاف به معنی آن نیست که DeepSeek در همه وظایف بهتر از رقبا عمل می‌کند. نتیجه اصلی این است که این مدل می‌تواند سطح قابل‌توجهی از توانایی را با هزینه بسیار کمتری ارائه دهد. آیا DeepSeek V4-Flash واقعاً قدرتمند است؟ قیمت پایین تنها زمانی اهمیت دارد که مدل بتواند کیفیت قابل‌قبولی نیز ارائه دهد. صفحه فعلی Artificial Analysis برای نسخه استدلالی با حداکثر تلاش، امتیاز ۴۰ را در Intelligence Index ثبت کرده است. این مدل در میان مدل‌های هم‌رده خود بالاتر از میانگین قرار دارد و سرعت تولید آن نیز حدود ۱۱۵ تا ۱۱۸ توکن در ثانیه گزارش شده است. نسخه غیر استدلالی امتیاز ۲۹ و سرعتی نزدیک به ۱۱۷ توکن در ثانیه دارد. البته یک نکته مهم وجود دارد: امتیازهای بنچمارک ممکن است با تغییر نسخه آزمون، تنظیمات میزان تلاش و به‌روزرسانی روش ارزیابی تغییر کنند. به همین دلیل نباید تنها با یک عدد درباره کیفیت نهایی مدل تصمیم گرفت. Artificial Analysis همچنین V4-Flash را مدلی نسبتاً پرحرف توصیف کرده است. نسخه Max Effort در ارزیابی این مؤسسه ۲۳۰ میلیون توکن خروجی تولید کرده که از میانه مدل‌های قابل مقایسه بیشتر بوده است. پرحرف بودن می‌تواند بخشی از مزیت قیمت پایین را در بعضی کاربردها کاهش دهد؛ زیرا هزینه نهایی فقط به نرخ هر توکن وابسته نیست، بلکه تعداد توکن‌های تولیدشده نیز مهم است. چرا DeepSeek V4-Flash ارزان است؟ کاهش هزینه این مدل را می‌توان به چند عامل مرتبط دانست. نخست، معماری آن به‌گونه‌ای طراحی شده که فقط بخشی از پارامترها برای هر توکن فعال شوند. این رویکرد شبیه معماری Mixture of Experts است و می‌تواند مصرف محاسباتی را نسبت به فعال‌سازی کامل مدل کاهش دهد. دوم، DeepSeek روی بهینه‌سازی استنتاج و استفاده از کش تمرکز کرده است. قیمت ورودی کش‌شده این مدل تا ۹۸ درصد کمتر از ورودی عادی گزارش شده است. این ویژگی برای گفت‌وگوهای طولانی، اسناد تکراری و ایجنت‌هایی که بارها از یک زمینه مشترک استفاده می‌کنند، اهمیت زیادی دارد. همچنین پژوهش‌های مرتبط با معماری DeepSeek V4 نشان داده‌اند که می‌توان با روش‌های توجه پراکنده، مقدار حافظه لازم برای نگهداری زمینه‌های بسیار طولانی را به‌شدت کاهش داد. البته این پژوهش را نباید لزوماً معادل دقیق زیرساخت تجاری V4-Flash دانست، اما نشان‌دهنده تمرکز فنی اکوسیستم DeepSeek بر کاهش هزینه پردازش زمینه‌های طولانی است. جنگ قیمت مدل‌های هوش مصنوعی چیست؟ تا چند سال پیش، رقابت شرکت‌های هوش مصنوعی بیشتر حول اندازه مدل، تعداد پارامترها و امتیاز بنچمارک‌ها شکل می‌گرفت. اکنون هزینه اجرای مدل نیز به یک معیار اصلی تبدیل شده است. DeepSeek، Moonshot AI، Alibaba، Google، OpenAI و Anthropic برای جذب توسعه‌دهندگان و مشتریان سازمانی رقابت می‌کنند. مدل‌های ارزان‌تر می‌توانند حجم بیشتری از درخواست‌ها را پردازش کنند و ورود استارتاپ‌ها به بازار را آسان‌تر سازند. Axios این روند را «رقابت به سمت صفر» توصیف کرده

...

پیشرفت‌های انقلابی هوش مصنوعی در ریاضیات: بررسی ۱۰ دستاورد جدید مدل Astra

هوش مصنوعی مدل Astra متعلق به OpenAI توانسته است در حل ۱۰ مسئله بنیادین و تاریخی ریاضیات و علوم کامپیوتر نظری پیشرفت‌های چشمگیری ایجاد کند....

آیا هوش مصنوعی در تشخیص پزشکی قابل اعتماد است؟ یافته‌های جدید پژوهش MIT

ابزارهای هوش مصنوعی می‌توانند تصاویر پزشکی را تحلیل کنند، بیماری‌های احتمالی را پیشنهاد دهند و حتی دلیل تشخیص خود را با زبانی ساده توضیح دهند. این قابلیت‌ها ممکن است در نگاه اول استفاده از هوش مصنوعی برای تشخیص بیماری را کاملاً منطقی و مطمئن نشان دهند. اما مشکل زمانی آغاز می‌شود که پاسخ هوش مصنوعی اشتباه باشد. یک توضیح روان، علمی‌نما و با اعتمادبه‌نفس می‌تواند باعث شود کاربر پاسخ نادرست مدل را بپذیرد؛ به‌خصوص اگر دانش پزشکی کافی برای ارزیابی آن نداشته باشد. پژوهش جدیدی از محققان MIT و چند دانشگاه دیگر نشان می‌دهد هوش مصنوعی در تشخیص پزشکی برای همه کاربران به یک اندازه مفید نیست. پزشکان و افراد غیرمتخصص از یک پیشنهاد مشابه AI برداشت متفاوتی دارند و توضیحات بیشتر نیز همیشه به تصمیم دقیق‌تر منجر نمی‌شوند. پژوهش جدید MIT درباره هوش مصنوعی پزشکی چه چیزی را بررسی کرد؟ این پژوهش با هدف بررسی تأثیر سطح تخصص کاربران بر استفاده از ابزارهای هوش مصنوعی پزشکی انجام شد. محققان می‌خواستند بدانند آیا توضیح‌پذیر کردن پاسخ‌های AI می‌تواند به افراد کمک کند تشخیص درست‌تری داشته باشند و خطاهای مدل را بهتر شناسایی کنند. در این مطالعه، دو گروه مورد بررسی قرار گرفتند: افراد غیرمتخصص باید با مشاهده تصویر یک خال پوستی تشخیص می‌دادند که آیا احتمال سرطانی بودن آن وجود دارد یا خیر. پزشکان وظیفه دشوارتری داشتند و باید برای تصاویر بیماری‌های پوستی، تشخیص افتراقی ارائه می‌کردند. شرکت‌کنندگان ابتدا در برخی موارد بدون کمک هوش مصنوعی تصمیم گرفتند و در موارد دیگر، یکی از چند نوع راهنمایی AI را دریافت کردند. هوش مصنوعی چگونه به شرکت‌کنندگان کمک کرد؟ پژوهشگران چهار شیوه ارائه اطلاعات را با یکدیگر مقایسه کردند: هدف از این روش‌ها آن بود که کاربر فقط یک پاسخ نهایی دریافت نکند و بتواند شواهد یا توضیحی درباره تصمیم مدل ببیند. این دسته از روش‌ها معمولاً با عنوان هوش مصنوعی توضیح‌پذیر یا Explainable AI شناخته می‌شوند. فرض اصلی این است که اگر مدل دلیل تصمیم خود را توضیح دهد، کاربر بهتر می‌تواند تشخیص دهد چه زمانی باید به آن اعتماد کند. نتایج این پژوهش نشان داد این فرض همیشه درست نیست. نتیجه پژوهش MIT؛ هوش مصنوعی برای همه کاربران یکسان عمل نمی‌کند کمک هوش مصنوعی به‌طور کلی دقت هر دو گروه را افزایش داد، اما دلیل این بهبود در پزشکان و افراد غیرمتخصص متفاوت بود. افراد غیرمتخصص بیشتر به این دلیل عملکرد بهتری داشتند که از پیشنهاد هوش مصنوعی پیروی می‌کردند. از آنجا که مدل مورد استفاده در بسیاری از نمونه‌ها تشخیص درستی داشت، این وابستگی در مجموع باعث افزایش دقت آن‌ها شد. اما همین رفتار هنگام اشتباه بودن مدل به یک نقطه‌ضعف جدی تبدیل شد. افراد غیرمتخصص معمولاً توانایی کمتری برای تشخیص خطای سیستم داشتند و حتی زمانی که هوش مصنوعی پاسخ نادرستی ارائه می‌کرد، احتمال داشت نظر خود را با پیشنهاد مدل هماهنگ کنند. محققان این رفتار را نوعی تبعیت از الگوریتم دانستند. در مقابل، پزشکان معمولاً پیش از مشاهده پاسخ AI، یک نظر اولیه بر اساس آموزش و تجربه خود داشتند. آن‌ها پیشنهاد مدل را با دانش پزشکی‌شان مقایسه می‌کردند و در نتیجه بهتر می‌توانستند خطاهای آن را تشخیص دهند. چرا توضیحات هوش مصنوعی همیشه مفید نیستند؟ یکی از مهم‌ترین یافته‌های پژوهش، تأثیر توضیحات متنی تولیدشده توسط مدل‌های زبانی بود. افراد غیرمتخصص توضیحات مدل زبانی را هم در زمان درست بودن و هم هنگام اشتباه بودن پاسخ، قابل‌اعتماد می‌دانستند. حتی توضیحاتی که مبهم، کلی یا عمومی بودند، گاهی برای آن‌ها متقاعدکننده‌تر به نظر می‌رسیدند. این مسئله نشان می‌دهد یک پاسخ دارای توضیح الزاماً پاسخ مطمئن‌تری نیست. مدل زبانی می‌تواند برای یک تشخیص نادرست نیز متنی منسجم و ظاهراً منطقی تولید کند. خطر اصلی این است که کاربر ممکن است کیفیت نگارش توضیح را با صحت پزشکی آن اشتباه بگیرد. در این پژوهش، اثر تبعیت از هوش مصنوعی هنگام استفاده از توضیحات مدل زبانی بیشتر بود و افراد غیرمتخصص حتی نسبت به پاسخ‌های غلط خود اطمینان بیشتری پیدا می‌کردند. این پدیده به سوگیری اتوماسیون مربوط است؛ یعنی تمایل افراد به اعتماد بیش از حد به پیشنهادهای سیستم‌های خودکار، حتی زمانی که احتمال اشتباه وجود دارد. مسئله شفافیت فقط به پزشکی محدود نیست و پژوهشگران در حوزه شفافیت عصبی مدل‌های هوش مصنوعی نیز تلاش می‌کنند بفهمند این سامانه‌ها چگونه به پاسخ نهایی می‌رسند. تفاوت استفاده پزشکان و افراد عادی از هوش مصنوعی پزشکی ویژگی افراد غیرمتخصص پزشکان نظر اولیه پیش از مشاهده پاسخ AI معمولاً ضعیف‌تر مبتنی بر آموزش و تجربه اعتماد به پیشنهاد مدل بیشتر محتاطانه‌تر توانایی تشخیص خطای مدل کمتر بیشتر تأثیر توضیحات مدل زبانی بسیار زیاد محدودتر بهترین نوع کمک AI نیازمند طراحی محافظتی پیش‌بینی ساده مدل پزشکان در این پژوهش در برابر توضیحات اشتباه هوش مصنوعی مقاوم‌تر بودند. جالب‌تر اینکه بهترین عملکرد آن‌ها زمانی ثبت شد که فقط پیش‌بینی مدل را بدون توضیحات اضافه دریافت کردند. توضیحات مدل زبانی کمترین بهبود را برای پزشکان ایجاد کرد. این نتیجه نشان می‌دهد افزودن اطلاعات بیشتر به رابط کاربری همیشه به تصمیم بهتر منجر نمی‌شود. گاهی توضیح اضافی می‌تواند باعث حواس‌پرتی، سوگیری یا پیچیده شدن تصمیم‌گیری شود. زمان نمایش پیشنهاد هوش مصنوعی نیز مهم است محققان دریافتند زمان ارائه توضیحات AI بر میزان اعتماد کاربران اثر می‌گذارد. وقتی توضیح هوش مصنوعی پیش از آنکه فرد فرصت کند نظر خودش را شکل دهد نمایش داده می‌شد، کاربران وابستگی بیشتری به مدل پیدا می‌کردند. در مقابل، اگر ابتدا از کاربر خواسته شود فرضیه یا تشخیص اولیه خود را بیان کند و سپس پیشنهاد AI را ببیند، احتمال بیشتری وجود دارد که پاسخ مدل را به‌صورت انتقادی بررسی کند. بر همین اساس، پژوهشگران پیشنهاد می‌کنند سیستم‌های پزشکی به‌جای آنکه بلافاصله یک پاسخ کامل و متقاعدکننده ارائه دهند، ابتدا کاربر را وادار به تفکر مستقل کنند و سپس گزینه‌های احتمالی دیگری را نشان دهند. آیا هوش مصنوعی در تشخیص پزشکی قابل اعتماد است؟ پاسخ به این سؤال به نحوه استفاده از هوش مصنوعی بستگی دارد. AI می‌تواند در برخی وظایف پزشکی بسیار مفید باشد؛ از جمله: در پژوهش MIT، مدل‌های هوش مصنوعی در مواردی که نشانه‌های بیماری ظریف بودند، عملکرد بهتری از انسان داشتند. با این حال، انسان‌ها هنگام وجود علائم غیرمعمول یا ویژگی‌های نامرتبط در تصویر، بهتر از مدل عمل کردند. این تفاوت نشان می‌دهد هوش مصنوعی و انسان نقاط

...

GPT-Live چیست؟ آشنایی با سیستم جدید مکالمه صوتی OpenAI

مکالمه صوتی با هوش مصنوعی در سال‌های اخیر پیشرفت زیادی کرده است، اما هنوز یک مشکل مهم باقی مانده: تأخیر و مکث‌های غیرطبیعی در گفت‌وگو. کاربر باید صحبتش را تمام کند، سیستم پایان جمله را تشخیص دهد و سپس مدل شروع به پردازش و پاسخ‌گویی کند. اگر این تشخیص زود انجام شود، صحبت کاربر قطع می‌شود و اگر دیر انجام شود، گفت‌وگو کند و مصنوعی به نظر می‌رسد. OpenAI برای حل این مشکل از سیستم جدیدی به نام GPT-Live رونمایی کرده است؛ فناوری‌ای که می‌تواند هم‌زمان صدای کاربر را دریافت کند و پاسخ صوتی ارائه دهد. هدف این سیستم، نزدیک کردن مکالمه با هوش مصنوعی به ریتم طبیعی گفت‌وگوی انسان‌هاست. GPT-Live چیست؟ GPT-Live نسل سوم سیستم صوتی OpenAI برای ایجاد مکالمه‌های سریع، پیوسته و بلادرنگ است. این فناوری به مدل اجازه می‌دهد بدون منتظر ماندن برای پایان کامل صحبت کاربر، جریان صدا را پردازش کند و در زمان مناسب پاسخ دهد. در سیستم‌های صوتی قدیمی، یک مدل کوچک به نام Turn Detector وظیفه داشت تشخیص دهد کاربر چه زمانی صحبتش را تمام کرده است. تنها پس از تصمیم این سیستم، مدل زبانی اصلی می‌توانست پردازش درخواست را آغاز کند. GPT-Live این تشخیص‌دهنده جداگانه را از مسیر اصلی صدا حذف کرده و کنترل جریان مکالمه را به خود مدل صوتی سپرده است. در نتیجه، مدل بهتر می‌تواند تشخیص دهد چه زمانی گوش دهد، چه زمانی صحبت کند و چه زمانی اجازه دهد کاربر پاسخ را قطع کند. OpenAI این سیستم را در تاریخ ۳ اوت ۲۰۲۶ معرفی کرد و اعلام کرد که توسعه زیرساخت آن حدود شش ماه زمان برده است. این فناوری در حال حاضر پایه بخشی از قابلیت‌های ChatGPT Voice را تشکیل می‌دهد. GPT-Live چگونه کار می‌کند؟ مهم‌ترین ویژگی GPT-Live، استفاده از معماری Full-Duplex یا ارتباط دوطرفه هم‌زمان است. در یک مکالمه صوتی معمولی با هوش مصنوعی، ارتباط اغلب نوبتی است: اما در GPT-Live، ورودی و خروجی صوتی می‌توانند به‌صورت هم‌زمان جریان داشته باشند. مدل در حالی که صدای کاربر را دریافت می‌کند، می‌تواند صحبت کند، مکث کند یا واکنش کوتاهی نشان دهد. این موضوع باعث می‌شود تعامل‌هایی مانند موارد زیر طبیعی‌تر شوند: OpenAI می‌گوید وظیفه اصلی معماری جدید، حفظ یک جریان صوتی بدون وقفه است. پردازش صدا در مسیر اصلی انجام می‌شود و کارهای سنگین‌تر مانند استفاده از ابزارها یا استدلال پیچیده، به مسیرهای جداگانه انتقال پیدا می‌کنند. تفاوت GPT-Live با حالت صوتی قبلی ChatGPT چیست؟ نسل‌های قبلی قابلیت صوتی ChatGPT نیز امکان گفت‌وگوی مستقیم را فراهم می‌کردند، اما معماری آن‌ها همچنان تا حد زیادی به مکالمه نوبتی وابسته بود. تفاوت اصلی GPT-Live را می‌توان در جدول زیر مشاهده کرد: ویژگی سیستم صوتی قبلی GPT-Live شیوه مکالمه نوبتی پیوسته و هم‌زمان تشخیص پایان صحبت متکی به Turn Detector کنترل‌شده توسط مدل امکان قطع پاسخ محدودتر طبیعی‌تر و سریع‌تر پردازش صوت مرحله‌ای جریان دائمی صوت استفاده از مدل‌های دیگر ممکن است باعث مکث شود در مسیر جداگانه انجام می‌شود حس مکالمه شبیه پرسش و پاسخ نزدیک‌تر به گفت‌وگوی انسانی در روش‌های قدیمی‌تر، حتی مدل‌های Speech-to-Speech نیز برای شروع پردازش منتظر تصمیم تشخیص‌دهنده پایان صحبت می‌ماندند. GPT-Live این محدودیت را کاهش می‌دهد و اجازه می‌دهد خود مدل صوتی مدیریت مکالمه را بر عهده بگیرد. OpenAI چگونه تأخیر مکالمه صوتی را کاهش داده است؟ طبیعی بودن مکالمه فقط به قدرت مدل وابسته نیست. انتقال صدا، وضعیت شبکه، اجرای ابزارها و مدیریت سابقه مکالمه نیز می‌توانند باعث ایجاد تأخیر شوند. OpenAI برای کاهش این تأخیر، مسیر انتقال صدا را از منطق برنامه جدا کرده است. صوت میان دستگاه کاربر و مدل از یک مسیر سریع و اختصاصی عبور می‌کند؛ در حالی که کارهایی مانند جست‌وجو، فراخوانی ابزار یا اجرای سرویس‌های جانبی در یک مسیر غیرهم‌زمان انجام می‌شوند. بنابراین اگر یک ابزار یا سرویس خارجی با تأخیر پاسخ دهد، جریان صوتی مکالمه متوقف نمی‌شود. همچنین OpenAI بخشی از زیرساخت قبلی مبتنی بر Python asyncio را با زبان Go بازنویسی کرده است. بر اساس توضیحات این شرکت، این تغییر باعث شده انتقال فریم‌های صوتی روان‌تر و پایدارتر شود. نقش WebRTC در GPT-Live GPT-Live برای انتقال صوت از WebRTC استفاده می‌کند؛ فناوری‌ای که برای ارتباطات صوتی و تصویری بلادرنگ طراحی شده است. WebRTC می‌تواند در شرایطی مانند افت بسته‌های شبکه، تغییر اتصال یا ناهماهنگی زمان‌بندی همچنان ارتباط را حفظ کند. برای مثال، اگر بخشی از صدا دیر برسد، سیستم می‌تواند پخش آن را کمی تنظیم کند تا از ایجاد سکوت یا پرش صوتی جلوگیری شود. پروتکل WARP چیست؟ راه‌اندازی معمولی WebRTC نیازمند چندین مرحله ارتباط میان کاربر و سرور است. این مراحل می‌توانند شروع مکالمه را به تأخیر بیندازند. OpenAI برای حل این مشکل، پروتکلی به نام WebRTC Abridged Roundtrip Protocol یا WARP توسعه داده است. این پروتکل تعداد رفت‌وبرگشت‌های شبکه برای شروع انتقال صدا و داده را از شش مرحله به یک مرحله کاهش می‌دهد. در کنار WARP، قابلیتی به نام Instant Connect نیز پارامترهای لازم برای اتصال را پیشاپیش آماده می‌کند. به این ترتیب، کاربر می‌تواند سریع‌تر وارد مکالمه صوتی شود. نقش GPT-5.5 در GPT-Live چیست؟ GPT-Live برای پاسخ‌های سریع و مکالمه طبیعی طراحی شده است، اما همه درخواست‌ها را به‌تنهایی پردازش نمی‌کند. اگر کاربر پرسشی مطرح کند که به استدلال عمیق، جست‌وجو یا استفاده از ابزار نیاز داشته باشد، GPT-Live می‌تواند از مدل‌های قدرتمندتری مانند GPT-5.6 کمک بگیرد. این فرایند در یک مسیر جداگانه انجام می‌شود. مدل صوتی می‌تواند در زمان پردازش درخواست، جریان گفت‌وگو را حفظ کند و پس از آماده شدن نتیجه، آن را وارد پاسخ کند. OpenAI این معماری را جداسازی «صحبت کردن» از «تفکر عمیق‌تر» توصیف می‌کند. هدف این است که استفاده از مدل‌های قدرتمند و ابزارها، باعث سکوت طولانی یا قطع مکالمه نشود. GPT-Live چه کاربردهایی دارد؟ معماری GPT-Live می‌تواند زمینه‌ساز نسل جدیدی از محصولات صوتی باشد. برخی از مهم‌ترین کاربردهای آن عبارت‌اند از: OpenAI اعلام کرده است که این زیرساخت در ChatGPT Voice برای قابلیت‌هایی مانند کنترل رایانه و هماهنگ کردن ایجنت‌ها در اپلیکیشن دسکتاپ ChatGPT نیز مورد استفاده قرار می‌گیرد. آیا GPT-Live اکنون در دسترس کاربران است؟ فناوری پشت GPT-Live در حال حاضر بخشی از زیرساخت ChatGPT Voice است، اما OpenAI هنوز GPT-Live API را به‌صورت عمومی منتشر نکرده است. این شرکت اعلام کرده که معماری جدید، زیربنای API آینده GPT-Live خواهد بود. با

...

زنگ خطر جدید برای بازار کار: هوش مصنوعی شغل‌ ها را نمی‌گیرد، جیب‌ها را خالی می‌کند!

از زمان معرفی عمومی چت‌بات‌های هوشمند و آغاز عصر جدید تکنولوژی، یک ترس مشترک و سایه‌ای سنگین بر جوامع بشری ریشه دواند: «ربات‌ها قرار است ما را اخراج کنند». در دو سال گذشته، تیتر اخبار پر از پیش‌بینی‌های آخرالزمانی درباره جایگزینی کامل نیروی کار انسانی با ماشین‌ها بود. اما اکنون که زمان کافی برای بررسی داده‌های واقعی اقتصاد سپری شده است، واقعیت کف بازار کار مسیر کاملاً متفاوتی را نشان می‌دهد. بر اساس یک گزارش جامع، تکان‌دهنده و ساختارشکن که اخیراً توسط موسسه Apollo (یکی از بزرگترین شرکت‌های مدیریت سرمایه در جهان) منتشر شده است، خطر اصلی و فوری در بازار کار، اخراج‌های دسته‌جمعی نیست؛ بلکه پدیده‌ای خاموش‌تر اما به همان اندازه مخرب در جریان است: شرکت‌ها در حال مصادره سود حاصل از بهره‌وری هوش مصنوعی از طریق سرکوب و کاهش رشد دستمزدها (Wage Compression) هستند. داده‌های این تحقیق به صراحت نشان می‌دهند مشاغلی که به شدت با ابزارهای هوش مصنوعی درگیر شده‌اند، پس از سال ۲۰۲۳ میلادی با کاهش ۶.۷ درصدی در رشد دستمزدهای واقعی خود مواجه بوده‌اند، در حالی که نرخ اشتغال آن‌ها تغییر منفی معناداری نکرده است. این پدیده، درک کلاسیک ما را از آینده شغلی با هوش مصنوعی کاملاً دگرگون می‌کند؛ آینده‌ای که در آن حفظ کردن صندلی و داشتن یک شغل، دیگر به معنای تضمین یک درآمد ایده‌آل، رو به رشد و متناسب با تورم نخواهد بود. عبور از پیش‌بینی‌های تئوری به واقعیت کف بازار برای درک اهمیت این گزارش، باید به نحوه ارزیابی تاثیر هوش مصنوعی در سال‌های گذشته نگاه کنیم. تا پیش از این، ادبیات تحقیق درباره تاثیر هوش مصنوعی بر نیروی کار به شدت بر «تئوری» و «احتمالات» متکی بود. محققان با استفاده از پایگاه‌های داده‌ای مانند O*NET (پایگاه اطلاعات مشاغل وزارت کار آمریکا)، شرح وظایف روی کاغذِ مشاغل را بررسی می‌کردند تا حدس بزنند کدام کارها ممکن است توسط ماشین‌ها انجام شوند. در این گزارش به وضوح اشاره شده است که تحقیقات قبلی (نسل اول تحقیقات هوش مصنوعی) تنها نشان می‌دادند که هوش مصنوعی «چه کارهایی را می‌تواند انجام دهد»، نه اینکه «مردم در واقعیت چگونه از آن استفاده می‌کنند». اما نقطه قوت و تمایز بی‌نظیر گزارش Apollo، تکیه بر داده‌های استفاده واقعی (Observed Usage) است. این موسسه با بهره‌گیری از شاخص اقتصادی شرکت Anthropic (شرکت سازنده هوش مصنوعی کلود که یکی از رقبا و شرکای کلیدی در توسعه بهترین ابزارهای هوش مصنوعی ۲۰۲۶ است) و تحلیل لاگ‌های واقعی مکالمات کاربران، تاثیر ملموس این ابزارها را اندازه‌گیری کرده است. نتایج نشان می‌دهد وقتی کارمندان در عمل از این سیستم‌ها برای انجام کارهایشان استفاده می‌کنند، ارزش افزوده این کار مستقیماً به جیب کارفرما می‌رود، نه کارمند. کارفرمایان متوجه شده‌اند که با کمک هوش مصنوعی، کارهای پیچیده توسط افراد با مهارت کمتر نیز قابل انجام است، در نتیجه قدرت چانه‌زنی کارمندان برای افزایش حقوق به شدت افت می‌کند. متدولوژی تحقیق: اثبات کاهش دستمزد بدون افت اشتغال موسسه Apollo برای رسیدن به این نتایج، از یک مدل اقتصادسنجی دقیق به نام «تفاضل در تفاضل» (Difference-in-Differences یا DiD) استفاده کرده است. آن‌ها داده‌های اشتغال و دستمزد ۳۲۱ شغل مختلف را از سال ۲۰۱۵ تا ۲۰۲۵ مورد بررسی قرار دادند و سال ۲۰۲۳ (سال پس از عرضه عمومی چت‌بات‌های پیشرفته) را به عنوان نقطه شکست ساختاری (Structural Break) در نظر گرفتند. یافته‌های این مدل آماری به صورت زیر خلاصه می‌شود: شکاف طبقاتی: اقتصاد هوش مصنوعی با چه کسانی بی‌رحم‌تر است؟ عمیق‌ترین و شاید تاریک‌ترین بخش این گزارش، بررسی تاثیر این پدیده بر دهک‌های مختلف درآمدی و حوزه‌های کاری متفاوت است. داده‌ها به وضوح اثبات می‌کنند که اقتصاد هوش مصنوعی به هیچ وجه عادلانه رفتار نمی‌کند و بار اصلی این تحول، بر دوش آسیب‌پذیرترین اقشار جامعه افتاده است. برای درک بهتر این شکاف طبقاتی، جدول زیر میزان تاثیرپذیری دستمزدهای واقعی را در گروه‌های مختلف نشان می‌دهد: گروه شغلی / دهک درآمدی میزان تاثیر بر رشد دستمزد وضعیت اشتغال تحلیل وضعیت کارمندان بخش خدمات (Service) -۲۴.۳٪ (کاهش شدید) بدون تغییر معنادار بیشترین آسیب به دلیل اتوماسیونِ آسانِ وظایف پایه‌ای و خدماتی. پایین‌ترین دهک درآمدی (Q1) -۱۰.۷٪ (کاهش بالا) بدون تغییر معنادار کاهش شدید قدرت چانه‌زنی کارگران ساده در برابر کارفرمایان. مشاغل اداری و فروش (Sales/Office) -۷.۳٪ (کاهش متوسط) بدون تغییر معنادار جایگزینی بخشی از وظایف تحلیلی با ابزارهای هوش مصنوعی متنی. دهک بالای درآمدی (Top Quartile) بدون تغییر معنادار بدون تغییر معنادار استفاده از هوش مصنوعی به عنوان اهرم قدرت برای ارتقای جایگاه. کارگران یقه آبی (فیزیکی) بدون تغییر معنادار بدون تغییر معنادار عدم توانایی هوش مصنوعی در انجام کارهای فیزیکی و مهارتی در دنیای واقعی. مصونیت کامل پردرآمدها و مدیران ارشد همان‌طور که در جدول مشخص است، پردرآمدترین افراد جامعه (یک‌چهارم بالای توزیع درآمدی یا Top Quartile) هیچ تاثیر منفی و معناداری را روی دستمزدهای خود تجربه نکرده‌اند. این بدان معناست که مدیران ارشد، متخصصان رده‌بالا و تصمیم‌گیرندگان کلان با تسلط بر اقتصاد هوش مصنوعی در سازمان‌ها، نه‌تنها موقعیت خود را از دست نداده‌اند، بلکه این فناوری را به یک اهرم قدرت برای افزایش بهره‌وری شخصی و سازمانی خود تبدیل کرده‌اند. جالب اینجاست که کارگران یقه آبی (Blue-collar) و مشاغل کاملاً فیزیکی نظیر لوله‌کش‌ها یا کارگران ساختمانی نیز فعلاً از این ترکش‌ها کاملاً در امان مانده‌اند، زیرا هوش مصنوعی هنوز توانایی ورود به دنیای فیزیکی و انجام کارهای دستی پیچیده را پیدا نکرده است. آمار شوکه‌کننده: ۵.۸ میلیون کارگر و خسارت ۲۸ میلیارد دلاری این تغییرات تنها روی کاغذ نیستند. در حال حاضر، حدود ۵.۸ میلیون کارگر در ایالات متحده (معادل ۳.۷ درصد از کل نیروی کار) در مشاغلی با میزان درگیری بالا با هوش مصنوعی (نمره بالای ۰.۵ در شاخص آنتروپیک) مشغول به کار هستند. گزارش Apollo تخمین می‌زند که این فشردگی و سرکوب دستمزدها، سالانه منجر به ۲۸ میلیارد دلار خسارت و کاهش درآمد نیروی کار تنها در همین گروه ۵.۸ میلیون نفری می‌شود. این ۲۸ میلیارد دلار در واقع ثروتی است که از جیب نیروی کار خارج شده و مستقیماً به حاشیه سود شرکت‌ها و کارفرمایان افزوده می‌شود. نوک پیکان به سمت کدام مشاغل است؟ در این ارزیابی، مشاغلی مانند برنامه‌نویسان کامپیوتر (با نمره درگیری ۰.۷۵)، نمایندگان پشتیبانی مشتری (نمره ۰.۷۰)، متخصصان ورود اطلاعات (نمره ۰.۶۷) و تحلیل‌گران تحقیقات بازار در صدر لیست مشاغل در معرض خطر قرار دارند. با روی کار آمدن

...

معرفی هوش مصنوعی Lyria 3.5 گوگل؛ تحول تولید موسیقی با Google Flow

مدل Lyria 3.5 گوگل دیپ‌مایند با ادغام در پلتفرم Google Flow Music، کیفیت تولید موسیقی، وکال و کنترل خلاقانه توسط هوش مصنوعی را به سطح جدیدی ارتقا داده است....

ورود هوش مصنوعی به زیرساخت‌های کلان علمی؛ بررسی استراتژی توسعه علوم ملی

ادغام مدل‌های پیشرفته‌ی هوش مصنوعی با زیرساخت‌های کلان علمی و ابررایانه‌ها، با هدف تسریع کشفیات و دوبرابر کردن بهره‌وری پژوهش‌ها در دهه‌ی آینده در حال انجام است....

درخواست مشاوره

برای دریافت مشاوره تخصصی و راهنمایی‌های دقیق، فرم زیر را پر کنید و تیم ما در سریع‌ترین زمان ممکن با شما تماس خواهد گرفت.