ابزارهای هوش مصنوعی میتوانند تصاویر پزشکی را تحلیل کنند، بیماریهای احتمالی را پیشنهاد دهند و حتی دلیل تشخیص خود را با زبانی ساده توضیح دهند. این قابلیتها ممکن است در نگاه اول استفاده از هوش مصنوعی برای تشخیص بیماری را کاملاً منطقی و مطمئن نشان دهند.
اما مشکل زمانی آغاز میشود که پاسخ هوش مصنوعی اشتباه باشد. یک توضیح روان، علمینما و با اعتمادبهنفس میتواند باعث شود کاربر پاسخ نادرست مدل را بپذیرد؛ بهخصوص اگر دانش پزشکی کافی برای ارزیابی آن نداشته باشد.
پژوهش جدیدی از محققان MIT و چند دانشگاه دیگر نشان میدهد هوش مصنوعی در تشخیص پزشکی برای همه کاربران به یک اندازه مفید نیست. پزشکان و افراد غیرمتخصص از یک پیشنهاد مشابه AI برداشت متفاوتی دارند و توضیحات بیشتر نیز همیشه به تصمیم دقیقتر منجر نمیشوند.
پژوهش جدید MIT درباره هوش مصنوعی پزشکی چه چیزی را بررسی کرد؟
این پژوهش با هدف بررسی تأثیر سطح تخصص کاربران بر استفاده از ابزارهای هوش مصنوعی پزشکی انجام شد. محققان میخواستند بدانند آیا توضیحپذیر کردن پاسخهای AI میتواند به افراد کمک کند تشخیص درستتری داشته باشند و خطاهای مدل را بهتر شناسایی کنند.
در این مطالعه، دو گروه مورد بررسی قرار گرفتند:
- افراد فاقد تخصص پزشکی
- پزشکان مراقبتهای اولیه
افراد غیرمتخصص باید با مشاهده تصویر یک خال پوستی تشخیص میدادند که آیا احتمال سرطانی بودن آن وجود دارد یا خیر. پزشکان وظیفه دشوارتری داشتند و باید برای تصاویر بیماریهای پوستی، تشخیص افتراقی ارائه میکردند.
شرکتکنندگان ابتدا در برخی موارد بدون کمک هوش مصنوعی تصمیم گرفتند و در موارد دیگر، یکی از چند نوع راهنمایی AI را دریافت کردند.
هوش مصنوعی چگونه به شرکتکنندگان کمک کرد؟
پژوهشگران چهار شیوه ارائه اطلاعات را با یکدیگر مقایسه کردند:
- پیشبینی مدل همراه با میزان اطمینان، بدون توضیح
- نمایش تصاویر پزشکی مشابه
- نقشه حرارتی برای مشخص کردن نواحی مهم تصویر
- توضیح متنی تولیدشده توسط یک مدل زبانی بزرگ
هدف از این روشها آن بود که کاربر فقط یک پاسخ نهایی دریافت نکند و بتواند شواهد یا توضیحی درباره تصمیم مدل ببیند.
این دسته از روشها معمولاً با عنوان هوش مصنوعی توضیحپذیر یا Explainable AI شناخته میشوند. فرض اصلی این است که اگر مدل دلیل تصمیم خود را توضیح دهد، کاربر بهتر میتواند تشخیص دهد چه زمانی باید به آن اعتماد کند.
نتایج این پژوهش نشان داد این فرض همیشه درست نیست.
نتیجه پژوهش MIT؛ هوش مصنوعی برای همه کاربران یکسان عمل نمیکند
کمک هوش مصنوعی بهطور کلی دقت هر دو گروه را افزایش داد، اما دلیل این بهبود در پزشکان و افراد غیرمتخصص متفاوت بود.
افراد غیرمتخصص بیشتر به این دلیل عملکرد بهتری داشتند که از پیشنهاد هوش مصنوعی پیروی میکردند. از آنجا که مدل مورد استفاده در بسیاری از نمونهها تشخیص درستی داشت، این وابستگی در مجموع باعث افزایش دقت آنها شد.
اما همین رفتار هنگام اشتباه بودن مدل به یک نقطهضعف جدی تبدیل شد.
افراد غیرمتخصص معمولاً توانایی کمتری برای تشخیص خطای سیستم داشتند و حتی زمانی که هوش مصنوعی پاسخ نادرستی ارائه میکرد، احتمال داشت نظر خود را با پیشنهاد مدل هماهنگ کنند. محققان این رفتار را نوعی تبعیت از الگوریتم دانستند.
در مقابل، پزشکان معمولاً پیش از مشاهده پاسخ AI، یک نظر اولیه بر اساس آموزش و تجربه خود داشتند. آنها پیشنهاد مدل را با دانش پزشکیشان مقایسه میکردند و در نتیجه بهتر میتوانستند خطاهای آن را تشخیص دهند.
چرا توضیحات هوش مصنوعی همیشه مفید نیستند؟
یکی از مهمترین یافتههای پژوهش، تأثیر توضیحات متنی تولیدشده توسط مدلهای زبانی بود.
افراد غیرمتخصص توضیحات مدل زبانی را هم در زمان درست بودن و هم هنگام اشتباه بودن پاسخ، قابلاعتماد میدانستند. حتی توضیحاتی که مبهم، کلی یا عمومی بودند، گاهی برای آنها متقاعدکنندهتر به نظر میرسیدند. این مسئله نشان میدهد یک پاسخ دارای توضیح الزاماً پاسخ مطمئنتری نیست. مدل زبانی میتواند برای یک تشخیص نادرست نیز متنی منسجم و ظاهراً منطقی تولید کند.
خطر اصلی این است که کاربر ممکن است کیفیت نگارش توضیح را با صحت پزشکی آن اشتباه بگیرد. در این پژوهش، اثر تبعیت از هوش مصنوعی هنگام استفاده از توضیحات مدل زبانی بیشتر بود و افراد غیرمتخصص حتی نسبت به پاسخهای غلط خود اطمینان بیشتری پیدا میکردند. این پدیده به سوگیری اتوماسیون مربوط است؛ یعنی تمایل افراد به اعتماد بیش از حد به پیشنهادهای سیستمهای خودکار، حتی زمانی که احتمال اشتباه وجود دارد.
مسئله شفافیت فقط به پزشکی محدود نیست و پژوهشگران در حوزه شفافیت عصبی مدلهای هوش مصنوعی نیز تلاش میکنند بفهمند این سامانهها چگونه به پاسخ نهایی میرسند.
تفاوت استفاده پزشکان و افراد عادی از هوش مصنوعی پزشکی
| ویژگی | افراد غیرمتخصص | پزشکان |
|---|---|---|
| نظر اولیه پیش از مشاهده پاسخ AI | معمولاً ضعیفتر | مبتنی بر آموزش و تجربه |
| اعتماد به پیشنهاد مدل | بیشتر | محتاطانهتر |
| توانایی تشخیص خطای مدل | کمتر | بیشتر |
| تأثیر توضیحات مدل زبانی | بسیار زیاد | محدودتر |
| بهترین نوع کمک AI | نیازمند طراحی محافظتی | پیشبینی ساده مدل |
پزشکان در این پژوهش در برابر توضیحات اشتباه هوش مصنوعی مقاومتر بودند. جالبتر اینکه بهترین عملکرد آنها زمانی ثبت شد که فقط پیشبینی مدل را بدون توضیحات اضافه دریافت کردند. توضیحات مدل زبانی کمترین بهبود را برای پزشکان ایجاد کرد.
این نتیجه نشان میدهد افزودن اطلاعات بیشتر به رابط کاربری همیشه به تصمیم بهتر منجر نمیشود. گاهی توضیح اضافی میتواند باعث حواسپرتی، سوگیری یا پیچیده شدن تصمیمگیری شود.
زمان نمایش پیشنهاد هوش مصنوعی نیز مهم است
محققان دریافتند زمان ارائه توضیحات AI بر میزان اعتماد کاربران اثر میگذارد.
وقتی توضیح هوش مصنوعی پیش از آنکه فرد فرصت کند نظر خودش را شکل دهد نمایش داده میشد، کاربران وابستگی بیشتری به مدل پیدا میکردند.
در مقابل، اگر ابتدا از کاربر خواسته شود فرضیه یا تشخیص اولیه خود را بیان کند و سپس پیشنهاد AI را ببیند، احتمال بیشتری وجود دارد که پاسخ مدل را بهصورت انتقادی بررسی کند.
بر همین اساس، پژوهشگران پیشنهاد میکنند سیستمهای پزشکی بهجای آنکه بلافاصله یک پاسخ کامل و متقاعدکننده ارائه دهند، ابتدا کاربر را وادار به تفکر مستقل کنند و سپس گزینههای احتمالی دیگری را نشان دهند.
آیا هوش مصنوعی در تشخیص پزشکی قابل اعتماد است؟
پاسخ به این سؤال به نحوه استفاده از هوش مصنوعی بستگی دارد.
AI میتواند در برخی وظایف پزشکی بسیار مفید باشد؛ از جمله:
- شناسایی الگوهای ظریف در تصاویر
- کمک به تشخیص زودهنگام
- ارائه گزینههای احتمالی برای بررسی بیشتر
- کاهش بخشی از خطاهای انسانی
- کمک به اولویتبندی موارد مشکوک
در پژوهش MIT، مدلهای هوش مصنوعی در مواردی که نشانههای بیماری ظریف بودند، عملکرد بهتری از انسان داشتند. با این حال، انسانها هنگام وجود علائم غیرمعمول یا ویژگیهای نامرتبط در تصویر، بهتر از مدل عمل کردند.
این تفاوت نشان میدهد هوش مصنوعی و انسان نقاط قوت یکسانی ندارند. بهترین نتیجه زمانی حاصل میشود که AI بهعنوان ابزار کمکی تصمیمگیری استفاده شود، نه مرجع نهایی و بدون خطا.
نقش هوش مصنوعی در تشخیص بیماریهای پوستی
تصاویر پوست یکی از حوزههای مهم کاربرد هوش مصنوعی پزشکی هستند. الگوریتمهای بینایی ماشین میتوانند با بررسی رنگ، شکل، حاشیه و بافت ضایعات پوستی، الگوهای مشکوک را شناسایی کنند.
با این حال، نتیجه مدل به عوامل مختلفی وابسته است:
- کیفیت و وضوح تصویر
- زاویه و نور محیط
- نوع دوربین
- رنگ پوست بیمار
- شباهت میان بیماریها
- وجود علائم غیرمعمول
- میزان تنوع دادههای آموزشی مدل
یکی از بخشهای مهم پژوهش، استفاده از مدلی بود که با محدودیتهای مرتبط با عدالت الگوریتمی آموزش دیده بود. این مدل توانست دقت تشخیص را بهبود دهد و اختلاف عملکرد میان رنگهای مختلف پوست را کاهش دهد.
این یافته اهمیت دادههای متنوع و ارزیابی عملکرد مدل روی گروههای مختلف جمعیتی را نشان میدهد.

آیا میتوان برای تشخیص بیماری به ChatGPT اعتماد کرد؟
مدلهای زبانی مانند ChatGPT میتوانند اطلاعات عمومی پزشکی را توضیح دهند، پرسشهای مناسب برای مراجعه به پزشک پیشنهاد کنند و به کاربران در فهم اصطلاحات پزشکی کمک کنند.
اما متن روان و مطمئن آنها نباید با تشخیص قطعی اشتباه گرفته شود.
مدل زبانی ممکن است:
- اطلاعات ناقص دریافت کند.
- علائم مهم را نادیده بگیرد.
- توضیحی منطقی برای نتیجهای اشتباه تولید کند.
- شرایط اورژانسی را بهدرستی تشخیص ندهد.
- به سابقه کامل، معاینه و آزمایشهای بیمار دسترسی نداشته باشد.
بنابراین کاربران نباید براساس پاسخ یک چتبات، مصرف دارو را آغاز یا متوقف کنند، مراجعه پزشکی را به تأخیر بیندازند یا درباره یک بیماری تشخیص قطعی بدهند.
این پژوهش چه معنایی برای آینده هوش مصنوعی پزشکی دارد؟
مهمترین پیام پژوهش این است که نمیتوان یک سیستم هوش مصنوعی پزشکی واحد را با رابطی یکسان برای همه کاربران طراحی کرد. پزشک متخصص، پزشک عمومی، پرستار، بیمار و کاربر عادی از سطح دانش، نیاز و توانایی متفاوتی برای ارزیابی پاسخ AI برخوردارند.
یک سیستم مناسب برای پزشکان ممکن است فقط پیشبینی، احتمال و دادههای کلیدی را نمایش دهد. اما سامانهای که برای عموم طراحی میشود باید:
- عدم قطعیت مدل را شفاف بیان کند.
- از ارائه تشخیص قطعی خودداری کند.
- کاربر را به مشورت با متخصص هدایت کند.
- علائم خطر و شرایط اورژانسی را برجسته کند.
- امکان شکلگیری نظر مستقل را پیش از نمایش پاسخ فراهم کند.
به گفته پژوهشگران، نحوه ارائه پیشنهاد هوش مصنوعی میتواند به اندازه درست بودن خود پیشنهاد اهمیت داشته باشد.
جمعبندی
پژوهش جدید MIT نشان میدهد هوش مصنوعی میتواند دقت تشخیص پزشکی را برای پزشکان و افراد غیرمتخصص افزایش دهد، اما میزان و نوع این مزیت به تخصص کاربر بستگی دارد.
افراد غیرمتخصص بیشتر تحتتأثیر توضیحات متقاعدکننده مدلهای زبانی قرار میگیرند و ممکن است حتی به یک پاسخ اشتباه اعتماد کنند. پزشکان به دلیل داشتن دانش و تشخیص اولیه، بهتر میتوانند خطاهای مدل را شناسایی کنند.
بنابراین آینده هوش مصنوعی پزشکی نه در جایگزینی کامل پزشک، بلکه در طراحی سیستمهایی است که متناسب با دانش کاربر، تفکر انتقادی را تقویت کنند و از اعتماد کورکورانه به الگوریتم جلوگیری کنند.
سوالات متداول درباره هوش مصنوعی در تشخیص پزشکی
آیا هوش مصنوعی میتواند بیماریها را تشخیص دهد؟
هوش مصنوعی میتواند تصاویر، علائم و دادههای پزشکی را بررسی و بیماریهای احتمالی را پیشنهاد کند؛ اما تشخیص نهایی باید با توجه به معاینه، سوابق بیمار و نظر پزشک انجام شود.
چرا افراد غیرمتخصص بیشتر به هوش مصنوعی پزشکی اعتماد میکنند؟
افراد غیرمتخصص معمولاً دانش کافی برای ارزیابی توضیح و شناسایی خطای مدل را ندارند. به همین دلیل ممکن است پاسخ روان و مطمئن هوش مصنوعی را درستتر از واقعیت تصور کنند.
آیا توضیحات هوش مصنوعی دقت تشخیص را افزایش میدهد؟
همیشه نه. پژوهش MIT نشان داد توضیحات متنی مدل زبانی ممکن است در افراد غیرمتخصص اعتماد بیش از حد ایجاد کند، حتی زمانی که تشخیص هوش مصنوعی اشتباه است.
آیا پزشکان نیز ممکن است به پاسخ اشتباه AI اعتماد کنند؟
بله، هوش مصنوعی میتواند پزشکان را نیز تحتتأثیر قرار دهد؛ اما آموزش و تجربه پزشکی معمولاً به آنها کمک میکند خطاهای مدل را بهتر شناسایی کنند.
آیا میتوان از ChatGPT برای تشخیص بیماری استفاده کرد؟
ChatGPT میتواند اطلاعات عمومی و توضیحات آموزشی ارائه دهد، اما نباید جایگزین معاینه و تشخیص پزشک شود. تصمیمهای درمانی نباید فقط براساس پاسخ یک مدل زبانی گرفته شوند.
آینده هوش مصنوعی پزشکی چگونه خواهد بود؟
احتمالاً هوش مصنوعی بیشتر بهعنوان دستیار پزشکان، ابزار تشخیص زودهنگام و سامانه پشتیبانی تصمیم استفاده خواهد شد. طراحی این ابزارها باید براساس سطح تخصص و نیاز کاربران انجام شود.