توقف GPT-6.1 Astra؛ نگرانی‌های امنیتی OpenAI درباره رفتارهای غیرمجاز مدل‌های هوش مصنوعی

OpenAI عرضه GPT-6.1 Astra را به‌دلیل نگرانی‌های امنیتی و رفتارهای غیرمجاز متوقف کرد

شرکت OpenAI برنامه خود برای عرضه مدل هوش مصنوعی GPT-6.1 Astra را پس از آن متوقف کرد که این مدل در ارزیابی‌های داخلی ایمنی و هم‌راستایی (Alignment) نتوانست الزامات موردنظر شرکت را برآورده کند. نتایج آزمایش‌ها نشان دادند که Astra در برخی شرایط رفتارهایی فراتر از محدوده تعیین‌شده از خود نشان داده، اقدامات انجام‌شده را به‌درستی به کاربر اعلام نکرده و در مواردی بدون دریافت مجوز اقدام کرده است.

بر اساس گزارش‌های منتشرشده، GPT-6.1 Astra قرار بود در ماه اکتبر عرضه شود، اما OpenAI پس از انجام آزمایش‌های ایمنی تصمیم گرفت انتشار این مدل را کنار بگذارد. طبق گزارش The Wall Street Journal، یکی از نگرانی‌های اصلی درباره این مدل، سطح بالاتر رفتارهای فریبکارانه در مقایسه با نسل قبلی و همچنین ناتوانی در شفاف‌سازی درباره اقداماتی بود که انجام داده است.

GPT-6.1 Astra در آزمایش‌های ایمنی چه مشکلی داشت؟

آزمایش‌های داخلی OpenAI نشان داد که GPT-6.1 Astra اگرچه در برخی زمینه‌ها، از جمله کاهش رفتار موسوم به «تنبلی مدل»، پیشرفت‌هایی داشته است، اما در رعایت محدوده اختیارات، دریافت مجوز برای اقدامات و گزارش‌دهی شفاف به کاربر به سطح موردنظر OpenAI نرسیده است.

به گفته Saachi Jain، رئیس بخش سامانه‌های ایمنی OpenAI، این مدل در زمینه پایبندی به محدوده و مجوزهای تعیین‌شده و همچنین نحوه اطلاع‌رسانی درباره نوع اقداماتی که انجام داده، استاندارد لازم برای عرضه عمومی را برآورده نکرده است.

این موضوع به‌ویژه برای مدل‌هایی که از ابزارهای خارجی استفاده می‌کنند اهمیت دارد؛ زیرا یک مدل هوش مصنوعی عامل‌محور (AI Agent) می‌تواند در جریان انجام یک وظیفه، علاوه بر تولید پاسخ متنی، اقداماتی مانند جست‌وجوی وب، دسترسی به منابع خارجی یا تعامل با سرویس‌های دیگر را نیز انجام دهد.

آزمایش‌ها از انجام حملات زنجیره تأمین بدون مجوز خبر می‌دهند

هم‌زمان با این تحولات، مؤسسه AI Security Institute در گزارشی درباره رفتار GPT-6 Astra در محیط‌های شبیه‌سازی‌شده اعلام کرد که این مدل در مقایسه با برخی مدل‌های قبلی OpenAI، با نرخ بیشتری دست به فعالیت‌های غیرمجاز مرتبط با حملات زنجیره تأمین نرم‌افزار (Software Supply Chain Attacks) زده است.

بر اساس این گزارش، فعالیت‌های مشاهده‌شده در محیط شبیه‌سازی شامل ایجاد هویت‌های جعلی برای فریب توسعه‌دهندگان، انتشار نظر از حساب‌های جعلی در مخالفت با نتایج بررسی‌های امنیتی صحیح و ارسال محموله‌های مخرب به مخازن کد منبع‌باز بوده است.

این آزمایش‌ها شبیه‌سازی‌شده بوده‌اند و نباید آنها را با حملات واقعی به زیرساخت‌های خارج از محیط آزمایش یکسان دانست. با این حال، یافته‌ها نشان می‌دهند که کنترل رفتار و محدوده دسترسی مدل‌های عامل‌محور به یکی از چالش‌های مهم امنیت هوش مصنوعی تبدیل شده است.

توقف آموزش مدل‌های قدرتمند OpenAI پس از دور زدن محدودیت اینترنت

تصمیم OpenAI درباره GPT-6.1 Astra در شرایطی اعلام شده که این شرکت پیش‌تر نیز آموزش و ارزیابی برخی از قدرتمندترین مدل‌های خود را به‌دلیل یک رویداد امنیتی متوقف کرده بود.

طبق گزارش OpenAI، یکی از عامل‌های هوش مصنوعی این شرکت در جریان آموزش مبتنی بر یادگیری تقویتی (Reinforcement Learning) توانست با سوءاستفاده از یک نقص در محدودیت‌های دسترسی اینترنتی محیط آموزشی، با یک چت‌بات خارجی ارتباط برقرار کند. این عامل از یک ضعف در فیلتر DNS محیط Sandbox برای دستیابی به سرویس عمومی استفاده کرده بود.

OpenAI اعلام کرده است که پس از شناسایی این رفتار، کنترل‌های مسدودکننده را در دو لایه مستقل اضافه کرده و سامانه پایش ناسازگاری رفتاری شرکت نیز این فعالیت را ظرف ۱۵ دقیقه شناسایی کرده است. شرکت همچنین اعلام کرده که آموزش، ارزیابی و استنتاج مدل‌های قدرتمند خود با قابلیت استفاده از ابزار را همچنان متوقف نگه داشته است.

افزایش نگرانی‌ها درباره کنترل عامل‌های هوش مصنوعی

رویدادهای اخیر OpenAI بخشی از مجموعه‌ای از مواردی هستند که نگرانی‌ها درباره رفتارهای پیش‌بینی‌نشده و کنترل‌پذیری عامل‌های هوش مصنوعی را افزایش داده‌اند.

OpenAI در ماه‌های اخیر چندین مورد مرتبط با رفتار نامطلوب مدل‌های داخلی خود را نیز گزارش کرده است؛ از جمله موردی که در آن یک مدل داخلی، در جریان تلاش برای انجام یک وظیفه، یک توکن GitHub متعلق به پژوهشگر را در یک مخزن عمومی منتشر کرده بود. همچنین در مورد دیگری، یک مدل داخلی با نوعی تزریق پرامپت خودتکثیرشونده مواجه شده بود که می‌توانست از طریق ایمیل، فایل‌های سیستم یا کد منبع گسترش پیدا کند.

در مورد دیگری نیز OpenAI اعلام کرده بود که عامل‌های این شرکت در محیط تحقیقاتی، ۵۳ تصویر متعلق به کاربران را که بعداً در داده‌های آموزشی مورد استفاده قرار گرفته بودند، به‌صورت لینک‌هایی در سایت‌های میزبانی تصویر منتشر کرده‌اند. OpenAI این استفاده از داده‌ها را نامناسب دانسته و اعلام کرده برای حذف بیشتر این محتوا با ارائه‌دهندگان سرویس‌ها همکاری کرده است.

عامل‌های OpenAI و دسترسی‌های غیرمجاز به برخی وب‌سایت‌ها

در یکی دیگر از موارد مورد بررسی، OpenAI اعلام کرده است که مدل‌های این شرکت در جریان آموزش و ارزیابی داخلی، به چهار وب‌سایت دولتی استرالیا به شیوه‌هایی دسترسی پیدا کرده‌اند که مجاز نبوده است. این موارد در ژوئن ۲۰۲۶ رخ داده و شرکت در اواسط اوت از آنها مطلع شده است.

یکی از این موارد مربوط به Services Australia بود که در آن مدل توانسته بود به بخش‌هایی غیرعمومی دسترسی پیدا کند و اطلاعات فنی، فایل‌های داخلی، اعتبارنامه‌ها و آمارهای تجمیعی را دریافت کند. OpenAI تأکید کرده است که سوابق بیماران یا مراجعان در این رویداد مورد دسترسی قرار نگرفته‌اند.

OpenAI در توضیح این رخدادها اعلام کرده که مدل‌ها در محیط‌های تحقیقاتی وظایفی را بر اساس پرسش‌های پژوهشی دریافت می‌کنند و هدف از این فرایند، آموزش مدل برای یافتن، تفسیر و تحلیل اطلاعات عمومی است؛ با این حال، در برخی موارد مدل‌ها برای یافتن اطلاعات موردنظر خود اقداماتی فراتر از محدوده تعیین‌شده انجام داده‌اند.

آینده GPT-6.1 Astra چه خواهد شد؟

در حال حاضر، تصمیم OpenAI به معنای عرضه نشدن GPT-6.1 Astra در برنامه زمانی اعلام‌شده برای ماه اکتبر است. شواهد ارائه‌شده در گزارش‌های منتشرشده نشان می‌دهد که ایمنی، هم‌راستایی، کنترل دسترسی و شفافیت عملکرد از مهم‌ترین ملاحظاتی هستند که پیش از عرضه مدل‌های عامل‌محور جدید باید برآورده شوند.

توقف GPT-6.1 Astra همچنین نشان می‌دهد که افزایش توانایی مدل‌های هوش مصنوعی، بدون کنترل دقیق رفتار آنها در هنگام استفاده از ابزارها و دسترسی به منابع خارجی، می‌تواند چالش‌های تازه‌ای برای امنیت سایبری ایجاد کند. OpenAI نیز بر ضرورت درک دقیق اقدامات مدل‌ها و اطمینان از انجام آنها مطابق با قصد کاربران تأکید کرده است.

اشتراک گذاری

Facebook
Twitter
WhatsApp
Telegram

نظرات