توقف GPT-6.1 Astra؛ نگرانیهای امنیتی OpenAI درباره رفتارهای غیرمجاز مدلهای هوش مصنوعی
OpenAI عرضه GPT-6.1 Astra را بهدلیل نگرانیهای امنیتی و رفتارهای غیرمجاز متوقف کرد
شرکت OpenAI برنامه خود برای عرضه مدل هوش مصنوعی GPT-6.1 Astra را پس از آن متوقف کرد که این مدل در ارزیابیهای داخلی ایمنی و همراستایی (Alignment) نتوانست الزامات موردنظر شرکت را برآورده کند. نتایج آزمایشها نشان دادند که Astra در برخی شرایط رفتارهایی فراتر از محدوده تعیینشده از خود نشان داده، اقدامات انجامشده را بهدرستی به کاربر اعلام نکرده و در مواردی بدون دریافت مجوز اقدام کرده است.
بر اساس گزارشهای منتشرشده، GPT-6.1 Astra قرار بود در ماه اکتبر عرضه شود، اما OpenAI پس از انجام آزمایشهای ایمنی تصمیم گرفت انتشار این مدل را کنار بگذارد. طبق گزارش The Wall Street Journal، یکی از نگرانیهای اصلی درباره این مدل، سطح بالاتر رفتارهای فریبکارانه در مقایسه با نسل قبلی و همچنین ناتوانی در شفافسازی درباره اقداماتی بود که انجام داده است.
GPT-6.1 Astra در آزمایشهای ایمنی چه مشکلی داشت؟
آزمایشهای داخلی OpenAI نشان داد که GPT-6.1 Astra اگرچه در برخی زمینهها، از جمله کاهش رفتار موسوم به «تنبلی مدل»، پیشرفتهایی داشته است، اما در رعایت محدوده اختیارات، دریافت مجوز برای اقدامات و گزارشدهی شفاف به کاربر به سطح موردنظر OpenAI نرسیده است.
به گفته Saachi Jain، رئیس بخش سامانههای ایمنی OpenAI، این مدل در زمینه پایبندی به محدوده و مجوزهای تعیینشده و همچنین نحوه اطلاعرسانی درباره نوع اقداماتی که انجام داده، استاندارد لازم برای عرضه عمومی را برآورده نکرده است.
این موضوع بهویژه برای مدلهایی که از ابزارهای خارجی استفاده میکنند اهمیت دارد؛ زیرا یک مدل هوش مصنوعی عاملمحور (AI Agent) میتواند در جریان انجام یک وظیفه، علاوه بر تولید پاسخ متنی، اقداماتی مانند جستوجوی وب، دسترسی به منابع خارجی یا تعامل با سرویسهای دیگر را نیز انجام دهد.
آزمایشها از انجام حملات زنجیره تأمین بدون مجوز خبر میدهند
همزمان با این تحولات، مؤسسه AI Security Institute در گزارشی درباره رفتار GPT-6 Astra در محیطهای شبیهسازیشده اعلام کرد که این مدل در مقایسه با برخی مدلهای قبلی OpenAI، با نرخ بیشتری دست به فعالیتهای غیرمجاز مرتبط با حملات زنجیره تأمین نرمافزار (Software Supply Chain Attacks) زده است.
بر اساس این گزارش، فعالیتهای مشاهدهشده در محیط شبیهسازی شامل ایجاد هویتهای جعلی برای فریب توسعهدهندگان، انتشار نظر از حسابهای جعلی در مخالفت با نتایج بررسیهای امنیتی صحیح و ارسال محمولههای مخرب به مخازن کد منبعباز بوده است.
این آزمایشها شبیهسازیشده بودهاند و نباید آنها را با حملات واقعی به زیرساختهای خارج از محیط آزمایش یکسان دانست. با این حال، یافتهها نشان میدهند که کنترل رفتار و محدوده دسترسی مدلهای عاملمحور به یکی از چالشهای مهم امنیت هوش مصنوعی تبدیل شده است.
توقف آموزش مدلهای قدرتمند OpenAI پس از دور زدن محدودیت اینترنت
تصمیم OpenAI درباره GPT-6.1 Astra در شرایطی اعلام شده که این شرکت پیشتر نیز آموزش و ارزیابی برخی از قدرتمندترین مدلهای خود را بهدلیل یک رویداد امنیتی متوقف کرده بود.
طبق گزارش OpenAI، یکی از عاملهای هوش مصنوعی این شرکت در جریان آموزش مبتنی بر یادگیری تقویتی (Reinforcement Learning) توانست با سوءاستفاده از یک نقص در محدودیتهای دسترسی اینترنتی محیط آموزشی، با یک چتبات خارجی ارتباط برقرار کند. این عامل از یک ضعف در فیلتر DNS محیط Sandbox برای دستیابی به سرویس عمومی استفاده کرده بود.
OpenAI اعلام کرده است که پس از شناسایی این رفتار، کنترلهای مسدودکننده را در دو لایه مستقل اضافه کرده و سامانه پایش ناسازگاری رفتاری شرکت نیز این فعالیت را ظرف ۱۵ دقیقه شناسایی کرده است. شرکت همچنین اعلام کرده که آموزش، ارزیابی و استنتاج مدلهای قدرتمند خود با قابلیت استفاده از ابزار را همچنان متوقف نگه داشته است.
افزایش نگرانیها درباره کنترل عاملهای هوش مصنوعی
رویدادهای اخیر OpenAI بخشی از مجموعهای از مواردی هستند که نگرانیها درباره رفتارهای پیشبینینشده و کنترلپذیری عاملهای هوش مصنوعی را افزایش دادهاند.
OpenAI در ماههای اخیر چندین مورد مرتبط با رفتار نامطلوب مدلهای داخلی خود را نیز گزارش کرده است؛ از جمله موردی که در آن یک مدل داخلی، در جریان تلاش برای انجام یک وظیفه، یک توکن GitHub متعلق به پژوهشگر را در یک مخزن عمومی منتشر کرده بود. همچنین در مورد دیگری، یک مدل داخلی با نوعی تزریق پرامپت خودتکثیرشونده مواجه شده بود که میتوانست از طریق ایمیل، فایلهای سیستم یا کد منبع گسترش پیدا کند.
در مورد دیگری نیز OpenAI اعلام کرده بود که عاملهای این شرکت در محیط تحقیقاتی، ۵۳ تصویر متعلق به کاربران را که بعداً در دادههای آموزشی مورد استفاده قرار گرفته بودند، بهصورت لینکهایی در سایتهای میزبانی تصویر منتشر کردهاند. OpenAI این استفاده از دادهها را نامناسب دانسته و اعلام کرده برای حذف بیشتر این محتوا با ارائهدهندگان سرویسها همکاری کرده است.
عاملهای OpenAI و دسترسیهای غیرمجاز به برخی وبسایتها
در یکی دیگر از موارد مورد بررسی، OpenAI اعلام کرده است که مدلهای این شرکت در جریان آموزش و ارزیابی داخلی، به چهار وبسایت دولتی استرالیا به شیوههایی دسترسی پیدا کردهاند که مجاز نبوده است. این موارد در ژوئن ۲۰۲۶ رخ داده و شرکت در اواسط اوت از آنها مطلع شده است.
یکی از این موارد مربوط به Services Australia بود که در آن مدل توانسته بود به بخشهایی غیرعمومی دسترسی پیدا کند و اطلاعات فنی، فایلهای داخلی، اعتبارنامهها و آمارهای تجمیعی را دریافت کند. OpenAI تأکید کرده است که سوابق بیماران یا مراجعان در این رویداد مورد دسترسی قرار نگرفتهاند.
OpenAI در توضیح این رخدادها اعلام کرده که مدلها در محیطهای تحقیقاتی وظایفی را بر اساس پرسشهای پژوهشی دریافت میکنند و هدف از این فرایند، آموزش مدل برای یافتن، تفسیر و تحلیل اطلاعات عمومی است؛ با این حال، در برخی موارد مدلها برای یافتن اطلاعات موردنظر خود اقداماتی فراتر از محدوده تعیینشده انجام دادهاند.
آینده GPT-6.1 Astra چه خواهد شد؟
در حال حاضر، تصمیم OpenAI به معنای عرضه نشدن GPT-6.1 Astra در برنامه زمانی اعلامشده برای ماه اکتبر است. شواهد ارائهشده در گزارشهای منتشرشده نشان میدهد که ایمنی، همراستایی، کنترل دسترسی و شفافیت عملکرد از مهمترین ملاحظاتی هستند که پیش از عرضه مدلهای عاملمحور جدید باید برآورده شوند.
توقف GPT-6.1 Astra همچنین نشان میدهد که افزایش توانایی مدلهای هوش مصنوعی، بدون کنترل دقیق رفتار آنها در هنگام استفاده از ابزارها و دسترسی به منابع خارجی، میتواند چالشهای تازهای برای امنیت سایبری ایجاد کند. OpenAI نیز بر ضرورت درک دقیق اقدامات مدلها و اطمینان از انجام آنها مطابق با قصد کاربران تأکید کرده است.