به گزارش پایگاه خبری پایداری ملی به نقل از خبرگزاری ایسنا، تککرانچ نوشت؛ شرکت «اوپنایآی» (OpenAI) جزئیات جدیدی را درباره مدل مورد انتظار «آسترا» (Astra) خود منتشر کرده است که برای انتشار قریبالوقوع آن آماده میشود. به گفته این شرکت، آسترا اولین مدل زبانی بزرگ است که آستانه بحرانی امنیت سایبری آن را برآورده میکند.
در پست وبلاگ اوپنایآی آمده است: ما قصد داریم به زودی آسترا را در دسترس قرار دهیم، اما دسترسی به پیشرفتهترین قابلیتهای امنیت سایبری آن محدودتر خواهد بود.
اوپنایآی خاطرنشان کرد که آسترا قادر به یافتن نقصهای امنیتی ناشناخته در سیستمهای رایانهای و بهرهبرداری از آنها بدون راهنمایی شخص است. این مشابه نگرانیهایی است که شرکت «آنتروپیک» (Anthropic) در اوایل سال جاری درباره مدل «میتوس» (Mythos) خود مطرح کرد و اوپنایآی نیز اقدامات احتیاطی مشابهی را برای عرضه آسترا انجام میدهد.
بدون وجود هیچ تأیید شخص ثالثی، ارزیابی ادعاهای اوپنایآی درباره ایمنی یا آمادگی دشوار است. این شرکت اعلام کرد که پیشنمایش این مدل را با گروهی از آزمایشکنندگان آغاز خواهد کرد، اما نگفت که آنها چه کسانی هستند یا چگونه انتخاب میشوند. مشخص نیست که آیا اوپنایآی با دولت آمریکا برای ارزیابی مدل پیش از انتشار آن همکاری میکند یا خیر.
اوپنایآی خاطرنشان کرد: آسترا در معیار «ExploitBench» که توانایی یک مدل زبانی بزرگ را برای هک کردن آسیبپذیریهای شناختهشده سیستم ارزیابی میکند، امتیاز کاملی به دست آورده است. به گفته این شرکت، آسترا در نسخه اصلاحشدهای از این آزمایش که توسط مهندسان اوپنایآی توسعه داده شده است، دو آسیبپذیری را کشف کرد و مورد بهرهبرداری قرار داد.
اوپنایآی اعلام کرد برای اطمینان از این که مدلهایش نه توسط افراد خرابکار مورد سوءاستفاده قرار میگیرند و نه خود قادر به انجام دادن رفتار بد هستند، بهبود مهار مدل را برای شناسایی سوءاستفادهها و جلوگیری از خطای مدل آغاز کرده است.
با وجود این، اوپنایآی برای آسترا روی روشهای جدید نامشخصی سرمایهگذاری کرده است که برای ایمنتر کردن مدل طراحی شدهاند. همچنین، این شرکت شروع به شناسایی حسابهایی کرده است که بهعنوان حسابهای پرریسک ارزیابی میشوند و پاسخهای مدل به درخواستهای آنها را محدود میکند، اما نحوه انجام دادن این کار را نیز بیان نکرد.
در نهایت، اگرچه این شرکت آسترا را به عنوان همسوترین مدل خود تا به امروز توصیف میکند، اما این مدل را با نظارت زنجیرهای اضافی برای شناسایی و متوقف کردن رفتار بد به کار میگیرد.
آمادهسازیها برای انتشار آسترا در حالی صورت میگیرند که صنعت نسبت به خروج عوامل هوش مصنوعی اوپنایآی از محیط آموزشی و دسترسی به دادههای خصوصی شرکت «هاگینگ فیس» (Hugging Face) واکنش نشان میدهد.
اوپنایآی اعلام کرد برای آسترا آزمایشی طراحی کرده است تا مدل جدید را وسوسه کند که اقدامات عوامل سرکش در حادثه هاگینگ فیس را تکرار کند. به گفته این شرکت، آسترا در این آزمایشها سعی در خروج از محیط آزمایش خود نداشته است.
با وجود همه این جزئیات جدید هنوز هم دشوار است که دقیقاً بدانیم آسترا چه قابلیتهایی دارد یا این که آیا اوپنایآی اقدامات مناسبی را برای تضمین ایمنی انجام میدهد. این شرکت اعلام کرد که انتظار دارد ارزیابیهای بیشتری را از این مدل و اطلاعات ایمنی بیشتری را پس از عرضه عمومی آن منتشر کند.