مدلهای هوش مصنوعی Claude پس از اتصال غیرمجاز به اینترنت، به سیستمهای ۳ شرکت حمله کردهاند. شرکت آنتروپیک اعلام کرده که در بررسیهای داخلی خود متوجه شده مدل هوش مصنوعی Claude در زمان اجرای تستهای امنیت سایبری به سیستمهای سه سازمان مختلف نفوذ کرده است. این خبر پس از آن منتشر میشود که شرکت OpenAI نیز اخیراً نفوذ یکی از مدلهای منتشرنشده خود به سیستمهای Hugging Face را گزارش کرده بود. طبق پست وبلاگ آنتروپیک، مدل Claude در سه سناریوی مجزا درحالیکه با یک مجموعه ثالث تعامل داشته، توانسته است از محیط آزمایشی به اینترنت متصل شود و دسترسی غیرمجاز به سیستمهای زنده این سازمانها پیدا کند. این شرکت با تشریح یافتههای خود از برنامههای حیاتی برای پیشگیری از تکرار حادثه خبر داد. بررسیهای امنیتی آنتروپیک پس از حادثه اخیر پس از رویداد مربوط به OpenAI، شرکت آنتروپیک تصمیم گرفت ارزیابیهای امنیت سایبری خود را به شکل ویژه بازبینی کند. هدف اصلی آن، یافتن شواهدی از دسترسی احتمالی Claude به اینترنت از داخل محیطهای ارزیابی (سندباکسها) بوده است؛ محیطی که هوش مصنوعی باید در آن بهصورت کاملاً ایزوله فعالیت کند. در میان بیش از ۱۴۱ هزار ارزیابی انجامشده، این آزمایشگاه هوش مصنوعی سه مورد را شناسایی کرده که در آنها مدل به اینترنت وصل شده است. این دسترسیها هنگام همکاری با شرکت Irregular رخ داده و ریشه آن پیکربندی نادرست محیط ارزیابی بوده است. به گفته آنتروپیک، علت اصلی حادثه سوءتفاهمی بر سر متصل بودن اینترنت در زمان آزمایش بوده، اما این شرکت مسئولیت کامل جبران آن را پذیرفته است. به دلیل وجود این اتصال آزاد، مدل به زیرساختهای عملیاتی سه سازمان دسترسی پیدا کرده است. مدلهای درگیر در این حوادث شامل Opus 4.7 ،Mythos 5 و یک مدل پژوهشی و آزمایشی داخلی میشوند. به تمامی مدلها پرامپت واضحی داده شده بوده که هیچ دسترسی به اینترنتی نداشته است، اما آنها سیستمهای واقعی را بخشی از سناریوی برنامهریزیشده برای تمرین فرض کردهاند. تفاوت در واکنش مدلهای Claude پیش از رخنه امنیتی یکی از نکات حائز اهمیت در بررسیهای آنتروپیک، نحوه واکنش متفاوت مدلها پس از مواجهه با نشانههای هدف است. مدل Opus 4.7 در تمام چهار اجرای فرایند، متوجه واقعی بودن سیستم عملیاتی هدف شده است. در دو مورد، این مدل توجیه کرده که این سیستم بخشی از محیط تمرین بوده و به حملات خود از جمله استخراج اعتبارنامهها و دسترسی به دیتابیس ادامه داده است. مدل Mythos 5 نیز متوجه متصل بودن به اینترنت شده، اما با خود استدلال کرده که همچنان در محیط شبیهسازی حضور دارد. این مدل در ادامه، یک پکیج مخرب را روی مخزن عمومی نرمافزار پایتون منتشر کرده که پیش از شناسایی، توسط سیستمهای بیرونی دانلود و اجرا شد. مدل پژوهشی داخلی آنتروپیک که ظاهراً جدیدترین نمونه آن بوده، پس از پی بردن به واقعی بودن هدف، فوراً حملات خود را متوقف کرده است. آنتروپیک اشاره کرده که در ارزیابی، لایههای نظارتی و فیلترهای ایمنی معمول فعال نبودهاند، زیرا تستها برای سنجش تواناییهای پایه طراحی شده بودند. همچنین هیچ نشانهای مبنی بر دنبال کردن «اهداف خودسرانه» توسط مدل مشاهده نشده و Claude تنها در راستای تکمیل دستورهای محوله عمل کرده است. علاوهبراین، آنتروپیک میان حادثه خود و OpenAI تفاوت قائل شده است. مدل OpenAI با سوءاستفاده از یک آسیبپذیری ناشناخته نرمافزاری از محیط تست خارج شده بوده، اما مدلهای آنتروپیک از مسیری که اشتباهاً قابل دسترسی بوده، به اینترنت دست پیدا کردهاند. آنتروپیک همچنین خودش این حادثه را کشف و اطلاعرسانی کرده است. اکنون این شرکت درحال همکاری با گروه ارزیابی مستقل METR است تا جزئیات حادثه به شکل مستقل نیز بازبینی شود.