این تمایز اهمیت دارد، زیرا نشان میدهد که گلوگاه در پژوهش آسیبپذیریها ممکن است هرچه بیشتر بهجای کشف نقصهای جدید، در اعتبارسنجی آنها و هماهنگی برای رفعشان باشد.
تنها حدود 10٪ به مرحله افشا رسیدهاند
Patrick Garrity، پژوهشگر امنیت در VulnCheck، بهتازگی متعلق به Anthropic Vulnerability Disclosure Ledger، که یک رکورد عمومی است که یافتههای مرتبط با Project Glasswing را هنگام عبور از فرایند افشای آسیبپذیری و رفع آن پیگیری میکند. این تحلیل نشان داد که متعلق به Anthropic Claude Mythos در مجموع 26,153 یافته آسیبپذیری را در پروژههای نرمافزاری متعدد از زمان Project Glasswing’s launch در آوریل 2026 تولید کرده است.
مرتبط:Microsoft پس از Patch Tuesday گسترده، اصلاحیههای اضطراری منتشر کرد
با این حال، تنها 2,736 مورد از آن یافتهها، یعنی اندکی بیش از 10٪، وارد دفترکل افشا شدهاند؛ به این معنا که یا به نگهدارنده نرمافزار مربوط گزارش شدهاند یا در فرایند افشا قرار دارند. کمتر از 0.8٪ از نقصها، تنها 202 مورد، در حال حاضر وصله شدهاند و 245 مورد پسگرفته شدهاند. 191 آسیبپذیری دیگر در مرحله پیش از افشا بود و هنوز به نگهدارندگان آنها گزارش نشده بود.
نزدیک به 90% باقیمانده از یافتههایی که توسط Claude Mythos تولید شدهاند، هنوز وارد دفتر ثبت نشده بودند؛ موضوعی که بهگفتهٔ Garrity نشان میدهد اعتبارسنجی و هماهنگی انسانی در تعیین اینکه کدام یافتههای تولیدشده توسط هوش مصنوعی شایستهٔ افشا و اصلاح هستند، به گلوگاه تبدیل شده است.
نتایج “برای کسانی که به درک نحوهٔ کار افشای هماهنگ آسیبپذیری نزدیکترند، شگفتآور نیست”، Garrity به Dark Reading میگوید. اما “بسیار متفاوت از روایتی است که ارائهدهندگان مدلهای پیشرو ترسیم کردهاند”؛ روایتی که عمدتاً بر توانایی هوش مصنوعی در تسریع چشمگیر کشف آسیبپذیری تمرکز داشته است.
“بهنظر میرسد دارند این را از طریق آزمونوخطا میآموزند،” او میگوید.
موارد مثبتِ واقعی و ارزیابی شدت
تحلیل Garrity پرسشهایی را نیز دربارهٔ ادعاهای Anthropic در خصوص دقت یافتههای آسیبپذیری Mythos و توانایی مدل در ارزیابی شدت آنها مطرح کرد. او اشاره کرد که 202 یافته که در دفتر ثبت آسیبپذیریها بهعنوان رفعشده علامت خوردهاند، بهطور محسوسی کمتر از 245 آسیبپذیری هستند که بهعنوان پسگرفتهشده علامت خوردهاند. او نوشت این اعداد بررسی دقیقتری از اینکه Anthropic نرخ مثبتِ واقعی ادعایی 91.4% را چگونه تعریف و اندازهگیری میکند، ایجاب میکند.
بههمینسان، Garrity دریافت که هوش مصنوعی Anthropic بهمراتب تهاجمیتر در ارزیابی شدت آسیبپذیریها نسبت به نگهدارندگان واقعی نرمافزارِ متاثر عمل کرده است. برای نمونه، Claude 91.5% از یافتههایی را که وارد دفتر ثبت شدهاند، بحرانی یا با شدت بالا ارزیابی کرد. اما خود نگهدارندگان پروژه تنها 61.3% را در این ردهٔ شدت قرار دادند.
مرتبط:دولت آمریکا شرکتهای هوش مصنوعی چینی را به تقطیر مدلهای پیشرو متهم میکند
“برداشت من این است که تیم، Claude را با دستورالعملهای دقیق دربارهٔ چگونگی تعیین شدت پرومپت نکرده است، و اگر هم این کار را کردهاند، سنجیده نبوده و در نتیجه به تعیین شدتهای بالاتر انجامیده است،” Garrity میگوید. “مایلم معیارهای CVSS بهکاررفته برای محاسبهٔ شدت و CWEهایی را که برای کمک به درک بهتر ضعفهای واقعی استفاده شدهاند ببینم؛ هر دوی اینها استانداردهای صنعت هستند که هنگام افشای آسیبپذیریها انتظار میرود ارائه شوند.”
نشانههای یک مسئله بزرگتر
پرسشها درباره توانایی هوش مصنوعی برای ارزیابی دقیق یافتههای آسیبپذیری، منحصر به Glasswing نیست. برای نمونه، پژوهش شرکت Contrast Security نشان داد که در نتایج تولیدشده توسط اسکنرهای امنیتی مبتنی بر هوش مصنوعی، تغییرپذیری قابل توجهی وجود دارد. اجرای مکرر همان ابزار روی همان کدبیس، یافتههای بهمراتب متفاوتی تولید کرد، و چند اسکنر تنها بر درصد اندکی از آسیبپذیریها اتفاق نظر داشتند.
جف ویلیامز، بنیانگذار Contrast Security و خالقِ OWASP Top 10، میگوید هنگامی که شرکت او سه اسکنر مختلف مبتنی بر هوش مصنوعی را سه نوبت روی همان کدبیسِ 50,000 خطی اجرا کرد، اسکنرها هر بار نتایج متفاوتی تولید کردند. برای مثال، یک اسکن ساده مبتنی بر Sonnet در سه اجرای یادشده تنها 17% از یافتههای خود را بازتولید کرد، در حالی که Opus 25% را بازتولید کرد اما بین بهترین و بدترین اجرا نزدیک به 30% نوسان در شمار یافتهها داشت.
مرتبط:افزایش آسیبپذیریهای ناشی از هوش مصنوعی شاید از آنچه در ابتدا تصور میشد قابلمدیریتتر باشد
این نابرابری بر یک تغییر احتمالی در اقتصادِ پژوهشِ آسیبپذیری دلالت میکند، بهگفته ویلیامز. هوش مصنوعی میتواند یافتن نقصهای بالقوه را نسبتاً کمهزینه کند، اما تعیین اینکه کدام یافتهها واقعی، قابل اقدام و شایسته اصلاح هستند، ممکن است زمان و منابع بهمراتب بیشتری بطلبد. “سه اسکنر مبتنی بر هوش مصنوعی روی همان کدبیس فقط بر 5% از یافتهها توافق داشتند”، او میگوید. “اسکن یک کدبیس 2 میلیونخطی حدود $315 هزینه API داشت و تریاژ نتایج حدود $128,000 هزینه داشت.”
تحلیل VulnCheck در زمانی ارائه شده است که Project Glasswing و تلاشهای مشابه برای بهکارگیری هوش مصنوعی در کشف آسیبپذیری در سراسر صنعت، شروع به تولید حجم عظیمی از نقصهای تازهشناساییشده کردهاند. این روند در حال ایجاد چالشهای جدید برای تیمهای امنیت و رفع آسیبپذیری است که باید آن نقصها را راستیآزمایی، اولویتبندی و وصله کنند. رکوردشکنِ Patch Tuesday سپتامبر مایکروسافت در همین هفته، که به 974 آسیبپذیری رسیدگی کرد، نمونهای از مقیاسِ چالشی را نشان میدهد که سازمانها همزمان با شتابگرفتن کشف آسیبپذیری بهواسطه هوش مصنوعی با آن روبهرو هستند.
“جهان هنوز امنیت را با سرعت انسان انجام میدهد”، ویلیامز میگوید.
اما بهگفته او، یافتن سریعتر تعداد بیشتری مشکل کمکی نمیکند؛ او به شمار اندک یافتههای Project Glasswing اشاره میکند که واقعاً به دست یک نگهدارنده پروژه رسیدهاند و شمار حتی کمتری که تأیید شده است رفع شدهاند. “و این در شرایطی است که شرکت Anthropic با توان محاسباتی نامحدود و شرکتهای Apple، Google و Microsoft بهعنوان شریک حضور دارند. این همان اتفاقی است که وقتی شیلنگ آتشنشانی را به یک قیف نشانه میروید رخ میدهد.”









