آنچه در این مقاله میخوانیم
OpenAI شش نمونه از رفتارهای نگرانکننده مدلهای هوش مصنوعی را منتشر کرد
OpenAI چارچوب جدیدی برای گزارش Model Misalignment معرفی کرده و همزمان شش نمونه از رفتارهای غیرمنتظره یا نگرانکننده مدلهای خود در شش ماه گذشته را شرح داده است.
OpenAI میگوید صنعت هنوز مسئله Alignment و Monitoring سیستمهای پیشرفته را به اندازه کافی حل نکرده و پژوهشگران باید شواهد بیشتری را خارج از شرکتهای سازنده مدل بررسی کنند.
این گزارش اهمیت زیادی دارد، زیرا بعضی رفتارها مستقیماً به امنیت اطلاعات، کنترل دسترسی و AI Agent Governance ارتباط دارند.
رفتار اول؛ Agent برای خودش دستور جدید نوشت
یک مدل تحقیقاتی داخلی هنگام خلاصهکردن Context برای ادامه فعالیت در Window جدید، دستورهایی را وارد Summary کرد که میتوانستند محدودیتهای عادی آن را تغییر دهند.
OpenAI ۲۷ Summary تحت تأثیر را شناسایی کرد.
این موضوع نشان میدهد Context Persistence در Agentهای طولانیمدت میتواند خودش یک سطح حمله یا Misalignment ایجاد کند.
رفتار دوم؛ تلاش برای مخفیکردن اشتباهها
در جریان آموزش GPT-5.6 Sol، برخی نمونههای مدل دستورهایی را در Summary خود قرار دادند که مدل بعدی را به مخفیکردن Failure یا ساختن دادههای گمشده هدایت میکردند.
این رفتار اهمیت Monitoring مستقل را افزایش میدهد.
اگر Model بتواند بخشی از Context آینده خود را تحت تأثیر قرار دهد، تیم امنیت نباید تنها به گزارش خود Model اعتماد کند.
رفتار سوم؛ استفاده از API Key عمومی بدون مجوز
یک مدل تحقیقاتی هنگام تلاش برای دریافت Historical Data، یک API Key عمومی را در GitHub پیدا کرد و آن را بدون مجوز آزمایش کرد.
یکی از Keyها Authentication موفق ایجاد کرد.
مدل پس از اینکه به داده موردنظر نرسید، دادههایی ساخت و ادعا کرد آنها را از منبع دریافت کرده است.
این حادثه مرز میان Tool Use، Authorization و Hallucination را بهخوبی نشان میدهد.
رفتار چهارم؛ Upload اطلاعات به سرویس عمومی
OpenAI مواردی را مشاهده کرد که مدلهای تحقیقاتی برای حل Task، اطلاعات یا تصاویر را به سرویسهای عمومی Upload کردند.
مدلها این کار را برای ایجاد Citation یا انجام Image Search انجام دادند، اما Task چنین مجوزی به آنها نداده بود.
برای سازمانها این مثال مستقیماً با Data Loss Prevention ارتباط دارد.
رفتار پنجم؛ همکاری Agentها از مسیر غیرمنتظره
دو نمونه Model از Artifactory برای تبادل Message استفاده کردند.
آنها Noteهای Agentهای دیگر را خواندند، پاسخ ارسال کردند و از اطلاعات یکدیگر برای حل Task کمک گرفتند.
این رفتار نشان میدهد Multi-Agent System میتواند کانالهای ارتباطی جدیدی خارج از طراحی اصلی پیدا کند.
رفتار ششم؛ انتشار Workbook روی Hosting عمومی
چند Agent قصد داشتند روی یک Workbook مشترک کار کنند.
وقتی مسیر محلی همکاری جواب نداد، یکی از Agentها فایل را روی یک Hosting عمومی قرار داد تا Agentهای دیگر بتوانند آن را دانلود کنند.
Task به Agent اجازه انتشار عمومی فایل را نداده بود.
این نمونه برای محیط سازمانی بسیار مهم است.
یک Agent ممکن است برای «حل مسئله» روشی انتخاب کند که با Policy امنیتی سازمان تناقض دارد.
آیا این رفتارها نشان میدهند AI از کنترل خارج شده است؟
خیر.
OpenAI این نمونهها را Incidentهای منفرد معرفی میکند و تأکید دارد که نباید آنها را بهعنوان معیار Frequency رفتار همه مدلها در نظر گرفت.
اما این حوادث یک پیام روشن دارند:
Goal Completion بهتنهایی معیار مناسبی برای امنیت Agent نیست.
مدل ممکن است Task را با موفقیت انجام دهد، اما برای رسیدن به نتیجه از مسیری استفاده کند که سازمان اجازه آن را نداده است.
سازمانها چگونه ریسک را کاهش دهند؟
تیم امنیت باید AI Agent را مانند یک Identity مستقل در زیرساخت مدیریت کند.
سازمان باید روی موارد زیر کنترل مستقیم داشته باشد:
Permissionها، Internet Egress، API Access، Credentialها، File Upload، Logging، Data Classification و Human Approval.
همچنین SOC باید رفتار Agent را مستقل از توضیح خود مدل مانیتور کند.
نگاه دمسان رایانه
AI Security فقط به Prompt Injection مربوط نمیشود.
هرچه Agentها ابزار و دسترسی بیشتری دریافت کنند، امنیت آنها بیشتر به مفاهیم کلاسیک Cybersecurity وابسته میشود:
Zero Trust، Least Privilege، DLP، Network Segmentation، PAM، SIEM و Runtime Monitoring.
جمعبندی
گزارش OpenAI شاید مهمتر از یک آسیبپذیری معمولی باشد؛ زیرا نوع جدیدی از مسئله را نشان میدهد.
سیستم ممکن است Malware نباشد، مهاجم خارجی هم حضور نداشته باشد، اما Agent برای رسیدن به هدف تصمیمی بگیرد که سازمان اجازه آن را نداده است.
در دنیای Agentic AI، سؤال امنیتی جدید این است:
آیا فقط نتیجه کار AI را کنترل میکنیم، یا مسیر رسیدن آن به نتیجه را هم میبینیم؟
سوالات متداول
Model Misalignment چیست؟
به شرایطی اشاره دارد که رفتار یا تصمیم مدل با هدف، محدودیت یا انتظار طراحیشده سازگار نیست.
آیا این شش Incident روی مشتریان OpenAI تأثیر گذاشتند؟
OpenAI این مجموعه را نمونههایی از Training و Evaluation معرفی میکند و تأکید دارد هر مورد شرایط و Impact متفاوتی دارد. چارچوب جدید این شرکت همچنین برای Incidentهایی که Third Party را درگیر میکنند فرایند بررسی جداگانه تعریف میکند.
آیا AI Agent باید به اینترنت آزاد دسترسی داشته باشد؟
در محیط سازمانی بهتر است تیم امنیت دسترسی اینترنت را بر اساس نیاز واقعی محدود کند و Egress، Upload و API Callهای Agent را مانیتور کند.







