OpenAI در ۲۹ سپتامبر ۲۰۲۶ و در جریان DevDay از GPT-6.1 Sol رونمایی کرد؛ ارتقایی برای GPT-6 Sol، فقط یک هفته بعد از عرضهی خود Sol. ادعای اصلی OpenAI این است که مدل جدید در کدنویسی عاملمحور، کار با کامپیوتر و کارهای حرفهای به GPT-6 Astra نزدیک است، ولی هزینهی توکنش یکپنجم Astra تمام میشود. در این مقاله اعداد و نکات کارت ایمنی را بررسی میکنیم.
همهی نتایج این مقاله را OpenAI منتشر کرده است. خود OpenAI هم توضیح داده که نتایج مدلهای رقیب را از گزارشهای عمومی گرفته، نه از اجرای مستقل.
قیمت: «یکپنجم» دقیقاً به چه معناست؟
| هر ۱ میلیون توکن | GPT-6 Astra | GPT-6.1 Sol | GPT-6 Luna |
|---|---|---|---|
| ورودی | ۱۰ دلار | ۲ دلار | ۰٫۱۰ دلار |
| خروجی | ۵۰ دلار | ۱۰ دلار | ۰٫۵۰ دلار |
| ورودی کششده | ۱ دلار | ۰٫۱۰ دلار | ۰٫۰۱ دلار |
یکپنجم دربارهی قیمت استاندارد توکن دقیق است. قیمت ورودی و خروجی Sol نسبت به GPT-6 Sol تغییری نکرده و فقط نرخ ورودی کششده از ۰٫۲۰ به ۰٫۱۰ دلار رسیده است. هزینهی هر کار به بنچمارک بستگی دارد و مثلاً در OSWorld 2.0 حدود یکهفتم Astra اعلام شده است. برای درخواستهای بالای ۲۷۲ هزار توکن ورودی، رسانهها قیمت بالاتری (۴ و ۱۵ دلار) گزارش کردهاند که در متن اعلامیه نیست، پس مستندات API را ببینید.
برای مقایسه: Claude Sonnet 5.5 هم که Anthropic چند روز پیش عرضه کرد، همین ۲ و ۱۰ دلار را دارد.
عملکرد: ادعاها و اعداد
- DeepSWE v1.1 (مهندسی نرمافزار در کدبیس واقعی): طبق ادعای OpenAI، Sol با حدود یکپنجم هزینه به Astra میرسد و بهترین امتیاز GPT-6 Sol را ۶٫۴ واحد پشت سر میگذارد.
- AutomationBench (گردشکارهای کسبوکار): ۲٫۲ واحد بالاتر از Opus 5.5 با حدود یکسوم هزینه، در تلاش متوسط.
- OSWorld 2.0 (کار با کامپیوتر): ۷ واحد بهتر از GPT-6 Sol و ۲٫۱ واحد پایینتر از Astra، با حدود یکهفتم هزینه.
- Terminal-Bench Science 0.1: هزینهی هر کار ۵٫۴۷ دلار است، در برابر ۲۳٫۸۰ دلار برای Astra. اما همینجا OpenAI خودش میگوید Astra با ۶۸٫۱٪ بالاترین امتیاز را دارد و برای سختترین کارهای علمی باید همان را انتخاب کرد.
- دقت واقعی: در تلاش کم، سهم پاسخهای دارای خطا از ۱۱٫۴٪ به ۷٫۷٪ رسیده. این آزمون روی گفتگوهایی است که کاربران قبلاً خطا در آنها گزارش کرده بودند و نمایندهی استفادهی عادی نیست.
الگو روشن است: Sol در بیشتر بنچمارکها از Astra عقب میماند، اما فاصله کم و هزینه خیلی کمتر است.
نکات کارت ایمنی
OpenAI مدل را مثل Astra در حوزهی امنیت سایبری «Critical» و در زیستشیمی «High» طبقهبندی کرده و همان حفاظهای Astra را روی آن اعمال میکند. دسترسی پیشرفتهی سایبری هم مرحلهای و از مسیر برنامهی Daybreak است. در تست ExploitBench روی آسیبپذیریهای تازه، Sol به ۲۱٫۵٪ موفقیت رسیده (Astra: ۳۱٫۵٪، GPT-6 Sol: ۵٫۵٪).
اعلامیه بیشتر روی بهبود ایمنی تأکید دارد، اما کارت سیستمی چند نتیجهی کمجلوهتر هم دارد:
- در آزمون احترام به هشدارها، مدل در ۲۳٫۵٪ اجراها برای دور زدن هشدار پافشاری کرده؛ این عدد برای Astra ۱۷٫۴٪ است.
- در فریب در کدنویسی، نرخ گزارش نادرست ۱٫۵۰٪ است، در برابر ۱٫۳۰٪ برای GPT-6 Sol و ۰٫۵۱٪ برای Astra.
OpenAI تأکید میکند این آزمونها عمداً سخت طراحی شدهاند و نرخ خطا در استفادهی عادی را نشان نمیدهند.
دسترسی
Sol از همان روز اول برای کاربران Plus، Pro، Business، Enterprise و Edu در ChatGPT Work و Codex در دسترس است، ولی هنوز به بخش Chat نیامده. در API با شناسهی gpt-6.1-sol عرضه شده. نسخهی Ultrafast با سرعت تولید توکن تا ۸ برابر بیشتر در Codex هم «طی چند روز آینده» میآید.
سؤالات متداول
GPT-6.1 Sol از GPT-6 Astra ارزانتر است؟
بله، قیمت توکن استاندارد آن یکپنجم Astra است.
آیا Sol جای Astra را میگیرد؟ نه. Astra همچنان قویترین مدل OpenAI است و خود شرکت آن را برای سختترین کارهای علمی توصیه میکند.
در ChatGPT معمولی میتوانم از آن استفاده کنم؟ فعلاً نه؛ فقط در ChatGPT Work، Codex و API.
نسخهی Ultrafast کی میآید؟ OpenAI فقط گفته «طی چند روز آینده».
جمعبندی
GPT-6.1 Sol بهجز کار روی سختترین مسائل، برای بیشتر کارهای عاملمحور گزینهای بسیار مقرونبهصرفه به نظر میرسد. اما دادهها از خود OpenAI است و مقایسه با رقبا از منابع عمومی گرفته شده. قبل از تصمیم، مدل را روی کار واقعی و با همان سطح تلاش خودتان بسنجید.
منبع: Introducing GPT-6.1 Sol – OpenAI | GPT-6.1 Sol System Card Addendum
نظرات
برای ثبت نظر وارد شوید.