
GLM-5.3؛ مدل جدید Z.ai در برابر رقبا چه حرفی برای گفتن دارد؟
یکشنبه ۱ شهریور ۱۴۰۵ – ۲۱:۳۰
GLM-5.3 بدون تغییر در معماری، با تمرکز بر Post-training جهش بزرگی در زمینه کدنویسی و امنیت سایبری داشته است؛ اما آیا واقعاً میتواند رقبای قدرتمندش را شکست دهد؟
هر از چندگاهی یک مدل هوش مصنوعی جدید معرفی میشود که در نگاه اول بهنظر میرسد تنها یک بهروزرسانی معمولی باشد، اما در عمل میتواند تصویر رقابت را بهکلی تغییر دهد. GLM-5.3 از این دست مدلهاست؛ نه به این دلیل که مدل پایهای بزرگتر یا معماری جدیدی دارد، بلکه بهخاطر این که Z.ai توانسته با تمرکز بر Post-training، در چند بنچمارک کلیدی کدنویسی و اتوماسیون جهشهای قابل توجهی را ثبت کند.
فهرست مطالب
- GLM-5.3 چیست؟
- GLM-5.3 در کدام بخش واقعاً تغییر کرده است؟
- GLM-5.3 در برابر رقبای خود
- قیمت GLM-5.3
- بازخورد اولیه کاربران از GLM-5.3
- GLM-5.3 برای چه کسی مناسب است؟
در این مقاله، GLM-5.3 را از منظر مشخصات، بنچمارکهای رسمی Z.ai، اولین ارزیابی مستقل و بازخورد کاربران بررسی میکنیم و نقاط قوت و ضعف این مدل را مورد بررسی قرار میدهیم.
GLM-5.3 چیست؟
تمام جهشهای عملکردی GLM-5.3 از مقیاسدهی و بهبود فرایند Post-training ناشی میشود. Z.ai، آزمایشگاه چینی جداشده از دانشگاه تسینگهوا که پیشتر با نام Zhipu AI شناخته میشد، در ۱۴ آگوست ۲۰۲۶ از GLM-5.3 رونمایی کرد. نکتهی مهم این عرضه، مسیر متفاوت آن است: مدل جدید همان مدل پایهی ۷۴۳ میلیارد پارامتری GLM-5.2 را حفظ کرده و هیچ تغییری در معماری یا اندازهی آن داده نشده است.
به گفتهی Z.ai، تمام جهشهای عملکردی از مقیاسدهی و بهبود فرایند پسآموزش (Post-training) ناشی میشود؛ یعنی مدل روی محیطهای اجرایی و وظایف واقعیتر مهندسی نرمافزار، از تشخیص گلوگاه در زیرساخت یادگیری ماشین گرفته تا تغییر کد، اجرای تست و تحویل نتیجه نهایی آموزش دیده است.
تمرکز GLM-5.3
تمرکز اصلی GLM-5.3 روی سه حوزهی کدنویسی طولانیمدت در محیط ترمینال، کار عاملمحور روی پروژههای چندفایلی و تحلیل امنیتی است. این ترکیب باعث شده Z.ai آن را با شعار «Built to Code. Ready for Cyber Defense» معرفی کند.
امنیت سایبری؛ قابلیت غافلگیرکننده GLM-5.3
Z.ai بخش قابلتوجهی از Post-training مدل را به دادهها و محیطهای مرتبط با کشف آسیبپذیری اختصاص داده است. به گفتهی شرکت، هدف اولیه فقط بهتر شدن در پیدا کردن باگهای منفرد بود، اما در عمل مدل توانایی بیشتری برای دنبالکردن زنجیرهی چندمرحلهای بهرهبرداری از آسیبپذیریها نشان داد؛ نتیجهای که Z.ai میگوید از قبل برنامهریزیشده نبود.
GLM-5.3 به ۲٬۴۳۶ آسیبپذیری در ۲۶۹ پروژهی متنباز دست یافته است.
Z.ai همچنین اعلام کرده که در آزمایش روی ۲۶۹ پروژهی متنباز، GLM-5.3 به ۲٬۴۳۶ آسیبپذیری رسیده که ۱٬۰۹۷ مورد از آنها در دستهی شدت متوسط تا بالا قرار داشتهاند؛ از جمله در نرمافزارهایی مثل هستههای سیستمعامل، موتورهای مرورگر و زیرساختهای متنباز. این آسیبپذیریها بهطور میانگین ۲۶٫۶ سال در کدها باقی مانده بودند و قدیمیترین مورد به سال ۱۹۸۱ برمیگردد.
وزنهای GLM-5.3 چه زمانی در دسترس قرار میگیرند؟
برخلاف نسلهای قبلی GLM که با مجوز MIT و بهصورت کاملاً باز عرضه شده بودند، وزنهای GLM-5.3 در زمان رونمایی منتشر نشدند. Z.ai دلیل این تأخیر را نیاز به تکمیل ارزیابیهای ایمنی، بهویژه با توجه به قابلیتهای امنیت سایبری مدل، اعلام کرده و گفته انتشار عمومی وزنها حدود دو هفته پس از رونمایی، یعنی حوالی پایان آگوست ۲۰۲۶، در نظر گرفته شده است.
تا زمان نگارش این مقاله، این وزنها هنوز منتشر نشدهاند و توصیف GLM-5.3 بهعنوان یک مدل «کاملاً باز» باید فعلاً زمان آینده در نظر گرفته شود، نه وضعیت فعلی. در حال حاضر، تنها راه استفاده از این مدل، API رسمی Z.ai و طرح Coding Plan است.
مشخصات فنی GLM-5.3 چیست؟
GLM-5.3 در حال حاضر مدلی کاملاً متنی است و ورودی تصویری بومی ندارد. پنجرهی کانتکست آن یک میلیون توکن است و حداکثر طول خروجی به ۱۲۸ هزار توکن میرسد. یکی از تغییرات مهم نسبت به نسل قبل این است که در GLM-5.3 استدلال (reasoning) همیشه فعال است و دیگر امکان غیرفعالکردن کامل آن وجود ندارد.
کاربر فقط میتواند شدت استدلال را در سه سطح low، high و max تنظیم کند که max بهصورت پیشفرض انتخاب شده است. توسعهدهندگانی که پیشتر درخواستهایشان را با غیرفعالکردن reasoning میفرستادند، هنگام مهاجرت باید این تنظیم را به سطح low تغییر دهند، وگرنه درخواست رد میشود.
GLM-5.3 در کدام بخش واقعاً تغییر کرده است؟
بخش اصلی ادعای Z.ai مربوط به وظایف طولانی و عاملمحور است. جدول زیر نتایج رسمی منتشرشده توسط خود شرکت را در برابر GLM-5.2 نشان میدهد.
| بنچمارک | چه چیزی را میسنجد | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 3.0 | کدنویسی عاملمحور در محیط ترمینال | ۲۸٫۳٪ | ۴٫۶٪ |
| DeepSWE v1.1 | حل وظایف بلندمدت مهندسی نرمافزار | ۶۶٫۹٪ | ۴۶٫۲٪ |
| AutomationBench v1.0.6 | اجرای گردشکارهای سازمانی چندمرحلهای | ۴۸٫۲٪ | ۲۶٫۲٪ |
| Agents’ Last Exam (pass@1) | وظایف دشوار چندمرحلهای عامل هوش مصنوعی | ۲۸٫۵٪ | ۲۳٫۸٪ |
| Z.ai Code Bench (سطح Max، نرخ تکمیل) | عملکرد در محیطهای توسعهی محلی واقعی | ۳۴٫۵٪ (~۷۵ هزار توکن خروجی) | ۲۳٫۴٪ (~۹۶ هزار توکن خروجی) |
| GDPval-AA v2 (امتیاز Elo، ارزیابی مستقل Artificial Analysis) | انجام کارهای دانشی و حرفهای | ۱۷۶۹ | ۱۵۰۸ |
نکتهی جالب در همین جدول این است که Z.ai فقط از افزایش دقت صحبت نمیکند؛ در بنچمارک داخلی Z.ai Code Bench، مدل جدید در سطح Max با مصرف توکن کمتر (حدود ۷۵ هزار در برابر ۹۶ هزار توکن) به نتیجهی بهتری رسیده است. با این حال، همانطور که در بخش بعد میبینیم، ارزیابی مستقل Artificial Analysis روایت دیگری از کارایی توکنی GLM-5.3 ارائه میدهد.
GLM-5.3 در برابر رقبا
تصویر واقعی پیچیدهتر از تیترهایی مثل قویترین مدل کدنویسی جهان است. در جدول منتشرشده توسط Z.ai، این مدل جدید در بعضی ارزیابیها از مدلهای بستهی رقیب عقب میماند.
| بنچمارک (چه چیزی را میسنجد) | GLM-5.3 | GPT-5.6 Sol | Claude Fable 5 | Claude Mythos 5 |
|---|---|---|---|---|
| Terminal-Bench 3.0 (کدنویسی عاملمحور در محیط ترمینال) | ۲۸٫۳٪ | ۳۴٫۶٪ | ۳۳٫۷٪ | — |
| DeepSWE v1.1 (حل وظایف بلندمدت مهندسی نرمافزار) | ۶۶٫۹٪ | ۷۲٫۷٪ | ۶۹٫۷٪ | — |
| Z.ai Code Bench، سطح Max (نرخ تکمیل وظیفه در محیط توسعهی محلی واقعی) | ۳۴٫۵٪ | — | ۳۹٫۵٪ | — |
| Z.ai Code Bench، سطح High | ۳۱٫۴٪ | — | — | (Claude Opus 4.8: ۲۹٫۵٪) |
| CyberGym (پیداکردن و اثبات آسیبپذیری امنیتی در کد) | ۸۴٫۵٪ | ۸۳٫۶٪ | — | ۸۳٫۸٪ |
| ExploitBench (نوشتن یک اکسپلویت کاربردی از آسیبپذیری پیداشده) | ۵۴٫۴٪ | ۷۶٫۵٪ | — | ۷۸٫۰٪ |
| ExploitGym، بودجهی ششساعته (تعداد این کدهای اکسپلویت کاملشده در زمان محدود) | ۱۳۰ وظیفه | — | — | ۲۴۷ وظیفه |
الگوی این جدول واضح است: هرچه یک آزمون در زنجیرهی «کشف آسیبپذیری تا ساخت اکسپلویت کامل» عمیقتر میشود، فاصلهی GLM-5.3 با مدلهای بستهی رقیب بیشتر میشود.
در CyberGym که کشف و اعتبارسنجی آسیبپذیری از روی کد منبع را میسنجد، GLM-5.3 بالاترین امتیاز را دارد؛ اما در ExploitBench و ExploitGym که ساخت اکسپلویت واقعی را ارزیابی میکنند، هم Claude Mythos 5 و هم GPT-5.6 Sol فاصلهی معناداری با آن دارند. Z.ai این الگو را طبیعی میداند و میگوید تمرکز GLM-5.3 روی دفاع سایبری است، نه تولید اکسپلویت.
در مقابل، در AutomationBench که اجرای گردشکارهای سازمانی چندمرحلهای را میسنجد، GLM-5.3 با ۴۸٫۲ درصد از مدلهای ذکرشده در جدول Z.ai جلوتر است. این نشان میدهد که عملکرد عامل هوش مصنوعی یک معیار واحد نیست و بسته به نوع تسک، رتبهبندی مدلها میتواند کاملاً تغییر کند.
ارزیابیهای مستقل در مورد GLM-5.3 چه میگویند؟
مهمترین دادهی مستقلی که پس از عرضهی GLM-5.3 منتشر شده، از Artificial Analysis است؛ مجموعهای که مدلها را با شاخص ترکیبی Intelligence Index و ارزیابیهای خودش مقایسه میکند، نه با اعداد سازنده. طبق این ارزیابی، GLM-5.3 در حالت max امتیاز ۶۰ گرفته که هفت واحد بالاتر از GLM-5.2 است و آن را همتراز با Kimi K3، در جایگاه مدل باز رتبهبالای فعلی، قرار میدهد. مدلهای بستهی ردهبالا مانند Claude Opus 5 همچنان امتیاز بالاتری دارند.
نتایج جالبتر Artificial Analysis دربارهی هزینه و کارایی توکنی است. برخلاف ادعای Z.ai مبنی بر کارآمدتر شدن مصرف توکن، این ارزیابی مستقل نشان میدهد GLM-5.3 با وجود قیمت پایینتر، پرحرفتر شده است. مدل برای هر وظیفه بهطور میانگین حدود ۱۸٬۷۰۰ توکن خروجی تولید میکند، در برابر حدود ۱۵٬۷۰۰ توکن برای GLM-5.2 و حدود ۱۴٬۷۰۰ توکن برای Kimi K3. با این حال، چون قیمت هر توکن GLM-5.3 پایین است، هزینهی هر وظیفه (حدود ۰٫۶۸ دلار) هنوز کمتر از Kimi K3 (حدود ۰٫۸۴ دلار) و GPT-5.6 Sol (حدود ۱٫۲۳ دلار) است، هرچند نسبت به هزینهی حدود ۰٫۳۳ دلاری GLM-5.2 گرانتر شده است.
نکتهای که بیشتر پوشش رسانهای گرفته، جهش GLM-5.3 در GDPval-AA v2 است؛ ارزیابی مستقل Artificial Analysis برای کارهای دانشی و حرفهای واقعی. امتیاز مدل از ۱۵۲۴ به ۱۷۷۰ رسیده، یعنی تنها پشت سر Claude Opus 5 با ۱۸۵۵ قرار میگیرد و از Kimi K3 با ۱۶۶۸ هم بیش از صد واحد جلوتر است. این یکی از معدود شواهد مستقلی است که نشان میدهد جهش GLM-5.3 صرفاً یک ادعای بازاریابی نیست.
ارزیابی KingBench 3 را چقدر جدی بگیریم؟
عددی که بیشترین بازتاب را در ویدیوها و شبکههای اجتماعی داشته، امتیاز ۷۳ از ۸۰ (۹۱٫۲۵ درصد) در KingBench 3 است.
سوالات متداول
GLM-5.3 چه ویژگیهایی دارد؟
GLM-5.3 یک مدل کاملاً متنی با ورودی تصویری بومی نیست و پنجرهی کانتکست آن یک میلیون توکن است.
چرا وزنهای GLM-5.3 منتشر نشدهاند؟
وزنهای GLM-5.3 به دلیل نیاز به تکمیل ارزیابیهای ایمنی، بهویژه در زمینه قابلیتهای امنیت سایبری، منتشر نشدهاند.
GLM-5.3 برای چه کاربردهایی مناسب است؟
این مدل برای کدنویسی طولانیمدت، کارهای عاملمحور و تحلیل امنیتی طراحی شده است.
چگونه میتوان از GLM-5.3 استفاده کرد؟
در حال حاضر، تنها راه استفاده از GLM-5.3 از طریق API رسمی Z.ai و طرح Coding Plan است.
GLM-5.3 در مقایسه با رقبای خود چه عملکردی دارد؟
GLM-5.3 در برخی بنچمارکها از رقبای خود عقب میماند، اما در زمینه کشف آسیبپذیریها عملکرد خوبی دارد.



