جارچی؛ موتور جستجوی هوشمند برای کشف، جستجو و مقایسه کالاها در بازار آنلاین ایران.

مشاهده جارچی
آموزش هوش مصنوعیوب گردی

GLM: تحولی جدید در صنعت خودرو سازی

GLM-5.3؛ مدل جدید Z.ai در برابر رقبا چه حرفی برای گفتن دارد؟

یک‌شنبه ۱ شهریور ۱۴۰۵ – ۲۱:۳۰

GLM-5.3 بدون تغییر در معماری، با تمرکز بر Post-training جهش بزرگی در زمینه کدنویسی و امنیت سایبری داشته است؛ اما آیا واقعاً می‌تواند رقبای قدرتمندش را شکست دهد؟

هر از چندگاهی یک مدل هوش مصنوعی جدید معرفی می‌شود که در نگاه اول به‌نظر می‌رسد تنها یک به‌روزرسانی معمولی باشد، اما در عمل می‌تواند تصویر رقابت را به‌کلی تغییر دهد. GLM-5.3 از این دست مدل‌هاست؛ نه به این دلیل که مدل پایه‌ای بزرگ‌تر یا معماری جدیدی دارد، بلکه به‌خاطر این که Z.ai توانسته با تمرکز بر Post-training، در چند بنچمارک کلیدی کدنویسی و اتوماسیون جهش‌های قابل توجهی را ثبت کند.

فهرست مطالب

  • GLM-5.3 چیست؟
  • GLM-5.3 در کدام بخش واقعاً تغییر کرده است؟
  • GLM-5.3 در برابر رقبای خود
  • قیمت GLM-5.3
  • بازخورد اولیه کاربران از GLM-5.3
  • GLM-5.3 برای چه کسی مناسب است؟

در این مقاله، GLM-5.3 را از منظر مشخصات، بنچمارک‌های رسمی Z.ai، اولین ارزیابی مستقل و بازخورد کاربران بررسی می‌کنیم و نقاط قوت و ضعف این مدل را مورد بررسی قرار می‌دهیم.

GLM-5.3 چیست؟

تمام جهش‌های عملکردی GLM-5.3 از مقیاس‌دهی و بهبود فرایند Post-training ناشی می‌شود. Z.ai، آزمایشگاه چینی جداشده از دانشگاه تسینگهوا که پیش‌تر با نام Zhipu AI شناخته می‌شد، در ۱۴ آگوست ۲۰۲۶ از GLM-5.3 رونمایی کرد. نکته‌ی مهم این عرضه، مسیر متفاوت آن است: مدل جدید همان مدل پایه‌ی ۷۴۳ میلیارد پارامتری GLM-5.2 را حفظ کرده و هیچ تغییری در معماری یا اندازه‌ی آن داده نشده است.

به گفته‌ی Z.ai، تمام جهش‌های عملکردی از مقیاس‌دهی و بهبود فرایند پس‌آموزش (Post-training) ناشی می‌شود؛ یعنی مدل روی محیط‌های اجرایی و وظایف واقعی‌تر مهندسی نرم‌افزار، از تشخیص گلوگاه در زیرساخت یادگیری ماشین گرفته تا تغییر کد، اجرای تست و تحویل نتیجه نهایی آموزش دیده است.

تمرکز GLM-5.3

تمرکز اصلی GLM-5.3 روی سه حوزه‌ی کدنویسی طولانی‌مدت در محیط ترمینال، کار عامل‌محور روی پروژه‌های چندفایلی و تحلیل امنیتی است. این ترکیب باعث شده Z.ai آن را با شعار «Built to Code. Ready for Cyber Defense» معرفی کند.

امنیت سایبری؛ قابلیت غافلگیرکننده GLM-5.3

Z.ai بخش قابل‌توجهی از Post-training مدل را به داده‌ها و محیط‌های مرتبط با کشف آسیب‌پذیری اختصاص داده است. به گفته‌ی شرکت، هدف اولیه فقط بهتر شدن در پیدا کردن باگ‌های منفرد بود، اما در عمل مدل توانایی بیشتری برای دنبال‌کردن زنجیره‌ی چندمرحله‌ای بهره‌برداری از آسیب‌پذیری‌ها نشان داد؛ نتیجه‌ای که Z.ai می‌گوید از قبل برنامه‌ریزی‌شده نبود.

GLM-5.3 به ۲٬۴۳۶ آسیب‌پذیری در ۲۶۹ پروژه‌ی متن‌باز دست یافته است.

Z.ai همچنین اعلام کرده که در آزمایش روی ۲۶۹ پروژه‌ی متن‌باز، GLM-5.3 به ۲٬۴۳۶ آسیب‌پذیری رسیده که ۱٬۰۹۷ مورد از آن‌ها در دسته‌ی شدت متوسط تا بالا قرار داشته‌اند؛ از جمله در نرم‌افزارهایی مثل هسته‌های سیستم‌عامل، موتورهای مرورگر و زیرساخت‌های متن‌باز. این آسیب‌پذیری‌ها به‌طور میانگین ۲۶٫۶ سال در کدها باقی مانده بودند و قدیمی‌ترین مورد به سال ۱۹۸۱ برمی‌گردد.

وزن‌های GLM-5.3 چه زمانی در دسترس قرار می‌گیرند؟

برخلاف نسل‌های قبلی GLM که با مجوز MIT و به‌صورت کاملاً باز عرضه شده بودند، وزن‌های GLM-5.3 در زمان رونمایی منتشر نشدند. Z.ai دلیل این تأخیر را نیاز به تکمیل ارزیابی‌های ایمنی، به‌ویژه با توجه به قابلیت‌های امنیت سایبری مدل، اعلام کرده و گفته انتشار عمومی وزن‌ها حدود دو هفته پس از رونمایی، یعنی حوالی پایان آگوست ۲۰۲۶، در نظر گرفته شده است.

تا زمان نگارش این مقاله، این وزن‌ها هنوز منتشر نشده‌اند و توصیف GLM-5.3 به‌عنوان یک مدل «کاملاً باز» باید فعلاً زمان آینده در نظر گرفته شود، نه وضعیت فعلی. در حال حاضر، تنها راه استفاده از این مدل، API رسمی Z.ai و طرح Coding Plan است.

مشخصات فنی GLM-5.3 چیست؟

GLM-5.3 در حال حاضر مدلی کاملاً متنی است و ورودی تصویری بومی ندارد. پنجره‌ی کانتکست آن یک میلیون توکن است و حداکثر طول خروجی به ۱۲۸ هزار توکن می‌رسد. یکی از تغییرات مهم نسبت به نسل قبل این است که در GLM-5.3 استدلال (reasoning) همیشه فعال است و دیگر امکان غیرفعال‌کردن کامل آن وجود ندارد.

کاربر فقط می‌تواند شدت استدلال را در سه سطح low، high و max تنظیم کند که max به‌صورت پیش‌فرض انتخاب شده است. توسعه‌دهندگانی که پیش‌تر درخواست‌هایشان را با غیرفعال‌کردن reasoning می‌فرستادند، هنگام مهاجرت باید این تنظیم را به سطح low تغییر دهند، وگرنه درخواست رد می‌شود.

GLM-5.3 در کدام بخش واقعاً تغییر کرده است؟

بخش اصلی ادعای Z.ai مربوط به وظایف طولانی و عامل‌محور است. جدول زیر نتایج رسمی منتشرشده توسط خود شرکت را در برابر GLM-5.2 نشان می‌دهد.

بنچمارک چه چیزی را می‌سنجد GLM-5.3 GLM-5.2
Terminal-Bench 3.0 کدنویسی عامل‌محور در محیط ترمینال ۲۸٫۳٪ ۴٫۶٪
DeepSWE v1.1 حل وظایف بلندمدت مهندسی نرم‌افزار ۶۶٫۹٪ ۴۶٫۲٪
AutomationBench v1.0.6 اجرای گردش‌کارهای سازمانی چندمرحله‌ای ۴۸٫۲٪ ۲۶٫۲٪
Agents’ Last Exam (pass@1) وظایف دشوار چندمرحله‌ای عامل هوش مصنوعی ۲۸٫۵٪ ۲۳٫۸٪
Z.ai Code Bench (سطح Max، نرخ تکمیل) عملکرد در محیط‌های توسعه‌ی محلی واقعی ۳۴٫۵٪ (~۷۵ هزار توکن خروجی) ۲۳٫۴٪ (~۹۶ هزار توکن خروجی)
GDPval-AA v2 (امتیاز Elo، ارزیابی مستقل Artificial Analysis) انجام کارهای دانشی و حرفه‌ای ۱۷۶۹ ۱۵۰۸

نکته‌ی جالب در همین جدول این است که Z.ai فقط از افزایش دقت صحبت نمی‌کند؛ در بنچمارک داخلی Z.ai Code Bench، مدل جدید در سطح Max با مصرف توکن کمتر (حدود ۷۵ هزار در برابر ۹۶ هزار توکن) به نتیجه‌ی بهتری رسیده است. با این حال، همان‌طور که در بخش بعد می‌بینیم، ارزیابی مستقل Artificial Analysis روایت دیگری از کارایی توکنی GLM-5.3 ارائه می‌دهد.

GLM-5.3 در برابر رقبا

تصویر واقعی پیچیده‌تر از تیترهایی مثل قوی‌ترین مدل کدنویسی جهان است. در جدول منتشرشده توسط Z.ai، این مدل جدید در بعضی ارزیابی‌ها از مدل‌های بسته‌ی رقیب عقب می‌ماند.

بنچمارک (چه چیزی را می‌سنجد) GLM-5.3 GPT-5.6 Sol Claude Fable 5 Claude Mythos 5
Terminal-Bench 3.0 (کدنویسی عامل‌محور در محیط ترمینال) ۲۸٫۳٪ ۳۴٫۶٪ ۳۳٫۷٪
DeepSWE v1.1 (حل وظایف بلندمدت مهندسی نرم‌افزار) ۶۶٫۹٪ ۷۲٫۷٪ ۶۹٫۷٪
Z.ai Code Bench، سطح Max (نرخ تکمیل وظیفه در محیط توسعه‌ی محلی واقعی) ۳۴٫۵٪ ۳۹٫۵٪
Z.ai Code Bench، سطح High ۳۱٫۴٪ (Claude Opus 4.8: ۲۹٫۵٪)
CyberGym (پیداکردن و اثبات آسیب‌پذیری امنیتی در کد) ۸۴٫۵٪ ۸۳٫۶٪ ۸۳٫۸٪
ExploitBench (نوشتن یک اکسپلویت کاربردی از آسیب‌پذیری پیداشده) ۵۴٫۴٪ ۷۶٫۵٪ ۷۸٫۰٪
ExploitGym، بودجه‌ی شش‌ساعته (تعداد این کدهای اکسپلویت کامل‌شده در زمان محدود) ۱۳۰ وظیفه ۲۴۷ وظیفه

الگوی این جدول واضح است: هرچه یک آزمون در زنجیره‌ی «کشف آسیب‌پذیری تا ساخت اکسپلویت کامل» عمیق‌تر می‌شود، فاصله‌ی GLM-5.3 با مدل‌های بسته‌ی رقیب بیشتر می‌شود.

در CyberGym که کشف و اعتبارسنجی آسیب‌پذیری از روی کد منبع را می‌سنجد، GLM-5.3 بالاترین امتیاز را دارد؛ اما در ExploitBench و ExploitGym که ساخت اکسپلویت واقعی را ارزیابی می‌کنند، هم Claude Mythos 5 و هم GPT-5.6 Sol فاصله‌ی معناداری با آن دارند. Z.ai این الگو را طبیعی می‌داند و می‌گوید تمرکز GLM-5.3 روی دفاع سایبری است، نه تولید اکسپلویت.

در مقابل، در AutomationBench که اجرای گردش‌کارهای سازمانی چندمرحله‌ای را می‌سنجد، GLM-5.3 با ۴۸٫۲ درصد از مدل‌های ذکرشده در جدول Z.ai جلوتر است. این نشان می‌دهد که عملکرد عامل هوش مصنوعی یک معیار واحد نیست و بسته به نوع تسک، رتبه‌بندی مدل‌ها می‌تواند کاملاً تغییر کند.

ارزیابی‌های مستقل در مورد GLM-5.3 چه می‌گویند؟

مهم‌ترین داده‌ی مستقلی که پس از عرضه‌ی GLM-5.3 منتشر شده، از Artificial Analysis است؛ مجموعه‌ای که مدل‌ها را با شاخص ترکیبی Intelligence Index و ارزیابی‌های خودش مقایسه می‌کند، نه با اعداد سازنده. طبق این ارزیابی، GLM-5.3 در حالت max امتیاز ۶۰ گرفته که هفت واحد بالاتر از GLM-5.2 است و آن را هم‌تراز با Kimi K3، در جایگاه مدل باز رتبه‌بالای فعلی، قرار می‌دهد. مدل‌های بسته‌ی رده‌بالا مانند Claude Opus 5 همچنان امتیاز بالاتری دارند.

نتایج جالب‌تر Artificial Analysis درباره‌ی هزینه و کارایی توکنی است. برخلاف ادعای Z.ai مبنی بر کارآمدتر شدن مصرف توکن، این ارزیابی مستقل نشان می‌دهد GLM-5.3 با وجود قیمت پایین‌تر، پرحرف‌تر شده است. مدل برای هر وظیفه به‌طور میانگین حدود ۱۸٬۷۰۰ توکن خروجی تولید می‌کند، در برابر حدود ۱۵٬۷۰۰ توکن برای GLM-5.2 و حدود ۱۴٬۷۰۰ توکن برای Kimi K3. با این حال، چون قیمت هر توکن GLM-5.3 پایین است، هزینه‌ی هر وظیفه (حدود ۰٫۶۸ دلار) هنوز کمتر از Kimi K3 (حدود ۰٫۸۴ دلار) و GPT-5.6 Sol (حدود ۱٫۲۳ دلار) است، هرچند نسبت به هزینه‌ی حدود ۰٫۳۳ دلاری GLM-5.2 گران‌تر شده است.

نکته‌ای که بیشتر پوشش رسانه‌ای گرفته، جهش GLM-5.3 در GDPval-AA v2 است؛ ارزیابی مستقل Artificial Analysis برای کارهای دانشی و حرفه‌ای واقعی. امتیاز مدل از ۱۵۲۴ به ۱۷۷۰ رسیده، یعنی تنها پشت سر Claude Opus 5 با ۱۸۵۵ قرار می‌گیرد و از Kimi K3 با ۱۶۶۸ هم بیش از صد واحد جلوتر است. این یکی از معدود شواهد مستقلی است که نشان می‌دهد جهش GLM-5.3 صرفاً یک ادعای بازاریابی نیست.

ارزیابی KingBench 3 را چقدر جدی بگیریم؟

عددی که بیشترین بازتاب را در ویدیوها و شبکه‌های اجتماعی داشته، امتیاز ۷۳ از ۸۰ (۹۱٫۲۵ درصد) در KingBench 3 است.

سوالات متداول

GLM-5.3 چه ویژگی‌هایی دارد؟

GLM-5.3 یک مدل کاملاً متنی با ورودی تصویری بومی نیست و پنجره‌ی کانتکست آن یک میلیون توکن است.

چرا وزن‌های GLM-5.3 منتشر نشده‌اند؟

وزن‌های GLM-5.3 به دلیل نیاز به تکمیل ارزیابی‌های ایمنی، به‌ویژه در زمینه قابلیت‌های امنیت سایبری، منتشر نشده‌اند.

GLM-5.3 برای چه کاربردهایی مناسب است؟

این مدل برای کدنویسی طولانی‌مدت، کارهای عامل‌محور و تحلیل امنیتی طراحی شده است.

چگونه می‌توان از GLM-5.3 استفاده کرد؟

در حال حاضر، تنها راه استفاده از GLM-5.3 از طریق API رسمی Z.ai و طرح Coding Plan است.

GLM-5.3 در مقایسه با رقبای خود چه عملکردی دارد؟

GLM-5.3 در برخی بنچمارک‌ها از رقبای خود عقب می‌ماند، اما در زمینه کشف آسیب‌پذیری‌ها عملکرد خوبی دارد.

لطفا به این مطلب امتیاز بدید...

نمایش بیشتر
وب گردی

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا