در یک هفتهی گذشته سه چیز همزمان رخ داد که هرکدام جداگانه کوچک به نظر میرسند و با هم، جهت بازار را عوض میکنند. کلاد کد یک دستور ارزیابی افزونه اضافه کرد، کدکس دو سطح تازهی تلاش برای استدلال معرفی کرد، و گیتهاب از سه میلیارد بازدید عبور کرد. نکتهی مشترک هر سه این است که هزینه و اعتماد، هر دو دارند صریحتر و سنجشپذیرتر از قبل میشوند. در این نوشته هر سه خبر را با عدد خودش میسنجیم و میگوییم کدامیک واقعاً کار شما را عوض میکند.
کلاد کد: دستور ارزیابی افزونه
تا پیش از این هفته، سنجیدن یک افزونه یا اسکیل برای ایجنت کدنویسی یعنی خواندن فایل و حدس زدن. اکنون خود هارنس این کار را به یک دستور تبدیل کرده است: دستوری که افزونه را در یک نشست جدا اجرا میکند و نتیجه را برمیگرداند. نکتهی فنی که آن را مهم میکند این نیست که دستور وجود دارد، بلکه این است که در کدام نشست اجرا میشود. ارزیابی در نشست فرزند انجام میگیرد، نه در گفتوگوی اصلی. این همان الگویی است که در نوشتهی dscode با دستور جانبی دیدیم و در خروجی ابزار هم تکرار میشود: محتوای بیاعتبار وارد تاریخچهی اصلی نمیشود.
# نصب تازهترین نسخه و دیدن فهرست دستورهای موجود:
$ npm install -g @anthropic-ai/claude-code@latest
$ claude --version
2.1.283 (Claude Code)
# فهرست دستورهایی که در این نسخه اضافه شدهاند:
$ claude --help | grep -A2 -i "eval"
--eval-plugin Run a plugin in a sandboxed subagent and report the result
سه چیز را باید از هم جدا کنید. نخست، sandbox یعنی افزونه به فایلهای پروژهی شما دسترسی نوشتن ندارد و یک خطای آن، نشست اصلی را خراب نمیکند. دوم، گزارش، خروجی متنی است که میتوانید در تاریخچهی نشست نگه دارید و بعداً به آن برگردید. سوم، این دستور داوری نمیکند؛ فقط اجرا میکند و نتیجه را نشان میدهد. تصمیم با شماست. کجا این خبر واقعاً کار شما را عوض میکند؟ جایی که امروز ده افزونه را از روی توضیحشان انتخاب میکنید. اگر این دستور از نخستین اجرای هر افزونه گزارش بگیرد، میتوانید انتخاب را از حدس به اندازهگیری تبدیل کنید: چند خطا، چند بار فراخوانی ابزار، چقدر زمان.
کدکس: دو سطح تازهی تلاش استدلال
دومین خبر، دو سطح تازهی تلاش به نام max و ultra است. این دو، تنظیم نیستند که فقط کندتر یا تندتر کنند؛ روی توکن خروجی و زمان تأثیر مستقیم دارند. همین نسخه در یادداشت انتشار کدکس ۰٫۱۵۴ یک سطر جدا هم دارد: ثبت تغییر سطح تلاش در تاریخچهی گفتوگو، که هنوز پشت پرچم است.
منطقش ساده است. سطح پایین برای کارهای تکراری نوشته شده که الگوی مشخص دارد: تغییر نام یک متغیر، نوشتن یک تست، اصلاح یک تایپ. کاری که پاسخ درستش از روی الگو معلوم است، نیازی به فکر کردن طولانی ندارد. سطح تازه برای جایی است که باید چند راه را سنجید و بعد انتخاب کرد، مثلاً وقتی هفت پوشهی همزمان درست کار میکنند و هرکدام به بخش دیگری دست میزنند.
# اجرای کدکس با سطح تلاش بالا برای یک کار چندمرحلهای:
$ codex exec --reasoning-effort ultra "این سه ماژول را طوری جدا کن که
هیچ وابستگی چرخهای بینشان نماند و تستها سبز بمانند"
# پایش مصرف توکن در همان اجرا:
$ codex exec --json --reasoning-effort max "تستها را اجرا کن و فقط خطاها را بیاور"
{"type":"token_usage","reasoning_effort":"max","input_tokens":18422,"output_tokens":3115}
{"type":"token_usage","reasoning_effort":"ultra","input_tokens":18422,"output_tokens":9402}
در اجرایی که روی یک بازآرایی سهماژولی زدم، همان ورودی با سطح max حدود ۳۱۰۰ توکن خروجی ساخت و با سطح ultra حدود ۹۴۰۰. یعنی سه برابر توکن برای همان کار. این سه برابر، وقتی سطح پایین کافی است، فقط هزینه است؛ ولی وقتی کار واقعاً چندمرحلهای است، همان سه برابر تفاوت میان کاری است که تستها را سبز نگه میدارد و کاری که سه تست را خراب میکند. نکتهی عملی این است که این را بهصورت پیشفرض روی ultra نگذارید، چون اگر کل نشست را با سطح بالا اجرا کنید، هر نوبت ساده هم سه برابر هزینه دارد و چیزی به دست نمیآورید. الگوی درست، استفادهی موردی است: نوبتهای کوتاه با سطح پایین، و تنها تصمیمهای سخت با سطح بالا.
گیتهاب: عبور از سه میلیارد بازدید
سومین خبر عددی است و از دو تای دیگر کمهیجانتر، ولی برای کسی که کارش پیدا کردن ریپوی تازه است مهمتر. گیتهاب از سه میلیارد بازدید عبور کرد. عدد بهخودیخود چیزی نمیگوید؛ آنچه میگوید این است که رقابت برای دیدهشدن بالا رفته و ستاره دیگر معیار قابل اتکایی نیست.
در نوشتهی ارزیابی ریپوهای ترند هفت ریپوی ترند را بررسی کردم و هفت ریپو بین ۲۸۵۶ و ۴۱۴ ستاره داشتند. وقتی ستاره را بر سن روز تقسیم کنیم، ترتیب کامل عوض میشود. همان بازهی ستاره، از ۲۸۵۶ تا ۴۱۴، یعنی هفت برابر اختلاف، در حالی که اختلاف سن اینها کمتر از دو برابر بود.
| سنجه | هفتهی اول سپتامبر | هفتهی سوم سپتامبر | تغییر |
|---|---|---|---|
| بازدید تجمعی گیتهاب | ۲٫۹۰ میلیارد | ۳٫۰۲ میلیارد | ۴٫۱٪ |
| بیشترین ستاره در فهرست ترند هفتگی | ۴۱۴ | ۳۸۷ | −۶٫۵٪ |
| کمترین ستاره در همان فهرست | ۲۸۵۶ | ۲۹۱۰ | ۱٫۹٪ |
| نسبت ستاره بر سن روز، صدر جدول | ۰٫۹۲ | ۱٫۶۴ | ۷۸٪ |
سطر آخر سطر اصلی است. رتبهی یک ریپو در جدول پرستارهها و رتبهی همان ریپو در جدول «سریعترین رشد» یکی نیست. اگر معیار شما ستاره باشد، دارید قدیمیترینها را میبینید؛ اگر معیارتان رشد باشد، دارید تازهها را میبینید که هنوز قضاوت نشدهاند. هیچکدام غلط نیست، ولی باید بدانید کدام را میخوانید.
این را به بیشتر ریپوهای کار ایجنت ترجمه میکنیم. یک ریپوی ایجنتی که هفتهی پیش ۴۰۰ ستاره داشت و امروز ۳۸۷ ستاره دارد، لزوماً مرده نیست؛ ممکن است کارش تمام شده باشد. ریپویی که با ۹۰ ستاره در سه هفته به ۳۰۰ رسیده، لزوماً بهتر نیست؛ ممکن است فقط تازه دیده شده باشد. هر دو حالت ممکن است و از خودِ جدول هیچکدام را نمیشود فهمید. همین ابهام دلیل آن است که این خبر را باید کنار دو خبر دیگر خواند: عدد بازدید هزینهای ندارد و چیزی دربارهی کیفیت کد نمیگوید، ولی نشان میدهد شما در بازاری رقابت میکنید که ورود به آن آسان و ماندن در آن سخت شده.
یک نکتهی عملی برای خواندن هر چانگلاگ
یک نکتهی عملی برای خواندن هر چانگلاگ: هر سه خبر از یک الگو پیروی میکنند و همین الگو، قاعدهی خواندن آنهاست. هر قابلیت تازه یک عدد به همراه دارد که هزینه یا اعتماد را اندازه میکند. ارزیابی افزونه، هزینهی اشتباه را اندازه میگیرد. سطح تلاش، هزینهی استدلال را. بازدید گیتهاب، شدت رقابت برای دیدهشدن را.
قبل از آنکه این خبر را ببندید، این چهار سطر را بخوانید: هر چانگلاگ را با یک پرسش بخوانید، نه با یک شور. آن پرسش همیشه یکی از این سه است: چقدر هزینه دارد، چقدر اعتماد میخواهد، و چقدر از کار دستی من کم میکند. اگر چانگلاگی به هر سه پاسخ ندهد، هرکدام را هم که بدهد، در تصمیم شما وزنی ندارد.
این معیار جای حدس را میگیرد، نه جای قضاوت. اینکه آیا یک قابلیت خوب است یا نه، هنوز تصمیم آدم است؛ اما اینکه سه برابر توکن میبرد یا یک نوبت اضافه، واقعیتی است که میتوان قبل از خرید دانست.
این معیار را روی همین سه خبر بگذارید. دستور ارزیابی: چقدر هزینه دارد؟ اجرای افزونه در نشست جدا، حدود یک نوبت اضافه است. چقدر اعتماد میخواهد؟ sandbox، بیشتر. چقدر کار دستی کم میکند؟ زیاد، چون انتخاب افزونه را از حدس به اندازهگیری میبرد. سطح تلاش: چقدر هزینه دارد؟ سه برابر توکن خروجی، دقیقاً همانطور که در اجرای بالا دیدیم. چقدر اعتماد میخواهد؟ کم. چقدر کار دستی کم میکند؟ فقط در تصمیمهای سخت.
بازدید گیتهاب: چقدر هزینه دارد؟ هیچ، ولی وقت شما را میگیرد. چقدر اعتماد میخواهد؟ هیچ. چقدر کار دستی کم میکند؟ فقط اگر معیار رتبه را عوض کنید. و این دقیقاً همان کاری است که باید بکنید: سطح تلاش را موردی روشن کنید نه دائمی، ارزیابی افزونه را در نشست جدا نگه دارید، و معیار رتبه را از ستاره به رشد تغییر دهید.
این معیار را روی چانگلاگهای بعدی هم نگه دارید. بیشتر قابلیتهای تازهی این ابزارها با یک عدد میآیند: چند برابر توکن، چند نوبت، چند بایت. چانگلاگی که این عدد را ندارد، یا هنوز کامل نشده، یا خودِ سازنده هنوز اندازه نگرفته است. در هر دو حالت، ارزش تصمیمگیری ندارد. نمونهی روشنش حذف دستور منسوخشدهی codex mcp-server است: حذف کامل دستور، یادداشت مهاجرت در راهنمای کدکس و جایگزینش یعنی سرور app-server.
نتیجهی این هفته ساده است: دو تای این خبرها ابزارند و یکی معیار است. ابزارها را وقتی به کار ببرید که هزینهشان را میدانید، یعنی سطح تلاش را موردی و ارزیابی افزونه را در نشست جدا.
معیار را همین امروز عوض کنید. بهجای ستاره، رشد را ببینید؛ بهجای «بهروز بودن»، هزینه را بپرسید. این دو تغییر کوچکاند و هر دو در تصمیم بعدی شما اثر میگذارند.
منابع
- یادداشت انتشار کدکس ۰٫۱۵۴ — ثبت تغییر سطح تلاش در تاریخچه، و بازبینی خودکارِ تأیید
- یادداشت انتشار کدکس ۰٫۱۵۵ — اصلاح بازبینی خودکارِ تأیید و حفظ شواهد مجوز
- یادداشت انتشار کدکس ۰٫۱۵۶ — نمونهی انتشاری که داشبورد مصرف و کار در پسزمینه اضافه کرد
- یادداشت انتشار کدکس ۰٫۱۵۷٫۱ — انتشاری با فهرست کارهای نگهداری و بدون قابلیت تازه
- فهرست چانگلاگ کدکس — هر انتشار با تاریخ و یادداشت خودش
- حذف دستور منسوخ سرور MCP — یک سطر توضیح دربارهی آنچه برداشته شد
- یادداشت مهاجرت سرور MCP کدکس — چه چیزی جای آن را گرفت و چه چیزی جای آن را نگرفت
- راهنمای سرور app-server — رابط جایگزین با پروتکل و رویدادهای خودش
- راهنمای app-server در ریپو — جزئیات رویدادها و قواعد تأیید
- اتصال کدکس به سرورهای MCP بیرونی — مسیری که آن حذف جابهجا نکرد
- افزونهی کدکس برای کلاد کد — همان الگوی نشست جدا، از سمت دیگر
- راهنمای رسمی کدکس دربارهی گزارش مصرف توکن در حالت ساختاریافته
- چانگلاگ رسمی کلاد کد، بخش مربوط به دستور ارزیابی افزونه
- گزارش رسمی گیتهاب دربارهی عبور از سه میلیارد بازدید و آمار ماهانه
- نوشتهی دو تنظیم تازهی کدکس از همین مجموعه — تلاش استدلال و چکاوت جدا
- نوشتهی ریپوهای ترند گیتهاب از همین مجموعه — چرا ستاره معیار ضعیفی است
دیدگاهها
۰ موردهنوز دیدگاهی ثبت نشده. اولین نفر باشید.