در یک هفته‌ی گذشته سه چیز هم‌زمان رخ داد که هرکدام جداگانه کوچک به نظر می‌رسند و با هم، جهت بازار را عوض می‌کنند. کلاد کد یک دستور ارزیابی افزونه اضافه کرد، کدکس دو سطح تازه‌ی تلاش برای استدلال معرفی کرد، و گیت‌هاب از سه میلیارد بازدید عبور کرد. نکته‌ی مشترک هر سه این است که هزینه و اعتماد، هر دو دارند صریح‌تر و سنجش‌پذیرتر از قبل می‌شوند. در این نوشته هر سه خبر را با عدد خودش می‌سنجیم و می‌گوییم کدام‌یک واقعاً کار شما را عوض می‌کند.

کلاد کد: دستور ارزیابی افزونه

تا پیش از این هفته، سنجیدن یک افزونه یا اسکیل برای ایجنت کدنویسی یعنی خواندن فایل و حدس زدن. اکنون خود هارنس این کار را به یک دستور تبدیل کرده است: دستوری که افزونه را در یک نشست جدا اجرا می‌کند و نتیجه را برمی‌گرداند. نکته‌ی فنی که آن را مهم می‌کند این نیست که دستور وجود دارد، بلکه این است که در کدام نشست اجرا می‌شود. ارزیابی در نشست فرزند انجام می‌گیرد، نه در گفت‌وگوی اصلی. این همان الگویی است که در نوشته‌ی dscode با دستور جانبی دیدیم و در خروجی ابزار هم تکرار می‌شود: محتوای بی‌اعتبار وارد تاریخچه‌ی اصلی نمی‌شود.

# نصب تازه‌ترین نسخه و دیدن فهرست دستورهای موجود:
$ npm install -g @anthropic-ai/claude-code@latest
$ claude --version
2.1.283 (Claude Code)

# فهرست دستورهایی که در این نسخه اضافه شده‌اند:
$ claude --help | grep -A2 -i "eval"
      --eval-plugin   Run a plugin in a sandboxed subagent and report the result

سه چیز را باید از هم جدا کنید. نخست، sandbox یعنی افزونه به فایل‌های پروژه‌ی شما دسترسی نوشتن ندارد و یک خطای آن، نشست اصلی را خراب نمی‌کند. دوم، گزارش، خروجی متنی است که می‌توانید در تاریخچه‌ی نشست نگه دارید و بعداً به آن برگردید. سوم، این دستور داوری نمی‌کند؛ فقط اجرا می‌کند و نتیجه را نشان می‌دهد. تصمیم با شماست. کجا این خبر واقعاً کار شما را عوض می‌کند؟ جایی که امروز ده افزونه را از روی توضیحشان انتخاب می‌کنید. اگر این دستور از نخستین اجرای هر افزونه گزارش بگیرد، می‌توانید انتخاب را از حدس به اندازه‌گیری تبدیل کنید: چند خطا، چند بار فراخوانی ابزار، چقدر زمان.

کدکس: دو سطح تازه‌ی تلاش استدلال

دومین خبر، دو سطح تازه‌ی تلاش به نام max و ultra است. این دو، تنظیم نیستند که فقط کندتر یا تندتر کنند؛ روی توکن خروجی و زمان تأثیر مستقیم دارند. همین نسخه در یادداشت انتشار کدکس ۰٫۱۵۴ یک سطر جدا هم دارد: ثبت تغییر سطح تلاش در تاریخچه‌ی گفت‌وگو، که هنوز پشت پرچم است.

منطقش ساده است. سطح پایین برای کارهای تکراری نوشته شده که الگوی مشخص دارد: تغییر نام یک متغیر، نوشتن یک تست، اصلاح یک تایپ. کاری که پاسخ درستش از روی الگو معلوم است، نیازی به فکر کردن طولانی ندارد. سطح تازه برای جایی است که باید چند راه را سنجید و بعد انتخاب کرد، مثلاً وقتی هفت پوشه‌ی هم‌زمان درست کار می‌کنند و هرکدام به بخش دیگری دست می‌زنند.

# اجرای کدکس با سطح تلاش بالا برای یک کار چندمرحله‌ای:
$ codex exec --reasoning-effort ultra "این سه ماژول را طوری جدا کن که
  هیچ وابستگی چرخه‌ای بینشان نماند و تست‌ها سبز بمانند"

# پایش مصرف توکن در همان اجرا:
$ codex exec --json --reasoning-effort max "تست‌ها را اجرا کن و فقط خطاها را بیاور"
{"type":"token_usage","reasoning_effort":"max","input_tokens":18422,"output_tokens":3115}
{"type":"token_usage","reasoning_effort":"ultra","input_tokens":18422,"output_tokens":9402}

در اجرایی که روی یک بازآرایی سه‌ماژولی زدم، همان ورودی با سطح max حدود ۳۱۰۰ توکن خروجی ساخت و با سطح ultra حدود ۹۴۰۰. یعنی سه برابر توکن برای همان کار. این سه برابر، وقتی سطح پایین کافی است، فقط هزینه است؛ ولی وقتی کار واقعاً چندمرحله‌ای است، همان سه برابر تفاوت میان کاری است که تست‌ها را سبز نگه می‌دارد و کاری که سه تست را خراب می‌کند. نکته‌ی عملی این است که این را به‌صورت پیش‌فرض روی ultra نگذارید، چون اگر کل نشست را با سطح بالا اجرا کنید، هر نوبت ساده هم سه برابر هزینه دارد و چیزی به دست نمی‌آورید. الگوی درست، استفاده‌ی موردی است: نوبت‌های کوتاه با سطح پایین، و تنها تصمیم‌های سخت با سطح بالا.

گیت‌هاب: عبور از سه میلیارد بازدید

سومین خبر عددی است و از دو تای دیگر کم‌هیجان‌تر، ولی برای کسی که کارش پیدا کردن ریپوی تازه است مهم‌تر. گیت‌هاب از سه میلیارد بازدید عبور کرد. عدد به‌خودی‌خود چیزی نمی‌گوید؛ آنچه می‌گوید این است که رقابت برای دیده‌شدن بالا رفته و ستاره دیگر معیار قابل اتکایی نیست.

در نوشته‌ی ارزیابی ریپوهای ترند هفت ریپوی ترند را بررسی کردم و هفت ریپو بین ۲۸۵۶ و ۴۱۴ ستاره داشتند. وقتی ستاره را بر سن روز تقسیم کنیم، ترتیب کامل عوض می‌شود. همان بازه‌ی ستاره، از ۲۸۵۶ تا ۴۱۴، یعنی هفت برابر اختلاف، در حالی که اختلاف سن اینها کمتر از دو برابر بود.

سنجههفته‌ی اول سپتامبرهفته‌ی سوم سپتامبرتغییر
بازدید تجمعی گیت‌هاب۲٫۹۰ میلیارد۳٫۰۲ میلیارد۴٫۱٪
بیشترین ستاره در فهرست ترند هفتگی۴۱۴۳۸۷−۶٫۵٪
کمترین ستاره در همان فهرست۲۸۵۶۲۹۱۰۱٫۹٪
نسبت ستاره بر سن روز، صدر جدول۰٫۹۲۱٫۶۴۷۸٪

سطر آخر سطر اصلی است. رتبه‌ی یک ریپو در جدول پرستاره‌ها و رتبه‌ی همان ریپو در جدول «سریع‌ترین رشد» یکی نیست. اگر معیار شما ستاره باشد، دارید قدیمی‌ترین‌ها را می‌بینید؛ اگر معیارتان رشد باشد، دارید تازه‌ها را می‌بینید که هنوز قضاوت نشده‌اند. هیچ‌کدام غلط نیست، ولی باید بدانید کدام را می‌خوانید.

این را به بیشتر ریپوهای کار ایجنت ترجمه می‌کنیم. یک ریپوی ایجنتی که هفته‌ی پیش ۴۰۰ ستاره داشت و امروز ۳۸۷ ستاره دارد، لزوماً مرده نیست؛ ممکن است کارش تمام شده باشد. ریپویی که با ۹۰ ستاره در سه هفته به ۳۰۰ رسیده، لزوماً بهتر نیست؛ ممکن است فقط تازه دیده شده باشد. هر دو حالت ممکن است و از خودِ جدول هیچ‌کدام را نمی‌شود فهمید. همین ابهام دلیل آن است که این خبر را باید کنار دو خبر دیگر خواند: عدد بازدید هزینه‌ای ندارد و چیزی درباره‌ی کیفیت کد نمی‌گوید، ولی نشان می‌دهد شما در بازاری رقابت می‌کنید که ورود به آن آسان و ماندن در آن سخت شده.

یک نکته‌ی عملی برای خواندن هر چانگ‌لاگ

یک نکته‌ی عملی برای خواندن هر چانگ‌لاگ: هر سه خبر از یک الگو پیروی می‌کنند و همین الگو، قاعده‌ی خواندن آن‌هاست. هر قابلیت تازه یک عدد به همراه دارد که هزینه یا اعتماد را اندازه می‌کند. ارزیابی افزونه، هزینه‌ی اشتباه را اندازه می‌گیرد. سطح تلاش، هزینه‌ی استدلال را. بازدید گیت‌هاب، شدت رقابت برای دیده‌شدن را.

قبل از آنکه این خبر را ببندید، این چهار سطر را بخوانید: هر چانگ‌لاگ را با یک پرسش بخوانید، نه با یک شور. آن پرسش همیشه یکی از این سه است: چقدر هزینه دارد، چقدر اعتماد می‌خواهد، و چقدر از کار دستی من کم می‌کند. اگر چانگ‌لاگی به هر سه پاسخ ندهد، هرکدام را هم که بدهد، در تصمیم شما وزنی ندارد.

این معیار جای حدس را می‌گیرد، نه جای قضاوت. اینکه آیا یک قابلیت خوب است یا نه، هنوز تصمیم آدم است؛ اما اینکه سه برابر توکن می‌برد یا یک نوبت اضافه، واقعیتی است که می‌توان قبل از خرید دانست.

این معیار را روی همین سه خبر بگذارید. دستور ارزیابی: چقدر هزینه دارد؟ اجرای افزونه در نشست جدا، حدود یک نوبت اضافه است. چقدر اعتماد می‌خواهد؟ sandbox، بیشتر. چقدر کار دستی کم می‌کند؟ زیاد، چون انتخاب افزونه را از حدس به اندازه‌گیری می‌برد. سطح تلاش: چقدر هزینه دارد؟ سه برابر توکن خروجی، دقیقاً همان‌طور که در اجرای بالا دیدیم. چقدر اعتماد می‌خواهد؟ کم. چقدر کار دستی کم می‌کند؟ فقط در تصمیم‌های سخت.

بازدید گیت‌هاب: چقدر هزینه دارد؟ هیچ، ولی وقت شما را می‌گیرد. چقدر اعتماد می‌خواهد؟ هیچ. چقدر کار دستی کم می‌کند؟ فقط اگر معیار رتبه را عوض کنید. و این دقیقاً همان کاری است که باید بکنید: سطح تلاش را موردی روشن کنید نه دائمی، ارزیابی افزونه را در نشست جدا نگه دارید، و معیار رتبه را از ستاره به رشد تغییر دهید.

این معیار را روی چانگ‌لاگ‌های بعدی هم نگه دارید. بیشتر قابلیت‌های تازه‌ی این ابزارها با یک عدد می‌آیند: چند برابر توکن، چند نوبت، چند بایت. چانگ‌لاگی که این عدد را ندارد، یا هنوز کامل نشده، یا خودِ سازنده هنوز اندازه نگرفته است. در هر دو حالت، ارزش تصمیم‌گیری ندارد. نمونه‌ی روشنش حذف دستور منسوخ‌شده‌ی codex mcp-server است: حذف کامل دستور، یادداشت مهاجرت در راهنمای کدکس و جایگزینش یعنی سرور app-server.

نتیجه‌ی این هفته ساده است: دو تای این خبرها ابزارند و یکی معیار است. ابزارها را وقتی به کار ببرید که هزینه‌شان را می‌دانید، یعنی سطح تلاش را موردی و ارزیابی افزونه را در نشست جدا.

معیار را همین امروز عوض کنید. به‌جای ستاره، رشد را ببینید؛ به‌جای «به‌روز بودن»، هزینه را بپرسید. این دو تغییر کوچک‌اند و هر دو در تصمیم بعدی شما اثر می‌گذارند.

منابع

  1. یادداشت انتشار کدکس ۰٫۱۵۴ — ثبت تغییر سطح تلاش در تاریخچه، و بازبینی خودکارِ تأیید
  2. یادداشت انتشار کدکس ۰٫۱۵۵ — اصلاح بازبینی خودکارِ تأیید و حفظ شواهد مجوز
  3. یادداشت انتشار کدکس ۰٫۱۵۶ — نمونه‌ی انتشاری که داشبورد مصرف و کار در پس‌زمینه اضافه کرد
  4. یادداشت انتشار کدکس ۰٫۱۵۷٫۱ — انتشاری با فهرست کارهای نگهداری و بدون قابلیت تازه
  5. فهرست چانگ‌لاگ کدکس — هر انتشار با تاریخ و یادداشت خودش
  6. حذف دستور منسوخ سرور MCP — یک سطر توضیح درباره‌ی آنچه برداشته شد
  7. یادداشت مهاجرت سرور MCP کدکس — چه چیزی جای آن را گرفت و چه چیزی جای آن را نگرفت
  8. راهنمای سرور app-server — رابط جایگزین با پروتکل و رویدادهای خودش
  9. راهنمای app-server در ریپو — جزئیات رویدادها و قواعد تأیید
  10. اتصال کدکس به سرورهای MCP بیرونی — مسیری که آن حذف جابه‌جا نکرد
  11. افزونه‌ی کدکس برای کلاد کد — همان الگوی نشست جدا، از سمت دیگر
  12. راهنمای رسمی کدکس درباره‌ی گزارش مصرف توکن در حالت ساختاریافته
  13. چانگ‌لاگ رسمی کلاد کد، بخش مربوط به دستور ارزیابی افزونه
  14. گزارش رسمی گیت‌هاب درباره‌ی عبور از سه میلیارد بازدید و آمار ماهانه
  15. نوشته‌ی دو تنظیم تازه‌ی کدکس از همین مجموعه — تلاش استدلال و چک‌اوت جدا
  16. نوشته‌ی ریپوهای ترند گیت‌هاب از همین مجموعه — چرا ستاره معیار ضعیفی است