مدل Claude Haiku 5.5 در ۷ اکتبر ۲۰۲۶ منتشر شد و همان روز نسخه‌ی 2.1.293 کلاد کد آن را به مدل پیش‌فرض Haiku روی Anthropic API تبدیل کرد[6]. نرخ ورودی آن تا ۱۰۰٬۰۰۰ توکن ۰٫۱۰ دلار است و از همان آستانه ۰٫۵۰ دلار می‌شود[2]. چون توکن‌ساز تازه همان متن را حدود ۳۰ درصد بیشتر می‌شمارد[3]، پرامپتی که دیروز زیر آستانه بود می‌تواند امروز از آن رد شود. لحظه‌ی خواندن: ۸ اکتبر ۲۰۲۶.

در ۷ اکتبر چه چیزی منتشر شد

شناسه‌ی مدل claude-haiku-5-5 است: بدون تاریخ در انتها و بدون نام مستقل جداگانه[3]. روی آمازون بدراک همین مدل با شناسه‌ی anthropic.claude-haiku-5-5 صدا زده می‌شود و روی گوگل کلود و مایکروسافت فاوندری همان شناسه‌ی بدون تاریخ را می‌گیرد[2].

سه عدد مشخصات را می‌سازند: کانتکست یک میلیون توکن، حداکثر خروجی ۱۲۸ هزار توکن، و سطح تلاش پیش‌فرض medium[2]. کانتکست نسبت به Haiku 4.5 پنج برابر شده، چون آن مدل روی ۲۰۰ هزار توکن سقف داشت[2]. بازنشستگی هم زودتر از ۷ اکتبر ۲۰۲۷ اعلام شده است[2].

این نخستین مدل رده‌ی Haiku است که پارامتر سطح تلاش را می‌پذیرد[1]. یعنی عمق تفکر را خودتان تنظیم می‌کنید، به‌جای آنکه با budget_tokens یک سقف ثابت بدهید که یا زود می‌آید یا پول را می‌سوزاند.

حساب رسمی @claudeai در ۷ اکتبر اعلام کرد این مدل به‌طور میانگین حدود ۷۵ درصد ارزان‌تر اجرا می‌شود[7]. پانویس خود شرکت دقیق‌تر است: ۹۰ درصد ارزان‌تر برای درخواست‌های تا ۱۰۰٬۰۰۰ توکن و ۵۰ درصد ارزان‌تر برای درخواست‌های بالای آن. ۹۰ درصد درخواست‌های Haiku 4.5 زیر همین آستانه می‌افتادند[1].

ادعای ۷۵ درصد با جدول قیمت می‌خواند. زیر آستانه نرخ ورودی ۰٫۱۰ دلار در برابر ۱٫۰۰ دلار یعنی ۹۰ درصد کاهش، و بالای آستانه ۰٫۵۰ در برابر ۱٫۰۰ دلار یعنی ۵۰ درصد کاهش.

جدول زیر از صفحه‌ی معرفی رسمی Haiku 5.5 آمده است. دو ستون آخر مرجع‌اند، نه رقیب هم‌رده.

سنجهHaiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
OSWorld 2.1، زیرمجموعه‌ی آفلاین۷۲٫۴٪۱۵٫۷٪۴۸٫۹٪۸۳٫۹٪
Terminal-Bench 4.0۳۹٫۲٪۰٫۰٪۱۶٫۴٪۷۰٫۶٪
GDPval-AA v2.1۱٬۶۲۰۷۳۵۱٬۴۳۷۱٬۸۴۰
AA-Briefcase v1.1۱٬۵۷۸۶۱۴۱٬۳۳۶۱٬۸۲۴
Humanity’s Last Exam، بدون ابزار۴۵٫۹٪۱۰٫۲٪—۵۶٫۹٪
Chartography، بدون ابزار۴۶٫۴٪۶٫۴٪۲۹٫۱٪۶۱٫۶٪

سطر اول و دوم مهم‌ترین‌اند. در OSWorld نمره از ۱۵٫۷ به ۷۲٫۴ درصد رفته که از تقسیم ۷۲٫۴ بر ۱۵٫۷ برابر ۴٫۶۱ برابر می‌شود. در Terminal-Bench 4.0 نمره‌ی Haiku 4.5 صفر ثبت شده و این مدل ۳۹٫۲ درصد گرفته است[1].

سطر دوم یک هشدار هم هست: Sonnet 5.5 روی همان سنجه ۷۰٫۶ درصد است. خود شرکت می‌نویسد Sonnet و Opus برای کدنویسی ایجنتی پیچیده بهترین انتخاب‌اند و Haiku 5.5 برای کارهای باریک‌تر مثل فشرده‌سازی کانتکست و کار ایجنت‌های زیرمجموعه ساخته شده است[1].

سد ۱۰۰ هزار توکن، جایی که نرخ پنج برابر می‌شود

قیمت این مدل دو پله دارد و مرز پله روی اندازه‌ی پرامپت است، نه روی کل مصرف. جدول زیر از صفحه‌ی مدل در مستندات Claude Platform نقل شده است[2].

دلار بر هر میلیون توکنتا ۱۰۰٬۰۰۰ توکن پرامپتبالای ۱۰۰٬۰۰۰ توکنHaiku 4.5
توکن ورودی۰٫۱۰۰٫۵۰۱٫۰۰
توکن خروجی۰٫۵۰۲٫۵۰۵٫۰۰
خواندن از کش۰٫۰۱۰٫۰۵۰٫۱۰
نوشتن کش پنج دقیقه‌ای۰٫۱۲۵۰٫۶۲۵۱٫۲۵

نسبت هر ستون بر ستون زیر آستانه ۵ برابر است: ۰٫۵۰ بر ۰٫۱۰، ۲٫۵۰ بر ۰٫۵۰، ۰٫۰۵ بر ۰٫۰۱ و ۰٫۶۲۵ بر ۰٫۱۲۵. یعنی یک توکن بیشتر از آستانه، صورتحساب همان درخواست را پنج برابر می‌کند، بی‌آنکه کیفیت پاسخ تغییر کند.

این بدترین حالت ممکن نیست، چون هزینه‌ی کل یک درخواست پنج برابر نمی‌شود. بخش بزرگی از بار روی پرامپت می‌ماند و پرامپت از آستانه رد شده است. کد زیر همین حساب را می‌کند؛ نه کلید API می‌خواهد و نه تماس شبکه‌ای می‌زند.

#!/usr/bin/env python3
"""محاسبه‌ی نقطه‌ای که قیمت Haiku 5.5 پله عوض می‌کند."""

# دلار بر هر میلیون توکن: (تا ۱۰۰ هزار توکن پرامپت، بالای آن)
HAIKU_55 = {"input": (0.10, 0.50), "output": (0.50, 2.50)}
HAIKU_45 = {"input": (1.00,), "output": (5.00,)}
CLIFF = 100_000
OUT = 2_000


def bill(rates, prompt_tokens, output_tokens):
    # پله را خودمان انتخاب می‌کنیم: مرز روی پرامپت است نه روی کل مصرف
    tier = 0 if prompt_tokens <= CLIFF else 1
    return ((prompt_tokens / 1e6) * rates["input"][tier]
            + (output_tokens / 1e6) * rates["output"][tier])


def main():
    print("prompt 2000 output tokens, USD")
    print(f"{'text tok (4.5)':>15} {'-> (5.5)':>10} {'over 100k':>9} "
          f"{'4.5':>9} {'5.5':>9} {'save':>7}")
    for text_tokens in (70_000, 80_000, 95_000):
        # توکن‌ساز تازه همان متن را حدود ۳۰ درصد بیشتر می‌شمارد
        g5 = int(text_tokens * 1.30)
        c45 = bill(HAIKU_45, text_tokens, OUT)
        c55 = bill(HAIKU_55, g5, OUT)
        print(f"{text_tokens:>15,} {g5:>10,} "
              f"{'yes' if g5 > CLIFF else 'no':>9} "
              f"{c45:>9.5f} {c55:>9.5f} {1 - c55 / c45:>6.0%}")

    a = bill(HAIKU_55, CLIFF, OUT)
    b = bill(HAIKU_55, CLIFF + 1, OUT)
    print()
    print(f"one extra token past the cliff: {a:.5f} -> {b:.5f} "
          f"({b / a:.1f}x on a single request)")
    print(f"output alone, 2000 tokens, per tier: "
          f"{OUT / 1e6 * HAIKU_55['output'][0]:.5f} under 100k vs "
          f"{OUT / 1e6 * HAIKU_55['output'][1]:.5f} over 100k")


if __name__ == "__main__":
    main()
$ python3 cliff.py
prompt 2000 output tokens, USD
 text tok (4.5)   -> (5.5) over 100k       4.5       5.5    save
         70,000     91,000        no   0.08000   0.01010    87%
         80,000    104,000       yes   0.09000   0.05700    37%
         95,000    123,500       yes   0.10500   0.06675    36%

one extra token past the cliff: 0.01100 -> 0.05500 (5.0x on a single request)
output alone, 2000 tokens, per tier: 0.00100 under 100k vs 0.00500 over 100k

ستون آخر یعنی چقدر کم می‌پردید، و خط اول جدول همان چیزی است که باید بترسید: پرامپتی که روی Haiku 4.5 هشتاد هزار توکن بود، امروز ۱۰۴ هزار توکن است و از سد رد شده. صرفه‌جویی از ۸۷ درصد به ۳۷ درصد می‌افتد، فقط چون توکن‌ساز عوض شده و متن شما دست‌نخورده مانده است.

خط آخر دام کوچک‌تری را نشان می‌دهد: ۲۰۰۰ توکن خروجی زیر آستانه ۰٫۰۰۱ دلار تمام می‌شود و بالای آن ۰٫۰۰۵ دلار. پس حتی وقتی پرامپت کوتاه است، اگر پاسخ بلند شود همان پله‌ی دوم روی خروجی هم می‌نشیند.

توکن‌ساز تازه، حدود ۳۰ درصد بیشتر

مستندات رسمی می‌گوید Haiku 5.5 از همان توکن‌ساز جدیدی استفاده می‌کند که مدل‌های 4.7 به بعد دارند، و همان متن روی آن حدود ۳۰ درصد توکن بیشتری می‌شمارد. این عدد تقریبی است و مقدار دقیقش به محتوا بستگی دارد[3].

این تغییر چهار چیز را در کد شما جابه‌جا می‌کند: شمارش توکن و فیلدهای usage بالاتر می‌روند، تعداد متنی که در یک عدد ثابت جا می‌شود کم می‌شود، max_tokens که برای Haiku 4.5 تنظیم شده بود ممکن است خروجی معادل را قطع کند، و برآورد هزینه‌ی قبلی دیگر درست نیست.

پرامپت را زیر ۱۰۰٬۰۰۰ توکن نگه دارید، حتی وقتی کانتکست یک میلیونی اجازه‌ی بیشتر می‌دهد. روی این مدل، کانتکست بزرگ یعنی پنج برابر نرخ؛ بزرگی پنجره دیگر مزیت قیمتی نیست.

نکته‌ی کناری: توکن‌های تفکر به‌سمت max_tokens شمرده می‌شوند[4]. با حد خروجی تنگ، پاسخ ممکن است بعد از یک بلوک تفکر قطع شود و هیچ متنی برنگردد.

پنج شکستی که با تعویض نام مدل ظاهر می‌شوند

تعویض نام مدل به‌تنهایی کافی نیست. صفحه‌ی تغییرات Haiku 5.5 پنج شکست را فهرست می‌کند که با تعویض نام هیچ‌کدام رفع نمی‌شوند[4].

اول اینکه thinking به شکل {"type": "enabled", "budget_tokens": N} خطای ۴۰۰ می‌دهد و باید به تفکر تطبیقی برسد[3]. دوم اینکه temperature، top_p و top_k را باید حذف کنید؛ مقدار غیرپیش‌فرض برای هر کدام خطای ۴۰۰ می‌دهد[2].

سوم اینکه اگر messages شما با یک نوبت دستیار تمام می‌شود، باید به‌جای آن با یک نوبت کاربر تمام شود، چون پیش‌پرکردن دستیار دیگر پذیرفته نمی‌شود[3]. چهارم اینکه در کار با کامپیوتر باید از computer_toolset_20260801 به‌جای computer_20250124 استفاده کنید[3].

پنجمین شکست روی گفت‌وگوهای ذخیره‌شده اثر می‌گذارد: اگر بین درخواست‌ها، system، ابزارها یا پیام‌های قبلی را عوض کنید و بلوک تفکر قبلی را دوباره بفرستید، درخواست خطای ۴۰۰ می‌گیرد. بلوک تفکر فقط تا وقتی معتبر است که هرچه پیش از آن فرستاده‌اید دست‌نخورده بماند، پس گفت‌وگو باید فقط‌افزودنی بماند[3].

دو رفتار دیگر خطا نیستند اما کد شما را متوقف می‌کنند. پاسخ می‌تواند با بلوک تفکر شروع شود، پس کدی که اولین بلوک محتوا را جواب فرض می‌کند باید بلوک‌ها را بر اساس فیلد type انتخاب کند[4]. و متن تفکر به‌صورت خلاصه می‌آید؛ اگر خلاصه‌ی فشرده کافی نیست باید thinking.display را روی summarized بگذارید[3].

سومین مورد یک رفتار تازه است: این مدل می‌تواند با stop_reason برابر refusal درخواست را رد کند و برخلاف مدل‌های بزرگ‌تر، جایگزین سمت سرور ندارد[4]. یک حالت خطا نیست که پاسخ نیست، ولی کلاینت شما باید آن را از مسیر خطا رد کند تا دوباره فرستد.

بشمار، بعد انتخاب کن

پیش از مهاجرت، پرامپت‌های واقعی خودتان را بشمارید. مستندات Claude Platform یک اندپوینت شمارش توکن دارد که شماره را پیش از ارسال برمی‌گرداند[10].

# پرامپت را با مدل مقصد بشمارید، نه با مدلی که قبلا استفاده می‌کردید
# مقدار زیر نمونه است؛ با پرامپت خودتان اجرا کنید تا عدد واقعی را ببینید
$ curl https://api.anthropic.com/v1/messages/count_tokens \
    -H "x-api-key: $ANTHROPIC_API_KEY" \
    -H "content-type: application/json" \
    -H "anthropic-version: 2023-06-01" \
    -d '{"model": "claude-haiku-5-5",
         "messages": [{"role": "user", "content": "..."}]}'
{"input_tokens": 104182}

اگر عددی مثل ۱۰۴٬۱۸۲ توکن برگشت، پرامپت از سد رد شده و نرخ ورودی پنج برابر است. پس همان‌جا تصمیم بگیرید: یا پرامپت را کوتاه کنید، یا بخش بزرگش را در فایل بگذارید و فقط مسیرش را بفرستید. اگر زیر آستانه بود، مهاجرت تقریباً همیشه به‌صرفه است.

در کلاد کد لازم نیست این پنج مورد را دستی پیدا کنید. راهنمای رسمی یک دستور برای همین کار معرفی می‌کند[3].

$ claude
> /claude-api migrate this project to claude-haiku-5-5

این اسکیل نام مدل را عوض می‌کند و در صورت نیاز پارامترهای شکسته و جایگزینی پیش‌پرکردن را هم اعمال می‌کند، بعد فهرستی از کارهای دستی می‌سازد. پیش از هر ویرایشی دامنه‌ی کار را از شما می‌پرسد و برای Bedrock قالب شناسه را جدا تنظیم می‌کند[3].

پس صورتحساب واقعی این است: ارزان‌تر شدن فقط تا ۱۰۰٬۰۰۰ توکن پرامپت دوام دارد، و توکن‌ساز تازه حدود ۳۰ درصد شما را به آن سمت هل می‌دهد. عدد واقعی را بگیرید، نه تخمین قبلی.

برای زمینه‌ی هزینه، کش پرامپت چطور کار می‌کند توضیح می‌دهد چرا قیمت توکن تنها بخش صورتحساب نیست.

منابع

  1. معرفی Claude Haiku 5.5 — Anthropic، ۷ اکتبر ۲۰۲۶
  2. صفحه‌ی مدل Claude Haiku 5.5 — Claude Platform Docs
  3. راهنمای مهاجرت به Claude Haiku 5.5 — Claude Platform Docs
  4. تغییرات Claude Haiku 5.5 نسبت به 4.5 — Claude Platform Docs
  5. قیمت‌گذاری مدل‌های Claude — Claude Platform Docs
  6. Claude Code changelog، نسخه‌ی 2.1.293 — ۷ اکتبر ۲۰۲۶
  7. اعلام انتشار در حساب @claudeai — ۷ اکتبر ۲۰۲۶
  8. پست معرفی مدل در حساب @AnthropicAI — ۷ اکتبر ۲۰۲۶
  9. یادداشت‌های انتشار Claude Platform
  10. شمارش توکن — Claude Platform Docs