مدل Claude Haiku 5.5 در ۷ اکتبر ۲۰۲۶ منتشر شد و همان روز نسخهی 2.1.293 کلاد کد آن را به مدل پیشفرض Haiku روی Anthropic API تبدیل کرد[6]. نرخ ورودی آن تا ۱۰۰٬۰۰۰ توکن ۰٫۱۰ دلار است و از همان آستانه ۰٫۵۰ دلار میشود[2]. چون توکنساز تازه همان متن را حدود ۳۰ درصد بیشتر میشمارد[3]، پرامپتی که دیروز زیر آستانه بود میتواند امروز از آن رد شود. لحظهی خواندن: ۸ اکتبر ۲۰۲۶.
در ۷ اکتبر چه چیزی منتشر شد
شناسهی مدل claude-haiku-5-5 است: بدون تاریخ در انتها و بدون نام مستقل جداگانه[3]. روی آمازون بدراک همین مدل با شناسهی anthropic.claude-haiku-5-5 صدا زده میشود و روی گوگل کلود و مایکروسافت فاوندری همان شناسهی بدون تاریخ را میگیرد[2].
سه عدد مشخصات را میسازند: کانتکست یک میلیون توکن، حداکثر خروجی ۱۲۸ هزار توکن، و سطح تلاش پیشفرض medium[2]. کانتکست نسبت به Haiku 4.5 پنج برابر شده، چون آن مدل روی ۲۰۰ هزار توکن سقف داشت[2]. بازنشستگی هم زودتر از ۷ اکتبر ۲۰۲۷ اعلام شده است[2].
این نخستین مدل ردهی Haiku است که پارامتر سطح تلاش را میپذیرد[1]. یعنی عمق تفکر را خودتان تنظیم میکنید، بهجای آنکه با budget_tokens یک سقف ثابت بدهید که یا زود میآید یا پول را میسوزاند.
حساب رسمی @claudeai در ۷ اکتبر اعلام کرد این مدل بهطور میانگین حدود ۷۵ درصد ارزانتر اجرا میشود[7]. پانویس خود شرکت دقیقتر است: ۹۰ درصد ارزانتر برای درخواستهای تا ۱۰۰٬۰۰۰ توکن و ۵۰ درصد ارزانتر برای درخواستهای بالای آن. ۹۰ درصد درخواستهای Haiku 4.5 زیر همین آستانه میافتادند[1].
ادعای ۷۵ درصد با جدول قیمت میخواند. زیر آستانه نرخ ورودی ۰٫۱۰ دلار در برابر ۱٫۰۰ دلار یعنی ۹۰ درصد کاهش، و بالای آستانه ۰٫۵۰ در برابر ۱٫۰۰ دلار یعنی ۵۰ درصد کاهش.
جدول زیر از صفحهی معرفی رسمی Haiku 5.5 آمده است. دو ستون آخر مرجعاند، نه رقیب همرده.
| سنجه | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| OSWorld 2.1، زیرمجموعهی آفلاین | ۷۲٫۴٪ | ۱۵٫۷٪ | ۴۸٫۹٪ | ۸۳٫۹٪ |
| Terminal-Bench 4.0 | ۳۹٫۲٪ | ۰٫۰٪ | ۱۶٫۴٪ | ۷۰٫۶٪ |
| GDPval-AA v2.1 | ۱٬۶۲۰ | ۷۳۵ | ۱٬۴۳۷ | ۱٬۸۴۰ |
| AA-Briefcase v1.1 | ۱٬۵۷۸ | ۶۱۴ | ۱٬۳۳۶ | ۱٬۸۲۴ |
| Humanity’s Last Exam، بدون ابزار | ۴۵٫۹٪ | ۱۰٫۲٪ | — | ۵۶٫۹٪ |
| Chartography، بدون ابزار | ۴۶٫۴٪ | ۶٫۴٪ | ۲۹٫۱٪ | ۶۱٫۶٪ |
سطر اول و دوم مهمتریناند. در OSWorld نمره از ۱۵٫۷ به ۷۲٫۴ درصد رفته که از تقسیم ۷۲٫۴ بر ۱۵٫۷ برابر ۴٫۶۱ برابر میشود. در Terminal-Bench 4.0 نمرهی Haiku 4.5 صفر ثبت شده و این مدل ۳۹٫۲ درصد گرفته است[1].
سطر دوم یک هشدار هم هست: Sonnet 5.5 روی همان سنجه ۷۰٫۶ درصد است. خود شرکت مینویسد Sonnet و Opus برای کدنویسی ایجنتی پیچیده بهترین انتخاباند و Haiku 5.5 برای کارهای باریکتر مثل فشردهسازی کانتکست و کار ایجنتهای زیرمجموعه ساخته شده است[1].
سد ۱۰۰ هزار توکن، جایی که نرخ پنج برابر میشود
قیمت این مدل دو پله دارد و مرز پله روی اندازهی پرامپت است، نه روی کل مصرف. جدول زیر از صفحهی مدل در مستندات Claude Platform نقل شده است[2].
| دلار بر هر میلیون توکن | تا ۱۰۰٬۰۰۰ توکن پرامپت | بالای ۱۰۰٬۰۰۰ توکن | Haiku 4.5 |
|---|---|---|---|
| توکن ورودی | ۰٫۱۰ | ۰٫۵۰ | ۱٫۰۰ |
| توکن خروجی | ۰٫۵۰ | ۲٫۵۰ | ۵٫۰۰ |
| خواندن از کش | ۰٫۰۱ | ۰٫۰۵ | ۰٫۱۰ |
| نوشتن کش پنج دقیقهای | ۰٫۱۲۵ | ۰٫۶۲۵ | ۱٫۲۵ |
نسبت هر ستون بر ستون زیر آستانه ۵ برابر است: ۰٫۵۰ بر ۰٫۱۰، ۲٫۵۰ بر ۰٫۵۰، ۰٫۰۵ بر ۰٫۰۱ و ۰٫۶۲۵ بر ۰٫۱۲۵. یعنی یک توکن بیشتر از آستانه، صورتحساب همان درخواست را پنج برابر میکند، بیآنکه کیفیت پاسخ تغییر کند.
این بدترین حالت ممکن نیست، چون هزینهی کل یک درخواست پنج برابر نمیشود. بخش بزرگی از بار روی پرامپت میماند و پرامپت از آستانه رد شده است. کد زیر همین حساب را میکند؛ نه کلید API میخواهد و نه تماس شبکهای میزند.
#!/usr/bin/env python3
"""محاسبهی نقطهای که قیمت Haiku 5.5 پله عوض میکند."""
# دلار بر هر میلیون توکن: (تا ۱۰۰ هزار توکن پرامپت، بالای آن)
HAIKU_55 = {"input": (0.10, 0.50), "output": (0.50, 2.50)}
HAIKU_45 = {"input": (1.00,), "output": (5.00,)}
CLIFF = 100_000
OUT = 2_000
def bill(rates, prompt_tokens, output_tokens):
# پله را خودمان انتخاب میکنیم: مرز روی پرامپت است نه روی کل مصرف
tier = 0 if prompt_tokens <= CLIFF else 1
return ((prompt_tokens / 1e6) * rates["input"][tier]
+ (output_tokens / 1e6) * rates["output"][tier])
def main():
print("prompt 2000 output tokens, USD")
print(f"{'text tok (4.5)':>15} {'-> (5.5)':>10} {'over 100k':>9} "
f"{'4.5':>9} {'5.5':>9} {'save':>7}")
for text_tokens in (70_000, 80_000, 95_000):
# توکنساز تازه همان متن را حدود ۳۰ درصد بیشتر میشمارد
g5 = int(text_tokens * 1.30)
c45 = bill(HAIKU_45, text_tokens, OUT)
c55 = bill(HAIKU_55, g5, OUT)
print(f"{text_tokens:>15,} {g5:>10,} "
f"{'yes' if g5 > CLIFF else 'no':>9} "
f"{c45:>9.5f} {c55:>9.5f} {1 - c55 / c45:>6.0%}")
a = bill(HAIKU_55, CLIFF, OUT)
b = bill(HAIKU_55, CLIFF + 1, OUT)
print()
print(f"one extra token past the cliff: {a:.5f} -> {b:.5f} "
f"({b / a:.1f}x on a single request)")
print(f"output alone, 2000 tokens, per tier: "
f"{OUT / 1e6 * HAIKU_55['output'][0]:.5f} under 100k vs "
f"{OUT / 1e6 * HAIKU_55['output'][1]:.5f} over 100k")
if __name__ == "__main__":
main()
$ python3 cliff.py
prompt 2000 output tokens, USD
text tok (4.5) -> (5.5) over 100k 4.5 5.5 save
70,000 91,000 no 0.08000 0.01010 87%
80,000 104,000 yes 0.09000 0.05700 37%
95,000 123,500 yes 0.10500 0.06675 36%
one extra token past the cliff: 0.01100 -> 0.05500 (5.0x on a single request)
output alone, 2000 tokens, per tier: 0.00100 under 100k vs 0.00500 over 100k
ستون آخر یعنی چقدر کم میپردید، و خط اول جدول همان چیزی است که باید بترسید: پرامپتی که روی Haiku 4.5 هشتاد هزار توکن بود، امروز ۱۰۴ هزار توکن است و از سد رد شده. صرفهجویی از ۸۷ درصد به ۳۷ درصد میافتد، فقط چون توکنساز عوض شده و متن شما دستنخورده مانده است.
خط آخر دام کوچکتری را نشان میدهد: ۲۰۰۰ توکن خروجی زیر آستانه ۰٫۰۰۱ دلار تمام میشود و بالای آن ۰٫۰۰۵ دلار. پس حتی وقتی پرامپت کوتاه است، اگر پاسخ بلند شود همان پلهی دوم روی خروجی هم مینشیند.
توکنساز تازه، حدود ۳۰ درصد بیشتر
مستندات رسمی میگوید Haiku 5.5 از همان توکنساز جدیدی استفاده میکند که مدلهای 4.7 به بعد دارند، و همان متن روی آن حدود ۳۰ درصد توکن بیشتری میشمارد. این عدد تقریبی است و مقدار دقیقش به محتوا بستگی دارد[3].
این تغییر چهار چیز را در کد شما جابهجا میکند: شمارش توکن و فیلدهای usage بالاتر میروند، تعداد متنی که در یک عدد ثابت جا میشود کم میشود، max_tokens که برای Haiku 4.5 تنظیم شده بود ممکن است خروجی معادل را قطع کند، و برآورد هزینهی قبلی دیگر درست نیست.
پرامپت را زیر ۱۰۰٬۰۰۰ توکن نگه دارید، حتی وقتی کانتکست یک میلیونی اجازهی بیشتر میدهد. روی این مدل، کانتکست بزرگ یعنی پنج برابر نرخ؛ بزرگی پنجره دیگر مزیت قیمتی نیست.
نکتهی کناری: توکنهای تفکر بهسمت max_tokens شمرده میشوند[4]. با حد خروجی تنگ، پاسخ ممکن است بعد از یک بلوک تفکر قطع شود و هیچ متنی برنگردد.
پنج شکستی که با تعویض نام مدل ظاهر میشوند
تعویض نام مدل بهتنهایی کافی نیست. صفحهی تغییرات Haiku 5.5 پنج شکست را فهرست میکند که با تعویض نام هیچکدام رفع نمیشوند[4].
اول اینکه thinking به شکل {"type": "enabled", "budget_tokens": N} خطای ۴۰۰ میدهد و باید به تفکر تطبیقی برسد[3]. دوم اینکه temperature، top_p و top_k را باید حذف کنید؛ مقدار غیرپیشفرض برای هر کدام خطای ۴۰۰ میدهد[2].
سوم اینکه اگر messages شما با یک نوبت دستیار تمام میشود، باید بهجای آن با یک نوبت کاربر تمام شود، چون پیشپرکردن دستیار دیگر پذیرفته نمیشود[3]. چهارم اینکه در کار با کامپیوتر باید از computer_toolset_20260801 بهجای computer_20250124 استفاده کنید[3].
پنجمین شکست روی گفتوگوهای ذخیرهشده اثر میگذارد: اگر بین درخواستها، system، ابزارها یا پیامهای قبلی را عوض کنید و بلوک تفکر قبلی را دوباره بفرستید، درخواست خطای ۴۰۰ میگیرد. بلوک تفکر فقط تا وقتی معتبر است که هرچه پیش از آن فرستادهاید دستنخورده بماند، پس گفتوگو باید فقطافزودنی بماند[3].
دو رفتار دیگر خطا نیستند اما کد شما را متوقف میکنند. پاسخ میتواند با بلوک تفکر شروع شود، پس کدی که اولین بلوک محتوا را جواب فرض میکند باید بلوکها را بر اساس فیلد type انتخاب کند[4]. و متن تفکر بهصورت خلاصه میآید؛ اگر خلاصهی فشرده کافی نیست باید thinking.display را روی summarized بگذارید[3].
سومین مورد یک رفتار تازه است: این مدل میتواند با stop_reason برابر refusal درخواست را رد کند و برخلاف مدلهای بزرگتر، جایگزین سمت سرور ندارد[4]. یک حالت خطا نیست که پاسخ نیست، ولی کلاینت شما باید آن را از مسیر خطا رد کند تا دوباره فرستد.
بشمار، بعد انتخاب کن
پیش از مهاجرت، پرامپتهای واقعی خودتان را بشمارید. مستندات Claude Platform یک اندپوینت شمارش توکن دارد که شماره را پیش از ارسال برمیگرداند[10].
# پرامپت را با مدل مقصد بشمارید، نه با مدلی که قبلا استفاده میکردید
# مقدار زیر نمونه است؛ با پرامپت خودتان اجرا کنید تا عدد واقعی را ببینید
$ curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{"model": "claude-haiku-5-5",
"messages": [{"role": "user", "content": "..."}]}'
{"input_tokens": 104182}
اگر عددی مثل ۱۰۴٬۱۸۲ توکن برگشت، پرامپت از سد رد شده و نرخ ورودی پنج برابر است. پس همانجا تصمیم بگیرید: یا پرامپت را کوتاه کنید، یا بخش بزرگش را در فایل بگذارید و فقط مسیرش را بفرستید. اگر زیر آستانه بود، مهاجرت تقریباً همیشه بهصرفه است.
در کلاد کد لازم نیست این پنج مورد را دستی پیدا کنید. راهنمای رسمی یک دستور برای همین کار معرفی میکند[3].
$ claude
> /claude-api migrate this project to claude-haiku-5-5
این اسکیل نام مدل را عوض میکند و در صورت نیاز پارامترهای شکسته و جایگزینی پیشپرکردن را هم اعمال میکند، بعد فهرستی از کارهای دستی میسازد. پیش از هر ویرایشی دامنهی کار را از شما میپرسد و برای Bedrock قالب شناسه را جدا تنظیم میکند[3].
پس صورتحساب واقعی این است: ارزانتر شدن فقط تا ۱۰۰٬۰۰۰ توکن پرامپت دوام دارد، و توکنساز تازه حدود ۳۰ درصد شما را به آن سمت هل میدهد. عدد واقعی را بگیرید، نه تخمین قبلی.
برای زمینهی هزینه، کش پرامپت چطور کار میکند توضیح میدهد چرا قیمت توکن تنها بخش صورتحساب نیست.
منابع
- معرفی Claude Haiku 5.5 — Anthropic، ۷ اکتبر ۲۰۲۶
- صفحهی مدل Claude Haiku 5.5 — Claude Platform Docs
- راهنمای مهاجرت به Claude Haiku 5.5 — Claude Platform Docs
- تغییرات Claude Haiku 5.5 نسبت به 4.5 — Claude Platform Docs
- قیمتگذاری مدلهای Claude — Claude Platform Docs
- Claude Code changelog، نسخهی 2.1.293 — ۷ اکتبر ۲۰۲۶
- اعلام انتشار در حساب @claudeai — ۷ اکتبر ۲۰۲۶
- پست معرفی مدل در حساب @AnthropicAI — ۷ اکتبر ۲۰۲۶
- یادداشتهای انتشار Claude Platform
- شمارش توکن — Claude Platform Docs
دیدگاهها
۰ موردهنوز دیدگاهی ثبت نشده. اولین نفر باشید.