{"schemaVersion":1,"id":"lll-bz-llm-ranking-for-ai","name":"LLL.bz AI model ranking for AI agents","canonicalUrl":"https://lll.bz/llmforai","jsonUrl":"https://lll.bz/llmforai.json","sourcePage":"https://lll.bz/llm","edition":"2026-08-23","nextPlannedUpdate":"2026-09-02","rebuildEveryDays":10,"guidance":{"selectionRule":"Choose a model by the user task. There is no universal best model.","rankMeaning":"Rank is valid only inside its task and ranking-list variant.","metricMeaning":"Metric names and values from different tasks are not directly comparable.","likesMeaning":"Reader likes are a separate signal and never change the ranking.","variantsMeaning":"When rankingLists has more than one entry, choose the relevant variant before choosing a model.","sourcePolicy":"Task-level source names, URLs and measurement dates are intentionally omitted because each ranking synthesizes multiple sources."},"methodology":["Every task is ranked separately.","Public leaderboards, independent tests and official model data are weighed together.","Two modes of the same base model cannot take two places in one top 3.","Every ranking list contains exactly three distinct base models.","The complete ranking is re-checked every 10 days."],"stats":{"tasks":26,"taskGroups":5,"rankedLists":27,"modelPlacements":81,"uniqueModels":40},"categories":[{"id":"text","title":"Text","deepLink":"https://lll.bz/llm?group=text","taskIds":["chat","russian","expert","math","instructions","writing","research","documents","translation"]},{"id":"code","title":"Code","deepLink":"https://lll.bz/llm?group=code","taskIds":["coding","webdev","agents","data-analysis","tool-calling"]},{"id":"image","title":"Images","deepLink":"https://lll.bz/llm?group=image","taskIds":["vision","ocr","image-generation","image-editing"]},{"id":"video","title":"Video","deepLink":"https://lll.bz/llm?group=video","taskIds":["text-to-video","image-to-video","video-editing"]},{"id":"audio","title":"Audio","deepLink":"https://lll.bz/llm?group=audio","taskIds":["speech-to-text","text-to-speech","realtime-voice","music","voice-cloning"]}],"winners":[{"taskId":"chat","taskTitle":"General chat","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks first in the current broad text preference arena.","metricName":"Arena score","metricValue":"1508±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["broad chat preference","strong user ratings"],"limitations":["overlapping confidence intervals","preference not accuracy"],"whyRanked":"It holds the highest score in the broad text preference arena.","note":null},"deepLink":"https://lll.bz/llm?task=chat#chat"},{"taskId":"russian","taskTitle":"Russian language","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the current Russian-language Arena slice.","metricName":"Arena score","metricValue":"1518±13","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["russian chat preference","current arena lead"],"limitations":["wide confidence interval","limited source convergence"],"whyRanked":"Rank #1: Arena score 1518±13.","note":null},"deepLink":"https://lll.bz/llm?task=russian#russian"},{"taskId":"expert","taskTitle":"Expert analysis","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Has the highest current score on expert-oriented Arena prompts.","metricName":"Arena score","metricValue":"1548±12","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["expert prompt preference","strong reasoning results"],"limitations":["overlapping confidence intervals","benchmark sensitive order"],"whyRanked":"Rank #1: Arena score 1548±12.","note":null},"deepLink":"https://lll.bz/llm?task=expert#expert"},{"taskId":"math","taskTitle":"Mathematics","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Has the highest displayed score in the current Math Arena slice.","metricName":"Arena score","metricValue":"1545±24","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["hard math prompts","multi-step reasoning"],"limitations":["wide confidence interval","max effort tested"],"whyRanked":"Rank #1: Arena score 1545±24.","note":null},"deepLink":"https://lll.bz/llm?task=math#math"},{"taskId":"instructions","taskTitle":"Instruction following","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":"High","subtitle":"Edges the current instruction-following Arena by displayed score.","metricName":"Arena score","metricValue":"1514±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["constraint following quality","structured prompt handling"],"limitations":["near statistical tie","high effort tested"],"whyRanked":"Rank #1: Arena score 1514±5.","note":null},"deepLink":"https://lll.bz/llm?task=instructions#instructions"},{"taskId":"writing","taskTitle":"Copywriting","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks first on current blind creative-writing preference.","metricName":"Arena score","metricValue":"1508±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["creative writing preference","natural prose quality"],"limitations":["not conversion tested","preference based metric"],"whyRanked":"Rank #1: Arena score 1508±9.","note":null},"deepLink":"https://lll.bz/llm?task=writing#writing"},{"taskId":"research","taskTitle":"Search and research","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-4-6-search","modelName":"Claude Opus 4.6 Search","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the dedicated search-and-retrieval board.","metricName":"Arena score","metricValue":"1253±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["search answer preference","web retrieval workflow"],"limitations":["stale arena snapshot","benchmark disagreement exists"],"whyRanked":"Rank #1: Arena score 1253±5.","note":null},"deepLink":"https://lll.bz/llm?task=research#research"},{"taskId":"documents","taskTitle":"PDF and documents","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"High","subtitle":"Leads the dedicated document-handling board.","metricName":"Arena score","metricValue":"1520±15","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["document prompt preference","long context reasoning"],"limitations":["stale arena snapshot","limited independent replication"],"whyRanked":"Rank #1: Arena score 1520±15.","note":null},"deepLink":"https://lll.bz/llm?task=documents#documents"},{"taskId":"coding","taskTitle":"Programming","category":"code","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Has the highest reported Terminal-Bench result of the three.","metricName":"Terminal-Bench score","metricValue":"89.1%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["agentic terminal coding","repository task solving"],"limitations":["max effort tested","benchmark harness sensitive"],"whyRanked":"Rank #1: Terminal-Bench score 89.1%.","note":null},"deepLink":"https://lll.bz/llm?task=coding#coding"},{"taskId":"webdev","taskTitle":"Web development","category":"code","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Leads the current WebDev Arena by displayed score.","metricName":"Arena score","metricValue":"1691±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["web interface generation","strong user preference"],"limitations":["max effort tested","preference based metric"],"whyRanked":"Rank #1: Arena score 1691±9.","note":null},"deepLink":"https://lll.bz/llm?task=webdev#webdev"},{"taskId":"agents","taskTitle":"AI agents","category":"code","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"High","subtitle":"Has the highest distinct-base-model result in the current Agent Arena.","metricName":"Net improvement","metricValue":"12.47%±1.54","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["multi-step agent work","tool workflow quality"],"limitations":["configuration sensitive result","close confidence ranges"],"whyRanked":"Rank #1: Net improvement 12.47%±1.54.","note":null},"deepLink":"https://lll.bz/llm?task=agents#agents"},{"taskId":"vision","taskTitle":"Image understanding","category":"image","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the current blind-preference vision leaderboard.","metricName":"Arena score","metricValue":"1312±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["visual prompt reasoning","strong vision preference"],"limitations":["preference not accuracy","benchmark coverage varies"],"whyRanked":"Rank #1: Arena score 1312±9.","note":null},"deepLink":"https://lll.bz/llm?task=vision#vision"},{"taskId":"ocr","taskTitle":"Text from image (OCR)","category":"image","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the current OCR-specific Arena preference slice.","metricName":"Arena score","metricValue":"1329±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["image text reading","strong ocr preference"],"limitations":["not character error","preference based metric"],"whyRanked":"Rank #1: Arena score 1329±9.","note":null},"deepLink":"https://lll.bz/llm?task=ocr#ocr"},{"taskId":"image-generation","taskTitle":"Image generation","category":"image","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","provider":"OpenAI","testedVariant":"High","subtitle":"Leads the selected live text-to-image preference leaderboard.","metricName":"Elo","metricValue":"1369","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["text image preference","current elo lead"],"limitations":["preference based metric","variant dependent score"],"whyRanked":"Rank #1: Elo 1369.","note":null},"deepLink":"https://lll.bz/llm?task=image-generation#image-generation"},{"taskId":"image-editing","taskTitle":"Image editing","category":"image","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","provider":"OpenAI","testedVariant":"Medium","subtitle":"Leads the image-editing preference board.","metricName":"Arena score","metricValue":"1463±4","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["instruction based editing","fresh arena lead"],"limitations":["cross arena disagreement","medium variant tested"],"whyRanked":"Rank #1: Arena score 1463±4.","note":null},"deepLink":"https://lll.bz/llm?task=image-editing#image-editing"},{"taskId":"text-to-video","taskTitle":"Text → video","category":"video","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","provider":"Alibaba","testedVariant":null,"subtitle":"Leads the selected live with-audio text-to-video table.","metricName":"Elo","metricValue":"1244","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["audio video generation","live arena lead"],"limitations":["mode dependent ranking","arena disagreement exists"],"whyRanked":"Rank #1: Elo 1244.","note":null},"deepLink":"https://lll.bz/llm?task=text-to-video#text-to-video"},{"taskId":"image-to-video","taskTitle":"Image → video","category":"video","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","provider":"Google","testedVariant":null,"subtitle":"Leads the selected no-audio image-to-video evaluation.","metricName":"Elo","metricValue":"1366","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["image animation quality","live arena lead"],"limitations":["audio excluded evaluation","arena order differs"],"whyRanked":"Rank #1: Elo 1366.","note":null},"deepLink":"https://lll.bz/llm?task=image-to-video#image-to-video"},{"taskId":"video-editing","taskTitle":"Video editing","category":"video","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","provider":"Alibaba","testedVariant":null,"subtitle":"Leads the selected live Artificial Analysis video-edit arena.","metricName":"Elo","metricValue":"1192","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["video edit preference","live arena lead"],"limitations":["major source disagreement","arena dependent ranking"],"whyRanked":"Rank #1: Elo 1192.","note":null},"deepLink":"https://lll.bz/llm?task=video-editing#video-editing"},{"taskId":"speech-to-text","taskTitle":"Speech to text","category":"audio","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","provider":"Alibaba","testedVariant":null,"subtitle":"Has the lowest displayed AA-WER on the selected non-streaming table.","metricName":"AA-WER","metricValue":"1.7%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":"preview","highlights":["lowest displayed wer","strong transcription accuracy"],"limitations":["preview model status","independent coverage thinner"],"whyRanked":"Rank #1: AA-WER 1.7%.","note":null},"deepLink":"https://lll.bz/llm?task=speech-to-text#speech-to-text"},{"taskId":"text-to-speech","taskTitle":"Text to speech","category":"audio","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"cartesia-sonic-3-6","modelName":"Cartesia Sonic 3.6","provider":"Cartesia","testedVariant":null,"subtitle":"Leads the selected provider-voice preference arena.","metricName":"Elo","metricValue":"1285","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://cartesia.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["natural speech preference","streaming voice quality"],"limitations":["single arena source","voice choice sensitive"],"whyRanked":"Rank #1: Elo 1285.","note":null},"deepLink":"https://lll.bz/llm?task=text-to-speech#text-to-speech"},{"taskId":"realtime-voice","taskTitle":"Voice agents","category":"audio","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"gemini-3-1-flash-live-preview","modelName":"Gemini 3.1 Flash Live Preview","provider":"Google","testedVariant":"Minimal","subtitle":"Has the highest distinct-model preference score in the live speech-agent arena.","metricName":"Elo","metricValue":"1046","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":"preview","highlights":["live conversational speech","strong agent preference"],"limitations":["preview model status","metric disagreement exists"],"whyRanked":"Rank #1: Elo 1046.","note":null},"deepLink":"https://lll.bz/llm?task=realtime-voice#realtime-voice"},{"taskId":"music","taskTitle":"Music generation","category":"audio","listId":"instrumental","listLabel":"Instrumental","model":{"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","provider":"Suno","testedVariant":null,"subtitle":"Leads the selected instrumental preference arena.","metricName":"Elo","metricValue":"1186","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://suno.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["instrumental music preference","current arena lead"],"limitations":["single evaluator source","independent replication missing"],"whyRanked":"Rank #1: Elo 1186.","note":null},"deepLink":"https://lll.bz/llm?task=music#music"},{"taskId":"translation","taskTitle":"Translation","category":"text","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"gemini","modelName":"Gemini","provider":"Google","testedVariant":null,"subtitle":"Ranks first for translation quality across the tested sample.","metricName":"AQI","metricValue":"77.7","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["multilingual translation quality","broad language coverage"],"limitations":["exact version undisclosed","awaiting wmt results"],"whyRanked":"Rank #1: AQI 77.7.","note":"The source does not disclose a single exact Gemini endpoint version for this aggregate family score."},"deepLink":"https://lll.bz/llm?task=translation#translation"},{"taskId":"data-analysis","taskTitle":"Data analysis and SQL","category":"code","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Leads the fresh Data & Analytics WebDev slice.","metricName":"Arena score","metricValue":"1614±30","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":"preliminary","highlights":["data app generation","analytics interface quality"],"limitations":["not sql execution","preliminary arena result"],"whyRanked":"Rank #1: Arena score 1614±30.","note":null},"deepLink":"https://lll.bz/llm?task=data-analysis#data-analysis"},{"taskId":"tool-calling","taskTitle":"Structured output and tool calling","category":"code","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"qwen3-7-max","modelName":"Qwen3.7 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Has the highest BFCL V4 score of the three.","metricName":"BFCL V4 score","metricValue":"75.0%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["function call accuracy","structured tool output"],"limitations":["mirror exposes score","tool schemas vary"],"whyRanked":"Rank #1: BFCL V4 score 75.0%.","note":null},"deepLink":"https://lll.bz/llm?task=tool-calling#tool-calling"},{"taskId":"voice-cloning","taskTitle":"Voice cloning","category":"audio","listId":"default","listLabel":"Top 3","model":{"rank":1,"modelId":"cartesia-sonic-3-6","modelName":"Cartesia Sonic 3.6","provider":"Cartesia","testedVariant":null,"subtitle":"Ranks first in the reported Controlled Voice arena update.","metricName":"Rank","metricValue":"1","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://cartesia.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["controlled voice cloning","streaming cloned speech"],"limitations":["independent reruns limited","rank only stored"],"whyRanked":"Rank #1: Rank 1.","note":null},"deepLink":"https://lll.bz/llm?task=voice-cloning#voice-cloning"}],"tasks":[{"id":"chat","title":"General chat","description":"For broad conversational quality across everyday prompts.","category":"text","deepLink":"https://lll.bz/llm?task=chat#chat","metricName":"Arena score","metricHint":null,"note":"The primary ranking is a blind-preference arena; confidence intervals overlap.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks first in the current broad text preference arena.","metricName":"Arena score","metricValue":"1508±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["broad chat preference","strong user ratings"],"limitations":["overlapping confidence intervals","preference not accuracy"],"whyRanked":"It holds the highest score in the broad text preference arena.","note":null},{"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":"High","subtitle":"A near-tied option for broad conversational prompts.","metricName":"Arena score","metricValue":"1504±4","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["broad conversation quality","stable arena score"],"limitations":["close statistical tie","high effort tested"],"whyRanked":"Rank #2: Arena score 1504±4.","note":null},{"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","provider":"Anthropic","testedVariant":"High","subtitle":"Places inside the same tightly clustered chat tier.","metricName":"Arena score","metricValue":"1502±4","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["broad prompt handling","competitive preference score"],"limitations":["close statistical tie","high effort tested"],"whyRanked":"Rank #3: Arena score 1502±4.","note":null}]}]},{"id":"russian","title":"Russian language","description":"For Russian-language conversation and writing.","category":"text","deepLink":"https://lll.bz/llm?task=russian#russian","metricName":"Arena score","metricHint":null,"note":"Fresh primary data exists, but three independent Russian-specific sources reproducing the full top three were not found.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the current Russian-language Arena slice.","metricName":"Arena score","metricValue":"1518±13","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["russian chat preference","current arena lead"],"limitations":["wide confidence interval","limited source convergence"],"whyRanked":"Rank #1: Arena score 1518±13.","note":null},{"rank":2,"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","provider":"Google","testedVariant":"High","subtitle":"Scores effectively level with the current leader in Russian.","metricName":"Arena score","metricValue":"1517±24","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":"preliminary","highlights":["strong russian preference","near leader score"],"limitations":["preliminary arena result","wide confidence interval"],"whyRanked":"Rank #2: Arena score 1517±24.","note":"Practically tied with Claude Fable 5 within the reported intervals."},{"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":null,"subtitle":"Remains inside the leading Russian preference cluster.","metricName":"Arena score","metricValue":"1509±8","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["russian prompt quality","stable arena placement"],"limitations":["source convergence weak","preference based metric"],"whyRanked":"Rank #3: Arena score 1509±8.","note":null}]}]},{"id":"expert","title":"Expert analysis","description":"For difficult analytical and professional knowledge tasks.","category":"text","deepLink":"https://lll.bz/llm?task=expert#expert","metricName":"Arena score","metricHint":null,"note":"The top three intervals overlap, so the exact order is not statistically decisive.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Has the highest current score on expert-oriented Arena prompts.","metricName":"Arena score","metricValue":"1548±12","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["expert prompt preference","strong reasoning results"],"limitations":["overlapping confidence intervals","benchmark sensitive order"],"whyRanked":"Rank #1: Arena score 1548±12.","note":null},{"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":"High","subtitle":"Scores essentially level with first place on expert prompts.","metricName":"Arena score","metricValue":"1546±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["complex prompt handling","high expert preference"],"limitations":["close statistical tie","high effort tested"],"whyRanked":"Rank #2: Arena score 1546±9.","note":null},{"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"High","subtitle":"Places in the leading cluster for specialist analysis.","metricName":"Arena score","metricValue":"1541±12","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["complex analytical prompts","strong knowledge work"],"limitations":["overlapping confidence intervals","high effort tested"],"whyRanked":"Rank #3: Arena score 1541±12.","note":null}]}]},{"id":"math","title":"Mathematics","description":"For hard calculations, proofs and multi-step maths.","category":"text","deepLink":"https://lll.bz/llm?task=math#math","metricName":"Arena score","metricHint":null,"note":"All three reported confidence intervals overlap materially.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Has the highest displayed score in the current Math Arena slice.","metricName":"Arena score","metricValue":"1545±24","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["hard math prompts","multi-step reasoning"],"limitations":["wide confidence interval","max effort tested"],"whyRanked":"Rank #1: Arena score 1545±24.","note":null},{"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks inside the same leading hard-math cluster.","metricName":"Arena score","metricValue":"1528±17","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["strong math reasoning","competitive proof solving"],"limitations":["overlapping confidence interval","prompt mix sensitive"],"whyRanked":"Rank #2: Arena score 1528±17.","note":null},{"rank":3,"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","provider":"Google","testedVariant":"High","subtitle":"Posts a near-tied preliminary score on difficult mathematics.","metricName":"Arena score","metricValue":"1523±33","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":"preliminary","highlights":["competitive math score","multi-step problem solving"],"limitations":["preliminary arena result","wide confidence interval"],"whyRanked":"Rank #3: Arena score 1523±33.","note":null}]}]},{"id":"instructions","title":"Instruction following","description":"For prompts with detailed constraints and required formats.","category":"text","deepLink":"https://lll.bz/llm?task=instructions#instructions","metricName":"Arena score","metricHint":null,"note":"First and second are practically tied within the reported intervals.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":"High","subtitle":"Edges the current instruction-following Arena by displayed score.","metricName":"Arena score","metricValue":"1514±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["constraint following quality","structured prompt handling"],"limitations":["near statistical tie","high effort tested"],"whyRanked":"Rank #1: Arena score 1514±5.","note":null},{"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Scores effectively level with first place on constrained prompts.","metricName":"Arena score","metricValue":"1512±7","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["complex constraint handling","strong prompt adherence"],"limitations":["near statistical tie","preference based score"],"whyRanked":"Rank #2: Arena score 1512±7.","note":null},{"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","provider":"Anthropic","testedVariant":"High","subtitle":"Maintains a high preference score on detailed instructions.","metricName":"Arena score","metricValue":"1503±6","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["detailed prompt handling","format constraint adherence"],"limitations":["high effort tested","preference based score"],"whyRanked":"Rank #3: Arena score 1503±6.","note":null}]}]},{"id":"writing","title":"Copywriting","description":"For persuasive, creative and polished marketing text.","category":"text","deepLink":"https://lll.bz/llm?task=writing#writing","metricName":"Arena score","metricHint":null,"note":"The source measures blind writing preference, not measured conversion performance.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks first on current blind creative-writing preference.","metricName":"Arena score","metricValue":"1508±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["creative writing preference","natural prose quality"],"limitations":["not conversion tested","preference based metric"],"whyRanked":"Rank #1: Arena score 1508±9.","note":null},{"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":"High","subtitle":"Scores close to first place for creative prose.","metricName":"Arena score","metricValue":"1499±7","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["polished longform prose","strong writing preference"],"limitations":["not conversion tested","high effort tested"],"whyRanked":"Rank #2: Arena score 1499±7.","note":null},{"rank":3,"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","provider":"Google","testedVariant":"High","subtitle":"Places in the current leading creative-writing cluster.","metricName":"Arena score","metricValue":"1493±18","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":"preliminary","highlights":["creative prompt handling","competitive writing preference"],"limitations":["preliminary arena result","not conversion tested"],"whyRanked":"Rank #3: Arena score 1493±18.","note":null}]}]},{"id":"research","title":"Search and research","description":"For web search, evidence gathering and sourced answers.","category":"text","deepLink":"https://lll.bz/llm?task=research#research","metricName":"Arena score","metricHint":null,"note":"The dedicated search board updates slower than the ten-day rebuild cycle.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-4-6-search","modelName":"Claude Opus 4.6 Search","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the dedicated search-and-retrieval board.","metricName":"Arena score","metricValue":"1253±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["search answer preference","web retrieval workflow"],"limitations":["stale arena snapshot","benchmark disagreement exists"],"whyRanked":"Rank #1: Arena score 1253±5.","note":null},{"rank":2,"modelId":"gpt-5-5-search","modelName":"GPT-5.5 Search","provider":"OpenAI","testedVariant":null,"subtitle":"Places second on the same search board.","metricName":"Arena score","metricValue":"1240±5","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["search focused responses","strong arena preference"],"limitations":["stale arena snapshot","retrieval metrics differ"],"whyRanked":"Rank #2: Arena score 1240±5.","note":null},{"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Completes the leading trio for search tasks.","metricName":"Arena score","metricValue":"1237±8","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["search answer quality","broad research reasoning"],"limitations":["stale arena snapshot","source convergence weak"],"whyRanked":"Rank #3: Arena score 1237±8.","note":null}]}]},{"id":"documents","title":"PDF and documents","description":"For understanding long documents, PDFs and mixed document content.","category":"text","deepLink":"https://lll.bz/llm?task=documents#documents","metricName":"Arena score","metricHint":null,"note":"The document board updates slower than the ten-day cycle; duplicate Claude Opus 4.6 configurations are collapsed into one entry.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"High","subtitle":"Leads the dedicated document-handling board.","metricName":"Arena score","metricValue":"1520±15","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["document prompt preference","long context reasoning"],"limitations":["stale arena snapshot","limited independent replication"],"whyRanked":"Rank #1: Arena score 1520±15.","note":null},{"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks second after collapsing duplicate configurations.","metricName":"Arena score","metricValue":"1510±6","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["document understanding quality","stable arena score"],"limitations":["stale arena snapshot","duplicate configs removed"],"whyRanked":"Rank #2: Arena score 1510±6.","note":null},{"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Becomes third after enforcing one configuration per base model.","metricName":"Arena score","metricValue":"1504±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["document comprehension quality","long prompt handling"],"limitations":["stale arena snapshot","limited external replication"],"whyRanked":"Rank #3: Arena score 1504±9.","note":null}]}]},{"id":"coding","title":"Programming","description":"For repository work, terminal coding and software engineering.","category":"code","deepLink":"https://lll.bz/llm?task=coding#coding","metricName":"Terminal-Bench score","metricHint":null,"note":"Terminal-Bench measures agentic terminal coding; SWE-bench and Code Arena measure different coding workloads.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Has the highest reported Terminal-Bench result of the three.","metricName":"Terminal-Bench score","metricValue":"89.1%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["agentic terminal coding","repository task solving"],"limitations":["max effort tested","benchmark harness sensitive"],"whyRanked":"Rank #1: Terminal-Bench score 89.1%.","note":null},{"rank":2,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","provider":"OpenAI","testedVariant":null,"subtitle":"Trails the reported leader by three tenths of a point.","metricName":"Terminal-Bench score","metricValue":"88.8%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["agentic coding tasks","terminal workflow quality"],"limitations":["tiny score gap","harness sensitive ranking"],"whyRanked":"Rank #2: Terminal-Bench score 88.8%.","note":"Practically tied with first place at the displayed precision."},{"rank":3,"modelId":"grok-4-6","modelName":"Grok 4.6","provider":"xAI","testedVariant":null,"subtitle":"Places inside the same tightly grouped Terminal-Bench frontier.","metricName":"Terminal-Bench score","metricValue":"88.4%","pricing":null,"pricingCta":null,"context":null,"maxOutput":null,"status":null,"highlights":["terminal task solving","competitive coding score"],"limitations":["tiny score gap","benchmark specific result"],"whyRanked":"Rank #3: Terminal-Bench score 88.4%.","note":null}]}]},{"id":"webdev","title":"Web development","description":"For building and editing interactive web interfaces.","category":"code","deepLink":"https://lll.bz/llm?task=webdev#webdev","metricName":"Arena score","metricHint":null,"note":"The ranking measures blind preference over generated web applications.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Leads the current WebDev Arena by displayed score.","metricName":"Arena score","metricValue":"1691±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["web interface generation","strong user preference"],"limitations":["max effort tested","preference based metric"],"whyRanked":"Rank #1: Arena score 1691±9.","note":null},{"rank":2,"modelId":"kimi-k3-max","modelName":"Kimi K3 Max","provider":"Moonshot AI","testedVariant":null,"subtitle":"Places second on blind evaluation of generated web applications.","metricName":"Arena score","metricValue":"1674±11","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://platform.moonshot.ai/docs/pricing/chat"},"context":null,"maxOutput":null,"status":null,"highlights":["frontend generation quality","competitive arena score"],"limitations":["close second tier","preference based metric"],"whyRanked":"Rank #2: Arena score 1674±11.","note":null},{"rank":3,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Places close behind second in the current WebDev Arena.","metricName":"Arena score","metricValue":"1669±13","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":"preliminary","highlights":["web app generation","competitive frontend preference"],"limitations":["preliminary arena result","close confidence interval"],"whyRanked":"Rank #3: Arena score 1669±13.","note":null}]}]},{"id":"agents","title":"AI agents","description":"For autonomous multi-step work with tools and external environments.","category":"code","deepLink":"https://lll.bz/llm?task=agents#agents","metricName":"Net improvement","metricHint":"Higher net improvement is better.","note":"Claude Opus 5 Max is omitted because it is another configuration of the same base model.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"High","subtitle":"Has the highest distinct-base-model result in the current Agent Arena.","metricName":"Net improvement","metricValue":"12.47%±1.54","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["multi-step agent work","tool workflow quality"],"limitations":["configuration sensitive result","close confidence ranges"],"whyRanked":"Rank #1: Net improvement 12.47%±1.54.","note":null},{"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":"High","subtitle":"Ranks second after collapsing duplicate Opus 5 configurations.","metricName":"Net improvement","metricValue":"11.57%±1.70","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["agent task execution","multi-step tool use"],"limitations":["overlapping confidence interval","high effort tested"],"whyRanked":"Rank #2: Net improvement 11.57%±1.70.","note":null},{"rank":3,"modelId":"kimi-k3-max","modelName":"Kimi K3 Max","provider":"Moonshot AI","testedVariant":null,"subtitle":"Is the next distinct base model in the Agent Arena ranking.","metricName":"Net improvement","metricValue":"10.41%±0.62","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://platform.moonshot.ai/docs/pricing/chat"},"context":null,"maxOutput":null,"status":null,"highlights":["agentic workflow quality","tool task execution"],"limitations":["lower displayed gain","arena specific workflow"],"whyRanked":"Rank #3: Net improvement 10.41%±0.62.","note":null}]}]},{"id":"vision","title":"Image understanding","description":"For reasoning about photos, diagrams and visual content.","category":"image","deepLink":"https://lll.bz/llm?task=vision#vision","metricName":"Arena score","metricHint":null,"note":"Second and third are practically tied within the reported intervals.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the current blind-preference vision leaderboard.","metricName":"Arena score","metricValue":"1312±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["visual prompt reasoning","strong vision preference"],"limitations":["preference not accuracy","benchmark coverage varies"],"whyRanked":"Rank #1: Arena score 1312±9.","note":null},{"rank":2,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Places narrowly ahead of third on mixed visual prompts.","metricName":"Arena score","metricValue":"1302±8","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["mixed image reasoning","competitive vision score"],"limitations":["near statistical tie","preference based metric"],"whyRanked":"Rank #2: Arena score 1302±8.","note":null},{"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","provider":"Anthropic","testedVariant":"High","subtitle":"Scores effectively level with second place on visual prompts.","metricName":"Arena score","metricValue":"1301±7","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["visual reasoning quality","strong multimodal preference"],"limitations":["near statistical tie","high effort tested"],"whyRanked":"Rank #3: Arena score 1301±7.","note":null}]}]},{"id":"ocr","title":"Text from image (OCR)","description":"For reading text embedded in images and scanned content.","category":"image","deepLink":"https://lll.bz/llm?task=ocr#ocr","metricName":"Arena score","metricHint":null,"note":"OCR Arena is preference-based rather than a character-error-rate benchmark.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","provider":"Anthropic","testedVariant":null,"subtitle":"Leads the current OCR-specific Arena preference slice.","metricName":"Arena score","metricValue":"1329±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["image text reading","strong ocr preference"],"limitations":["not character error","preference based metric"],"whyRanked":"Rank #1: Arena score 1329±9.","note":null},{"rank":2,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Places second on OCR-oriented visual prompts.","metricName":"Arena score","metricValue":"1317±9","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["visual text extraction","competitive ocr preference"],"limitations":["not extraction accuracy","benchmark coverage limited"],"whyRanked":"Rank #2: Arena score 1317±9.","note":null},{"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","provider":"Anthropic","testedVariant":null,"subtitle":"Completes the current leading OCR preference cluster.","metricName":"Arena score","metricValue":"1314±7","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["image text reasoning","stable ocr preference"],"limitations":["not character error","close second tier"],"whyRanked":"Rank #3: Arena score 1314±7.","note":null}]}]},{"id":"image-generation","title":"Image generation","description":"For generating images from natural-language prompts.","category":"image","deepLink":"https://lll.bz/llm?task=image-generation#image-generation","metricName":"Elo","metricHint":null,"note":"Second and third differ by one displayed Elo point.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","provider":"OpenAI","testedVariant":"High","subtitle":"Leads the selected live text-to-image preference leaderboard.","metricName":"Elo","metricValue":"1369","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["text image preference","current elo lead"],"limitations":["preference based metric","variant dependent score"],"whyRanked":"Rank #1: Elo 1369.","note":null},{"rank":2,"modelId":"reve-2-1","modelName":"Reve 2.1","provider":"Reve","testedVariant":null,"subtitle":"Places second on the selected live image arena.","metricName":"Elo","metricValue":"1321","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://reve.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["prompt image quality","strong arena preference"],"limitations":["one point margin","arena dependent order"],"whyRanked":"Rank #2: Elo 1321.","note":null},{"rank":3,"modelId":"nano-banana-2","modelName":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","provider":"Google","testedVariant":null,"subtitle":"Scores one Elo point behind second on the selected live board.","metricName":"Elo","metricValue":"1320","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":"preview","highlights":["prompt image generation","competitive arena score"],"limitations":["preview model status","one point margin"],"whyRanked":"Rank #3: Elo 1320.","note":"Practically tied with Reve 2.1 at the displayed precision."}]}]},{"id":"image-editing","title":"Image editing","description":"For editing existing images from text instructions.","category":"image","deepLink":"https://lll.bz/llm?task=image-editing#image-editing","metricName":"Arena score","metricHint":null,"note":"The two major public image-edit arenas currently disagree materially.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","provider":"OpenAI","testedVariant":"Medium","subtitle":"Leads the image-editing preference board.","metricName":"Arena score","metricValue":"1463±4","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["instruction based editing","fresh arena lead"],"limitations":["cross arena disagreement","medium variant tested"],"whyRanked":"Rank #1: Arena score 1463±4.","note":null},{"rank":2,"modelId":"grok-imagine-image-2-0","modelName":"Grok Imagine Image 2.0","provider":"xAI","testedVariant":"Low","subtitle":"Places second on the selected fresh image-edit arena.","metricName":"Arena score","metricValue":"1439±8","pricing":null,"pricingCta":null,"context":null,"maxOutput":null,"status":"preliminary","highlights":["image edit preference","strong arena placement"],"limitations":["preliminary arena result","cross arena disagreement"],"whyRanked":"Rank #2: Arena score 1439±8.","note":null},{"rank":3,"modelId":"mai-image-2-6-preview","modelName":"MAI-Image-2.6 Preview","provider":"Microsoft AI","testedVariant":null,"subtitle":"Ranks third on the same image-editing board.","metricName":"Arena score","metricValue":"1420±8","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://azure.microsoft.com/en-us/pricing/details/ai-foundry/"},"context":null,"maxOutput":null,"status":"preview","highlights":["instruction image editing","competitive arena score"],"limitations":["preview model status","cross arena disagreement"],"whyRanked":"Rank #3: Arena score 1420±8.","note":null}]}]},{"id":"text-to-video","title":"Text → video","description":"For generating complete videos from text prompts.","category":"video","deepLink":"https://lll.bz/llm?task=text-to-video#text-to-video","metricName":"Elo","metricHint":null,"note":"This ranking uses the with-audio table; the no-audio table has a different order.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","provider":"Alibaba","testedVariant":null,"subtitle":"Leads the selected live with-audio text-to-video table.","metricName":"Elo","metricValue":"1244","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["audio video generation","live arena lead"],"limitations":["mode dependent ranking","arena disagreement exists"],"whyRanked":"Rank #1: Elo 1244.","note":null},{"rank":2,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","provider":"Google","testedVariant":null,"subtitle":"Places second when native audio is included in evaluation.","metricName":"Elo","metricValue":"1238","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["native audio video","strong video preference"],"limitations":["mode dependent ranking","arena order differs"],"whyRanked":"Rank #2: Elo 1238.","note":null},{"rank":3,"modelId":"minimax-h3","modelName":"MiniMax H3","provider":"MiniMax","testedVariant":null,"subtitle":"Completes the selected with-audio text-to-video top three.","metricName":"Elo","metricValue":"1228","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://platform.minimax.io/docs/guides/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["text video generation","competitive audio video"],"limitations":["mode dependent ranking","source order differs"],"whyRanked":"Rank #3: Elo 1228.","note":null}]}]},{"id":"image-to-video","title":"Image → video","description":"For animating a still image into a generated video.","category":"video","deepLink":"https://lll.bz/llm?task=image-to-video#image-to-video","metricName":"Elo","metricHint":null,"note":"The selected ranking uses the no-audio table to isolate visual animation quality.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","provider":"Google","testedVariant":null,"subtitle":"Leads the selected no-audio image-to-video evaluation.","metricName":"Elo","metricValue":"1366","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["image animation quality","live arena lead"],"limitations":["audio excluded evaluation","arena order differs"],"whyRanked":"Rank #1: Elo 1366.","note":null},{"rank":2,"modelId":"minimax-h3","modelName":"MiniMax H3","provider":"MiniMax","testedVariant":null,"subtitle":"Places second on the selected visual-only image animation table.","metricName":"Elo","metricValue":"1346","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://platform.minimax.io/docs/guides/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["still image animation","strong video preference"],"limitations":["audio excluded evaluation","cross arena disagreement"],"whyRanked":"Rank #2: Elo 1346.","note":null},{"rank":3,"modelId":"dreamina-seedance-2-0","modelName":"Dreamina Seedance 2.0","provider":"ByteDance","testedVariant":"720p","subtitle":"Ranks third on the selected no-audio image-to-video table.","metricName":"Elo","metricValue":"1337","pricing":null,"pricingCta":null,"context":null,"maxOutput":null,"status":null,"highlights":["image motion generation","competitive video quality"],"limitations":["audio excluded evaluation","720p variant tested"],"whyRanked":"Rank #3: Elo 1337.","note":null}]}]},{"id":"video-editing","title":"Video editing","description":"For instruction-driven edits and transformations of existing video.","category":"video","deepLink":"https://lll.bz/llm?task=video-editing#video-editing","metricName":"Elo","metricHint":null,"note":"The two public video-edit arenas currently disagree on first place.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","provider":"Alibaba","testedVariant":null,"subtitle":"Leads the selected live Artificial Analysis video-edit arena.","metricName":"Elo","metricValue":"1192","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["video edit preference","live arena lead"],"limitations":["major source disagreement","arena dependent ranking"],"whyRanked":"Rank #1: Elo 1192.","note":null},{"rank":2,"modelId":"minimax-h3","modelName":"MiniMax H3","provider":"MiniMax","testedVariant":null,"subtitle":"Places second on the selected live video-edit table.","metricName":"Elo","metricValue":"1130","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://platform.minimax.io/docs/guides/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["video transformation quality","strong editing preference"],"limitations":["source dependent order","arena preference metric"],"whyRanked":"Rank #2: Elo 1130.","note":null},{"rank":3,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","provider":"Google","testedVariant":null,"subtitle":"Completes the selected live video-editing top three.","metricName":"Elo","metricValue":"1125","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["video editing quality","multimodal edit workflow"],"limitations":["source dependent order","small second gap"],"whyRanked":"Rank #3: Elo 1125.","note":null}]}]},{"id":"speech-to-text","title":"Speech to text","description":"For transcribing spoken audio into text.","category":"audio","deepLink":"https://lll.bz/llm?task=speech-to-text#speech-to-text","metricName":"AA-WER","metricHint":"Lower WER is better.","note":null,"rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","provider":"Alibaba","testedVariant":null,"subtitle":"Has the lowest displayed AA-WER on the selected non-streaming table.","metricName":"AA-WER","metricValue":"1.7%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":"preview","highlights":["lowest displayed wer","strong transcription accuracy"],"limitations":["preview model status","independent coverage thinner"],"whyRanked":"Rank #1: AA-WER 1.7%.","note":null},{"rank":2,"modelId":"elevenlabs-scribe-v2","modelName":"ElevenLabs Scribe v2","provider":"ElevenLabs","testedVariant":null,"subtitle":"Places second on the selected composite transcription error metric.","metricName":"AA-WER","metricValue":"2.2%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://elevenlabs.io/pricing/api"},"context":null,"maxOutput":null,"status":null,"highlights":["low transcription error","broad speech recognition"],"limitations":["higher wer than leader","aggregate dataset metric"],"whyRanked":"Rank #2: AA-WER 2.2%.","note":null},{"rank":3,"modelId":"mai-transcribe-1-5","modelName":"MAI-Transcribe-1.5","provider":"Microsoft AI","testedVariant":null,"subtitle":"Places third on the selected non-streaming speech benchmark.","metricName":"AA-WER","metricValue":"2.4%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://azure.microsoft.com/en-us/pricing/details/ai-foundry/"},"context":null,"maxOutput":null,"status":null,"highlights":["low speech error","strong accuracy latency"],"limitations":["higher wer than leaders","aggregate benchmark score"],"whyRanked":"Rank #3: AA-WER 2.4%.","note":null}]}]},{"id":"text-to-speech","title":"Text to speech","description":"For generating natural spoken audio from text.","category":"audio","deepLink":"https://lll.bz/llm?task=text-to-speech#text-to-speech","metricName":"Elo","metricHint":null,"note":"Second and third have the same displayed Elo score.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"cartesia-sonic-3-6","modelName":"Cartesia Sonic 3.6","provider":"Cartesia","testedVariant":null,"subtitle":"Leads the selected provider-voice preference arena.","metricName":"Elo","metricValue":"1285","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://cartesia.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["natural speech preference","streaming voice quality"],"limitations":["single arena source","voice choice sensitive"],"whyRanked":"Rank #1: Elo 1285.","note":null},{"rank":2,"modelId":"qwen-audio-3-0-tts-plus","modelName":"Qwen-Audio-3.0-TTS-Plus","provider":"Alibaba","testedVariant":null,"subtitle":"Shares the second displayed Elo tier on provider voices.","metricName":"Elo","metricValue":"1240","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["natural voice generation","competitive speech preference"],"limitations":["tied displayed score","single arena source"],"whyRanked":"Rank #2: Elo 1240.","note":null},{"rank":3,"modelId":"speechify-simba-3-2","modelName":"SpeechifyAI Simba 3.2","provider":"Speechify","testedVariant":null,"subtitle":"Shares the same displayed Elo as second place.","metricName":"Elo","metricValue":"1240","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://speechify.com/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["natural speech generation","strong provider voices"],"limitations":["tied displayed score","single arena source"],"whyRanked":"Rank #3: Elo 1240.","note":"Practically tied with Qwen-Audio-3.0-TTS-Plus at the displayed precision."}]}]},{"id":"realtime-voice","title":"Voice agents","description":"For real-time spoken conversation with an interactive AI agent.","category":"audio","deepLink":"https://lll.bz/llm?task=realtime-voice#realtime-voice","metricName":"Elo","metricHint":null,"note":"Duplicate effort settings of Gemini 3.1 Flash Live were collapsed to the best configuration.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"gemini-3-1-flash-live-preview","modelName":"Gemini 3.1 Flash Live Preview","provider":"Google","testedVariant":"Minimal","subtitle":"Has the highest distinct-model preference score in the live speech-agent arena.","metricName":"Elo","metricValue":"1046","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":"preview","highlights":["live conversational speech","strong agent preference"],"limitations":["preview model status","metric disagreement exists"],"whyRanked":"Rank #1: Elo 1046.","note":null},{"rank":2,"modelId":"gpt-realtime-1-5","modelName":"GPT-Realtime-1.5","provider":"OpenAI","testedVariant":null,"subtitle":"Is the next distinct current system after collapsing duplicate Gemini modes.","metricName":"Elo","metricValue":"1000","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["realtime spoken dialogue","interactive voice workflow"],"limitations":["lower preference score","objective metrics differ"],"whyRanked":"Rank #2: Elo 1000.","note":null},{"rank":3,"modelId":"elevenlabs-agents","modelName":"ElevenLabs Agents","provider":"ElevenLabs","testedVariant":null,"subtitle":"Is the next distinct current voice-agent system on the selected arena.","metricName":"Elo","metricValue":"937","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://elevenlabs.io/pricing/api"},"context":null,"maxOutput":null,"status":null,"highlights":["voice agent platform","realtime spoken interaction"],"limitations":["lower arena elo","system level comparison"],"whyRanked":"Rank #3: Elo 937.","note":null}]}]},{"id":"music","title":"Music generation","description":"For generating complete instrumental or vocal music.","category":"audio","deepLink":"https://lll.bz/llm?task=music#music","metricName":"Elo","metricHint":null,"note":"Task-level models mirror the instrumental variant. Only one specialized evaluator covers this area, so treat the order as indicative.","rankingLists":[{"id":"instrumental","label":"Instrumental","models":[{"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","provider":"Suno","testedVariant":null,"subtitle":"Leads the selected instrumental preference arena.","metricName":"Elo","metricValue":"1186","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://suno.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["instrumental music preference","current arena lead"],"limitations":["single evaluator source","independent replication missing"],"whyRanked":"Rank #1: Elo 1186.","note":null},{"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","provider":"Mureka","testedVariant":null,"subtitle":"Places second on instrumental music preference.","metricName":"Elo","metricValue":"1174","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.mureka.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["instrumental generation quality","strong music preference"],"limitations":["single evaluator source","independent replication missing"],"whyRanked":"Rank #2: Elo 1174.","note":null},{"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","provider":"Mureka","testedVariant":null,"subtitle":"Ranks third on instrumental music preference.","metricName":"Elo","metricValue":"1166","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.mureka.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["instrumental music quality","competitive arena score"],"limitations":["single evaluator source","older model version"],"whyRanked":"Rank #3: Elo 1166.","note":null}]},{"id":"vocals","label":"Vocals","models":[{"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","provider":"Suno","testedVariant":null,"subtitle":"Leads the selected vocal-music preference arena.","metricName":"Elo","metricValue":"1169","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://suno.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["vocal music preference","current arena lead"],"limitations":["single evaluator source","independent replication missing"],"whyRanked":"Rank #1: Elo 1169.","note":null},{"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","provider":"Mureka","testedVariant":null,"subtitle":"Places second on the selected vocal-music arena.","metricName":"Elo","metricValue":"1154","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.mureka.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["vocal generation quality","strong music preference"],"limitations":["single evaluator source","independent replication missing"],"whyRanked":"Rank #2: Elo 1154.","note":null},{"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","provider":"Mureka","testedVariant":null,"subtitle":"Ranks third on the selected vocal-music arena.","metricName":"Elo","metricValue":"1138","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.mureka.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["vocal music generation","competitive arena score"],"limitations":["single evaluator source","older model version"],"whyRanked":"Rank #3: Elo 1138.","note":null}]}]},{"id":"translation","title":"Translation","description":"For translating text accurately between languages.","category":"text","deepLink":"https://lll.bz/llm?task=translation#translation","metricName":"AQI","metricHint":null,"note":"Measured by model family rather than exact version: the evaluation reports Gemini, Claude and GPT as families, so read this as a family-level ranking.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"gemini","modelName":"Gemini","provider":"Google","testedVariant":null,"subtitle":"Ranks first for translation quality across the tested sample.","metricName":"AQI","metricValue":"77.7","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://ai.google.dev/gemini-api/docs/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["multilingual translation quality","broad language coverage"],"limitations":["exact version undisclosed","awaiting wmt results"],"whyRanked":"Rank #1: AQI 77.7.","note":"The source does not disclose a single exact Gemini endpoint version for this aggregate family score."},{"rank":2,"modelId":"claude","modelName":"Claude","provider":"Anthropic","testedVariant":null,"subtitle":"Ranks second across the same translation sample.","metricName":"AQI","metricValue":"75.6","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["multilingual translation quality","broad project coverage"],"limitations":["exact version undisclosed","awaiting wmt results"],"whyRanked":"Rank #2: AQI 75.6.","note":"The source does not disclose a single exact Claude endpoint version for this aggregate family score."},{"rank":3,"modelId":"gpt","modelName":"GPT","provider":"OpenAI","testedVariant":null,"subtitle":"Ranks third across the same translation sample.","metricName":"AQI","metricValue":"73.1","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://openai.com/api/pricing/"},"context":null,"maxOutput":null,"status":null,"highlights":["multilingual translation coverage","broad language testing"],"limitations":["exact version undisclosed","awaiting wmt results"],"whyRanked":"Rank #3: AQI 73.1.","note":"The source does not disclose a single exact GPT endpoint version for this aggregate family score."}]}]},{"id":"data-analysis","title":"Data analysis and SQL","description":"For tables, CSV analysis, SQL generation and data-driven conclusions.","category":"code","deepLink":"https://lll.bz/llm?task=data-analysis#data-analysis","metricName":"Arena score","metricHint":null,"note":"The fresh source measures data-oriented web applications, not normalized text-to-SQL execution accuracy. BIRD and Spider2 did not yield a clean current raw-model top three that could be reconciled with this board.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Leads the fresh Data & Analytics WebDev slice.","metricName":"Arena score","metricValue":"1614±30","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":"preliminary","highlights":["data app generation","analytics interface quality"],"limitations":["not sql execution","preliminary arena result"],"whyRanked":"Rank #1: Arena score 1614±30.","note":null},{"rank":2,"modelId":"claude-opus-5","modelName":"Claude Opus 5","provider":"Anthropic","testedVariant":"Max","subtitle":"Places effectively level with first on data-oriented web tasks.","metricName":"Arena score","metricValue":"1612±16","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.anthropic.com/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["data workflow generation","analytical app building"],"limitations":["not sql execution","max effort tested"],"whyRanked":"Rank #2: Arena score 1612±16.","note":"Practically tied with Qwen3.8 Max within the reported intervals."},{"rank":3,"modelId":"kimi-k3-max","modelName":"Kimi K3 Max","provider":"Moonshot AI","testedVariant":null,"subtitle":"Completes the leading Data & Analytics WebDev cluster.","metricName":"Arena score","metricValue":"1600±22","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://platform.moonshot.ai/docs/pricing/chat"},"context":null,"maxOutput":null,"status":null,"highlights":["data app generation","analytics workflow quality"],"limitations":["not sql execution","source convergence missing"],"whyRanked":"Rank #3: Arena score 1600±22.","note":null}]}]},{"id":"tool-calling","title":"Structured output and tool calling","description":"For reliable function calls, JSON arguments and structured tool use.","category":"code","deepLink":"https://lll.bz/llm?task=tool-calling#tool-calling","metricName":"BFCL V4 score","metricHint":null,"note":"Scores come from the Berkeley function-calling benchmark. Tool schemas differ between providers, so narrow gaps here mean little in practice.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"qwen3-7-max","modelName":"Qwen3.7 Max","provider":"Alibaba","testedVariant":null,"subtitle":"Has the highest BFCL V4 score of the three.","metricName":"BFCL V4 score","metricValue":"75.0%","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://www.alibabacloud.com/help/en/model-studio/model-pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["function call accuracy","structured tool output"],"limitations":["mirror exposes score","tool schemas vary"],"whyRanked":"Rank #1: BFCL V4 score 75.0%.","note":null},{"rank":2,"modelId":"btl-4","modelName":"BTL-4","provider":"Bad Theory Labs","testedVariant":null,"subtitle":"Places second on the captured BFCL V4 score view.","metricName":"BFCL V4 score","metricValue":"73.5%","pricing":null,"pricingCta":null,"context":null,"maxOutput":null,"status":null,"highlights":["function call reliability","structured argument handling"],"limitations":["pricing not captured","public availability unclear"],"whyRanked":"Rank #2: BFCL V4 score 73.5%.","note":"A provider pricing page was not reliably captured."},{"rank":3,"modelId":"ling-3-0-flash","modelName":"Ling 3.0 Flash","provider":"InclusionAI","testedVariant":null,"subtitle":"Places third on the captured BFCL V4 score view.","metricName":"BFCL V4 score","metricValue":"73.0%","pricing":null,"pricingCta":null,"context":null,"maxOutput":null,"status":null,"highlights":["function call accuracy","json argument handling"],"limitations":["pricing not captured","narrow score margin"],"whyRanked":"Rank #3: BFCL V4 score 73.0%.","note":"A provider pricing page was not reliably captured."}]}]},{"id":"voice-cloning","title":"Voice cloning","description":"For reproducing a speaker's voice from a short reference sample.","category":"audio","deepLink":"https://lll.bz/llm?task=voice-cloning#voice-cloning","metricName":"Rank","metricHint":"Lower rank is better.","note":"The order comes from a single controlled-voice comparison, so only the ranking is stored, not exact scores.","rankingLists":[{"id":"default","label":"Top 3","models":[{"rank":1,"modelId":"cartesia-sonic-3-6","modelName":"Cartesia Sonic 3.6","provider":"Cartesia","testedVariant":null,"subtitle":"Ranks first in the reported Controlled Voice arena update.","metricName":"Rank","metricValue":"1","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://cartesia.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["controlled voice cloning","streaming cloned speech"],"limitations":["independent reruns limited","rank only stored"],"whyRanked":"Rank #1: Rank 1.","note":null},{"rank":2,"modelId":"cartesia-sonic-3-5","modelName":"Cartesia Sonic 3.5","provider":"Cartesia","testedVariant":null,"subtitle":"Ranks second in the reported Controlled Voice update.","metricName":"Rank","metricValue":"2","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://cartesia.ai/pricing"},"context":null,"maxOutput":null,"status":null,"highlights":["controlled voice cloning","reference voice matching"],"limitations":["independent reruns limited","older release version"],"whyRanked":"Rank #2: Rank 2.","note":null},{"rank":3,"modelId":"eleven-v3","modelName":"Eleven v3","provider":"ElevenLabs","testedVariant":null,"subtitle":"Ranks third in the reported Controlled Voice update.","metricName":"Rank","metricValue":"3","pricing":null,"pricingCta":{"label":"Provider pricing ↗","url":"https://elevenlabs.io/pricing/api"},"context":null,"maxOutput":null,"status":null,"highlights":["reference voice cloning","expressive cloned speech"],"limitations":["independent reruns limited","rank only stored"],"whyRanked":"Rank #3: Rank 3.","note":null}]}]}],"models":[{"modelId":"claude-fable-5","modelName":"Claude Fable 5","providers":["Anthropic"],"wins":6,"appearances":11,"tasks":[{"taskId":"chat","taskTitle":"General chat","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"russian","taskTitle":"Russian language","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"expert","taskTitle":"Expert analysis","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"math","taskTitle":"Mathematics","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"instructions","taskTitle":"Instruction following","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"writing","taskTitle":"Copywriting","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"research","taskTitle":"Search and research","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"documents","taskTitle":"PDF and documents","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"agents","taskTitle":"AI agents","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"vision","taskTitle":"Image understanding","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"ocr","taskTitle":"Text from image (OCR)","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"claude-opus-5","modelName":"Claude Opus 5","providers":["Anthropic"],"wins":5,"appearances":7,"tasks":[{"taskId":"expert","taskTitle":"Expert analysis","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"math","taskTitle":"Mathematics","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"documents","taskTitle":"PDF and documents","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"coding","taskTitle":"Programming","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"webdev","taskTitle":"Web development","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"agents","taskTitle":"AI agents","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"data-analysis","taskTitle":"Data analysis and SQL","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"cartesia-sonic-3-6","modelName":"Cartesia Sonic 3.6","providers":["Cartesia"],"wins":2,"appearances":2,"tasks":[{"taskId":"text-to-speech","taskTitle":"Text to speech","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"voice-cloning","taskTitle":"Voice cloning","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"gpt-image-2","modelName":"GPT Image 2","providers":["OpenAI"],"wins":2,"appearances":2,"tasks":[{"taskId":"image-generation","taskTitle":"Image generation","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"image-editing","taskTitle":"Image editing","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"suno-v5-5","modelName":"Suno V5.5","providers":["Suno"],"wins":2,"appearances":2,"tasks":[{"taskId":"music","taskTitle":"Music generation","listId":"instrumental","listLabel":"Instrumental","rank":1},{"taskId":"music","taskTitle":"Music generation","listId":"vocals","listLabel":"Vocals","rank":1}]},{"modelId":"wan-3-0","modelName":"Wan 3.0","providers":["Alibaba"],"wins":2,"appearances":2,"tasks":[{"taskId":"text-to-video","taskTitle":"Text → video","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"video-editing","taskTitle":"Video editing","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","providers":["Anthropic"],"wins":1,"appearances":6,"tasks":[{"taskId":"chat","taskTitle":"General chat","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"russian","taskTitle":"Russian language","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"expert","taskTitle":"Expert analysis","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"instructions","taskTitle":"Instruction following","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"writing","taskTitle":"Copywriting","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"documents","taskTitle":"PDF and documents","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","providers":["Alibaba"],"wins":1,"appearances":4,"tasks":[{"taskId":"webdev","taskTitle":"Web development","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"vision","taskTitle":"Image understanding","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"ocr","taskTitle":"Text from image (OCR)","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"data-analysis","taskTitle":"Data analysis and SQL","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","providers":["Google"],"wins":1,"appearances":3,"tasks":[{"taskId":"text-to-video","taskTitle":"Text → video","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"image-to-video","taskTitle":"Image → video","listId":"default","listLabel":"Top 3","rank":1},{"taskId":"video-editing","taskTitle":"Video editing","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"claude-opus-4-6-search","modelName":"Claude Opus 4.6 Search","providers":["Anthropic"],"wins":1,"appearances":1,"tasks":[{"taskId":"research","taskTitle":"Search and research","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","providers":["Alibaba"],"wins":1,"appearances":1,"tasks":[{"taskId":"speech-to-text","taskTitle":"Speech to text","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"gemini","modelName":"Gemini","providers":["Google"],"wins":1,"appearances":1,"tasks":[{"taskId":"translation","taskTitle":"Translation","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"gemini-3-1-flash-live-preview","modelName":"Gemini 3.1 Flash Live Preview","providers":["Google"],"wins":1,"appearances":1,"tasks":[{"taskId":"realtime-voice","taskTitle":"Voice agents","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"qwen3-7-max","modelName":"Qwen3.7 Max","providers":["Alibaba"],"wins":1,"appearances":1,"tasks":[{"taskId":"tool-calling","taskTitle":"Structured output and tool calling","listId":"default","listLabel":"Top 3","rank":1}]},{"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","providers":["Anthropic"],"wins":0,"appearances":4,"tasks":[{"taskId":"chat","taskTitle":"General chat","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"instructions","taskTitle":"Instruction following","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"vision","taskTitle":"Image understanding","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"ocr","taskTitle":"Text from image (OCR)","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"gemini-3-7-flash","modelName":"Gemini 3.7 Flash","providers":["Google"],"wins":0,"appearances":3,"tasks":[{"taskId":"russian","taskTitle":"Russian language","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"math","taskTitle":"Mathematics","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"writing","taskTitle":"Copywriting","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"kimi-k3-max","modelName":"Kimi K3 Max","providers":["Moonshot AI"],"wins":0,"appearances":3,"tasks":[{"taskId":"webdev","taskTitle":"Web development","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"agents","taskTitle":"AI agents","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"data-analysis","taskTitle":"Data analysis and SQL","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"minimax-h3","modelName":"MiniMax H3","providers":["MiniMax"],"wins":0,"appearances":3,"tasks":[{"taskId":"text-to-video","taskTitle":"Text → video","listId":"default","listLabel":"Top 3","rank":3},{"taskId":"image-to-video","taskTitle":"Image → video","listId":"default","listLabel":"Top 3","rank":2},{"taskId":"video-editing","taskTitle":"Video editing","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"mureka-v8","modelName":"Mureka V8","providers":["Mureka"],"wins":0,"appearances":2,"tasks":[{"taskId":"music","taskTitle":"Music generation","listId":"instrumental","listLabel":"Instrumental","rank":3},{"taskId":"music","taskTitle":"Music generation","listId":"vocals","listLabel":"Vocals","rank":3}]},{"modelId":"mureka-v9","modelName":"Mureka V9","providers":["Mureka"],"wins":0,"appearances":2,"tasks":[{"taskId":"music","taskTitle":"Music generation","listId":"instrumental","listLabel":"Instrumental","rank":2},{"taskId":"music","taskTitle":"Music generation","listId":"vocals","listLabel":"Vocals","rank":2}]},{"modelId":"btl-4","modelName":"BTL-4","providers":["Bad Theory Labs"],"wins":0,"appearances":1,"tasks":[{"taskId":"tool-calling","taskTitle":"Structured output and tool calling","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"cartesia-sonic-3-5","modelName":"Cartesia Sonic 3.5","providers":["Cartesia"],"wins":0,"appearances":1,"tasks":[{"taskId":"voice-cloning","taskTitle":"Voice cloning","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"claude","modelName":"Claude","providers":["Anthropic"],"wins":0,"appearances":1,"tasks":[{"taskId":"translation","taskTitle":"Translation","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"dreamina-seedance-2-0","modelName":"Dreamina Seedance 2.0","providers":["ByteDance"],"wins":0,"appearances":1,"tasks":[{"taskId":"image-to-video","taskTitle":"Image → video","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"eleven-v3","modelName":"Eleven v3","providers":["ElevenLabs"],"wins":0,"appearances":1,"tasks":[{"taskId":"voice-cloning","taskTitle":"Voice cloning","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"elevenlabs-agents","modelName":"ElevenLabs Agents","providers":["ElevenLabs"],"wins":0,"appearances":1,"tasks":[{"taskId":"realtime-voice","taskTitle":"Voice agents","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"elevenlabs-scribe-v2","modelName":"ElevenLabs Scribe v2","providers":["ElevenLabs"],"wins":0,"appearances":1,"tasks":[{"taskId":"speech-to-text","taskTitle":"Speech to text","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"gpt","modelName":"GPT","providers":["OpenAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"translation","taskTitle":"Translation","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"gpt-5-5-search","modelName":"GPT-5.5 Search","providers":["OpenAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"research","taskTitle":"Search and research","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","providers":["OpenAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"coding","taskTitle":"Programming","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"gpt-realtime-1-5","modelName":"GPT-Realtime-1.5","providers":["OpenAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"realtime-voice","taskTitle":"Voice agents","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"grok-4-6","modelName":"Grok 4.6","providers":["xAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"coding","taskTitle":"Programming","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"grok-imagine-image-2-0","modelName":"Grok Imagine Image 2.0","providers":["xAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"image-editing","taskTitle":"Image editing","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"ling-3-0-flash","modelName":"Ling 3.0 Flash","providers":["InclusionAI"],"wins":0,"appearances":1,"tasks":[{"taskId":"tool-calling","taskTitle":"Structured output and tool calling","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"mai-image-2-6-preview","modelName":"MAI-Image-2.6 Preview","providers":["Microsoft AI"],"wins":0,"appearances":1,"tasks":[{"taskId":"image-editing","taskTitle":"Image editing","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"mai-transcribe-1-5","modelName":"MAI-Transcribe-1.5","providers":["Microsoft AI"],"wins":0,"appearances":1,"tasks":[{"taskId":"speech-to-text","taskTitle":"Speech to text","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"nano-banana-2","modelName":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","providers":["Google"],"wins":0,"appearances":1,"tasks":[{"taskId":"image-generation","taskTitle":"Image generation","listId":"default","listLabel":"Top 3","rank":3}]},{"modelId":"qwen-audio-3-0-tts-plus","modelName":"Qwen-Audio-3.0-TTS-Plus","providers":["Alibaba"],"wins":0,"appearances":1,"tasks":[{"taskId":"text-to-speech","taskTitle":"Text to speech","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"reve-2-1","modelName":"Reve 2.1","providers":["Reve"],"wins":0,"appearances":1,"tasks":[{"taskId":"image-generation","taskTitle":"Image generation","listId":"default","listLabel":"Top 3","rank":2}]},{"modelId":"speechify-simba-3-2","modelName":"SpeechifyAI Simba 3.2","providers":["Speechify"],"wins":0,"appearances":1,"tasks":[{"taskId":"text-to-speech","taskTitle":"Text to speech","listId":"default","listLabel":"Top 3","rank":3}]}]}