{"schema_version":"2.0","methodology_version":"2.0-task-consensus","edition":"2026-09-07","last_verified_at":"2026-09-07T10:16:44.291125+00:00","windowStart":"2026-09-07","windowEnd":"2026-09-07","nextUpdate":"2026-09-17","categories":[{"id":"text","title":"Text","taskIds":["chat","russian","expert","math","instructions","writing","research","documents"],"deepLink":"https://lll.bz/llm?group=text"},{"id":"code","title":"Code","taskIds":["coding","webdev","agents","data-analysis","tool-calling","code-reasoning","reference-design","repo-refactoring"],"deepLink":"https://lll.bz/llm?group=code"},{"id":"image","title":"Images","taskIds":["vision","ocr","image-generation","image-editing"],"deepLink":"https://lll.bz/llm?group=image"},{"id":"video","title":"Video","taskIds":["text-to-video","image-to-video","video-editing"],"deepLink":"https://lll.bz/llm?group=video"},{"id":"audio","title":"Audio","taskIds":["speech-to-text","text-to-speech","realtime-voice","music","voice-cloning","voice-conversation"],"deepLink":"https://lll.bz/llm?group=audio"}],"tasks":[{"id":"chat","title":"General chat","name":"General chat","description":"For broad conversational quality across everyday prompts.","category":"text","sourceName":"Arena, Artificial Analysis, LiveBench","sourceUrl":"https://arena.ai/leaderboard/text","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-0","lb-Overall","aa-intelligence"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5","confidence":"medium","disagreement_status":"source_split","independent_source_count":3,"source_coverage":1,"family_weights":{"Arena":0.7,"Artificial Analysis":0.15,"LiveBench":0.15},"ci_overlap":true,"winner_disagreement":true},"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.84463946,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1507,"raw_unit":"Elo","ci_low":1502,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":6,"sample_count":27189,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-0|claude-fable-5","lb-Overall|Claude Fable 5 Max Effort","aa-intelligence|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.845","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks."},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.65,"mean_rank":1.6666666666666667,"median_rank":1,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1504,"raw_unit":"Elo","ci_low":1493,"ci_high":1515,"rank_spread_min":1,"rank_spread_max":14,"sample_count":2906,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (max with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":57,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (xhigh with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":2,"raw_score":56,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (high with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"High","reasoning_effort":"high","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (medium with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Medium","reasoning_effort":"medium","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":11},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (low with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Low","reasoning_effort":"low","rank":15,"raw_score":51,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":16}],"aggregation_source_results":["arena-0|claude-fable-5.1-max","lb-Overall|Claude Fable 5.1 Max Effort","aa-intelligence|Claude Fable 5.1 (max with fallback)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.650","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5-1","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 1.67; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks."},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":82.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":55,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (xhigh)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Xhigh","reasoning_effort":"xhigh","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":5},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (high)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"High","reasoning_effort":"high","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":8},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (medium)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Medium","reasoning_effort":"medium","rank":12,"raw_score":52,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":12},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (low)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Low","reasoning_effort":"low","rank":22,"raw_score":49,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":22},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (Non-reasoning)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":null,"reasoning_effort":null,"rank":25,"raw_score":48,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":26}],"aggregation_source_results":["lb-Overall|GPT-6 Astra Max Effort","aa-intelligence|GPT-6 Astra (max)"],"is_preliminary":false,"rank":3,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"chat:gpt-6-astra","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1505,"raw_unit":"Elo","ci_low":1501,"ci_high":1509,"rank_spread_min":1,"rank_spread_max":6,"sample_count":72099,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1498,"raw_unit":"Elo","ci_low":1495,"ci_high":1501,"rank_spread_min":3,"rank_spread_max":11,"sample_count":76015,"is_preliminary":false,"provider":"Anthropic","source_order":6}],"aggregation_source_results":["arena-0|claude-opus-4-6-high"],"is_preliminary":false},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1502,"raw_unit":"Elo","ci_low":1498,"ci_high":1506,"rank_spread_min":1,"rank_spread_max":9,"sample_count":60103,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1494,"raw_unit":"Elo","ci_low":1490,"ci_high":1498,"rank_spread_min":3,"rank_spread_max":14,"sample_count":61238,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-0|claude-opus-4-7-high"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.38200495,"mean_rank":5.5,"median_rank":5.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 xHigh Effort","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":4,"raw_score":81.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":4},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 (max)","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Meta","source_order":10},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 (xhigh)","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":12,"raw_score":52,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Meta","source_order":14}],"aggregation_source_results":["lb-Overall|Muse Spark 1.3 xHigh Effort","aa-intelligence|Muse Spark 1.3 (max)"],"is_preliminary":false},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.3438406,"mean_rank":14.333333333333334,"median_rank":11,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.2 (xHigh)","normalized_model_family":"muse-spark-1-2","base_model":"muse spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":5,"raw_score":1499,"raw_unit":"Elo","ci_low":1489,"ci_high":1509,"rank_spread_min":1,"rank_spread_max":17,"sample_count":3240,"is_preliminary":false,"provider":"Meta","source_order":5},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.2 xHigh Effort","normalized_model_family":"muse-spark-1-2","base_model":"Muse Spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":11,"raw_score":78,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":13},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.2 (xhigh)","normalized_model_family":"muse-spark-1-2","base_model":"Muse Spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":27,"raw_score":47,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Meta","source_order":29}],"aggregation_source_results":["arena-0|muse-spark-1.2 (xHigh)","lb-Overall|Muse Spark 1.2 xHigh Effort","aa-intelligence|Muse Spark 1.2 (xhigh)"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.32532248,"mean_rank":6.666666666666667,"median_rank":7,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":9,"raw_score":1493,"raw_unit":"Elo","ci_low":1488,"ci_high":1498,"rank_spread_min":4,"rank_spread_max":17,"sample_count":35174,"is_preliminary":false,"provider":"Anthropic","source_order":9},{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":14,"raw_score":1488,"raw_unit":"Elo","ci_low":1482,"ci_high":1494,"rank_spread_min":5,"rank_spread_max":25,"sample_count":17119,"is_preliminary":false,"provider":"Anthropic","source_order":14},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 5 Opus Thinking Max Effort","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":80.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":7},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (xhigh)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Xhigh","reasoning_effort":"xhigh","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":7},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (high)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":12,"raw_score":52,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":13},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (medium)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Medium","reasoning_effort":"medium","rank":18,"raw_score":50,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":21},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (low)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Low","reasoning_effort":"low","rank":37,"raw_score":44,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":38}],"aggregation_source_results":["arena-0|claude-opus-5-high","lb-Overall|Claude 5 Opus Thinking Max Effort","aa-intelligence|Claude Opus 5 (max)"],"is_preliminary":false},{"model_id":"kimi-k3-open","base_model":"Kimi K3\nopen","display_name":"Kimi K3\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi K3\nopen","normalized_model_family":"kimi-k3-open","base_model":"Kimi K3\nopen","variant":null,"reasoning_effort":null,"rank":8,"raw_score":79.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":8}],"aggregation_source_results":["lb-Overall|Kimi K3\nopen"],"is_preliminary":false},{"model_id":"qwen-3-8-max-open","base_model":"Qwen 3.8 Max\nopen","display_name":"Qwen 3.8 Max\nopen","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen 3.8 Max\nopen","normalized_model_family":"qwen-3-8-max-open","base_model":"Qwen 3.8 Max\nopen","variant":null,"reasoning_effort":null,"rank":10,"raw_score":78.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["lb-Overall|Qwen 3.8 Max\nopen"],"is_preliminary":false},{"model_id":"gemini-3-8-flash","base_model":"gemini 3.8 flash","display_name":"gemini 3.8 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.28474325,"mean_rank":19.333333333333332,"median_rank":23,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.8-flash-high","normalized_model_family":"gemini-3-8-flash","base_model":"gemini 3.8 flash","variant":"High","reasoning_effort":"high","rank":8,"raw_score":1494,"raw_unit":"Elo","ci_low":1485,"ci_high":1503,"rank_spread_min":1,"rank_spread_max":22,"sample_count":5125,"is_preliminary":true,"provider":"Google","source_order":8},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.8 Flash High","normalized_model_family":"gemini-3-8-flash","base_model":"Gemini 3.8 Flash","variant":"High","reasoning_effort":"high","rank":23,"raw_score":75.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":23},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.8 Flash (high)","normalized_model_family":"gemini-3-8-flash","base_model":"Gemini 3.8 Flash","variant":"High","reasoning_effort":"high","rank":27,"raw_score":47,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":27},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.8 Flash (low)","normalized_model_family":"gemini-3-8-flash","base_model":"Gemini 3.8 Flash","variant":"Low","reasoning_effort":"low","rank":44,"raw_score":41,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":46}],"aggregation_source_results":["arena-0|gemini-3.8-flash-high","lb-Overall|Gemini 3.8 Flash High","aa-intelligence|Gemini 3.8 Flash (high)"],"is_preliminary":true},{"model_id":"muse-spark-1-1","base_model":"muse spark 1.1","display_name":"muse spark 1.1","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.27559681,"mean_rank":17.5,"median_rank":17.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.1","normalized_model_family":"muse-spark-1-1","base_model":"muse spark 1.1","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1492,"raw_unit":"Elo","ci_low":1487,"ci_high":1497,"rank_spread_min":4,"rank_spread_max":18,"sample_count":24064,"is_preliminary":false,"provider":"Meta","source_order":10},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.1 xHigh Effort","normalized_model_family":"muse-spark-1-1","base_model":"Muse Spark 1.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":25,"raw_score":75.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":25}],"aggregation_source_results":["arena-0|muse-spark-1.1","lb-Overall|Muse Spark 1.1 xHigh Effort"],"is_preliminary":false},{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.26965841,"mean_rank":18,"median_rank":11,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.7-flash-high","normalized_model_family":"gemini-3-7-flash","base_model":"gemini 3.7 flash","variant":"High","reasoning_effort":"high","rank":11,"raw_score":1491,"raw_unit":"Elo","ci_low":1483,"ci_high":1499,"rank_spread_min":3,"rank_spread_max":25,"sample_count":5682,"is_preliminary":true,"provider":"Google","source_order":11},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.7 Flash High","normalized_model_family":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","variant":"High","reasoning_effort":"high","rank":9,"raw_score":78.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":9},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.7 Flash (high)","normalized_model_family":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","variant":"High","reasoning_effort":"high","rank":34,"raw_score":45,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":35}],"aggregation_source_results":["arena-0|gemini-3.7-flash-high","lb-Overall|Gemini 3.7 Flash High","aa-intelligence|Gemini 3.7 Flash (high)"],"is_preliminary":true},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.26409182,"mean_rank":15,"median_rank":15,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":12,"raw_score":1489,"raw_unit":"Elo","ci_low":1484,"ci_high":1494,"rank_spread_min":5,"rank_spread_max":24,"sample_count":18090,"is_preliminary":false,"provider":"Moonshot","source_order":12},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi K3 (max)","normalized_model_family":"kimi-k3","base_model":"Kimi K3","variant":"Max","reasoning_effort":"max","rank":18,"raw_score":50,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Kimi","source_order":18},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi K3 (low)","normalized_model_family":"kimi-k3","base_model":"Kimi K3","variant":"Low","reasoning_effort":"low","rank":52,"raw_score":37,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Kimi","source_order":52}],"aggregation_source_results":["arena-0|kimi-k3-max","aa-intelligence|Kimi K3 (max)"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.26339665,"mean_rank":12.333333333333334,"median_rank":15,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":17,"raw_score":1483,"raw_unit":"Elo","ci_low":1478,"ci_high":1488,"rank_spread_min":9,"rank_spread_max":32,"sample_count":23413,"is_preliminary":false,"provider":"OpenAI","source_order":17},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":5,"raw_score":81,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":5},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol (max)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":15,"raw_score":51,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":15},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol (xhigh)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":18,"raw_score":50,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":20},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol (high)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"High","reasoning_effort":"high","rank":25,"raw_score":48,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":25},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol (medium)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Medium","reasoning_effort":"medium","rank":32,"raw_score":46,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":33},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol (low)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Low","reasoning_effort":"low","rank":44,"raw_score":41,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":47}],"aggregation_source_results":["arena-0|gpt-5.6-sol-xhigh","lb-Overall|GPT-5.6 Sol Max Effort","aa-intelligence|GPT-5.6 Sol (max)"],"is_preliminary":false}],"candidate_count":149,"ranking":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.84463946,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1507,"raw_unit":"Elo","ci_low":1502,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":6,"sample_count":27189,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-0|claude-fable-5","lb-Overall|Claude Fable 5 Max Effort","aa-intelligence|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.845","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort","Claude Fable 5 (with fallback)"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.65,"mean_rank":1.6666666666666667,"median_rank":1,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1504,"raw_unit":"Elo","ci_low":1493,"ci_high":1515,"rank_spread_min":1,"rank_spread_max":14,"sample_count":2906,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (max with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":57,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (xhigh with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":2,"raw_score":56,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (high with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"High","reasoning_effort":"high","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (medium with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Medium","reasoning_effort":"medium","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":11},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (low with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Low","reasoning_effort":"low","rank":15,"raw_score":51,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":16}],"aggregation_source_results":["arena-0|claude-fable-5.1-max","lb-Overall|Claude Fable 5.1 Max Effort","aa-intelligence|Claude Fable 5.1 (max with fallback)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.650","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5-1","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 1.67; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","aliases":["Claude Fable 5.1","claude-fable-5.1-max","Claude Fable 5.1 Max Effort","Claude Fable 5.1 (max with fallback)","Claude Fable 5.1 (xhigh with fallback)","Claude Fable 5.1 (high with fallback)","Claude Fable 5.1 (medium with fallback)","Claude Fable 5.1 (low with fallback)"]},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":82.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":55,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (xhigh)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Xhigh","reasoning_effort":"xhigh","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":5},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (high)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"High","reasoning_effort":"high","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":8},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (medium)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Medium","reasoning_effort":"medium","rank":12,"raw_score":52,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":12},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (low)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Low","reasoning_effort":"low","rank":22,"raw_score":49,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":22},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (Non-reasoning)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":null,"reasoning_effort":null,"rank":25,"raw_score":48,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":26}],"aggregation_source_results":["lb-Overall|GPT-6 Astra Max Effort","aa-intelligence|GPT-6 Astra (max)"],"is_preliminary":false,"rank":3,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"chat:gpt-6-astra","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","aliases":["GPT-6 Astra","GPT-6 Astra Max Effort","GPT-6 Astra (max)","GPT-6 Astra (xhigh)","GPT-6 Astra (high)","GPT-6 Astra (medium)","GPT-6 Astra (low)","GPT-6 Astra (Non-reasoning)"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.84463946,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1507,"raw_unit":"Elo","ci_low":1502,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":6,"sample_count":27189,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-0|claude-fable-5","lb-Overall|Claude Fable 5 Max Effort","aa-intelligence|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.845","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort","Claude Fable 5 (with fallback)"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.65,"mean_rank":1.6666666666666667,"median_rank":1,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1504,"raw_unit":"Elo","ci_low":1493,"ci_high":1515,"rank_spread_min":1,"rank_spread_max":14,"sample_count":2906,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (max with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":57,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (xhigh with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":2,"raw_score":56,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (high with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"High","reasoning_effort":"high","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (medium with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Medium","reasoning_effort":"medium","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":11},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (low with fallback)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Low","reasoning_effort":"low","rank":15,"raw_score":51,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":16}],"aggregation_source_results":["arena-0|claude-fable-5.1-max","lb-Overall|Claude Fable 5.1 Max Effort","aa-intelligence|Claude Fable 5.1 (max with fallback)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.650","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5-1","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 1.67; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","aliases":["Claude Fable 5.1","claude-fable-5.1-max","Claude Fable 5.1 Max Effort","Claude Fable 5.1 (max with fallback)","Claude Fable 5.1 (xhigh with fallback)","Claude Fable 5.1 (high with fallback)","Claude Fable 5.1 (medium with fallback)","Claude Fable 5.1 (low with fallback)"]},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":82.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":55,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (xhigh)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Xhigh","reasoning_effort":"xhigh","rank":4,"raw_score":54,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":5},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (high)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"High","reasoning_effort":"high","rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":8},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (medium)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Medium","reasoning_effort":"medium","rank":12,"raw_score":52,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":12},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (low)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Low","reasoning_effort":"low","rank":22,"raw_score":49,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":22},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (Non-reasoning)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":null,"reasoning_effort":null,"rank":25,"raw_score":48,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":26}],"aggregation_source_results":["lb-Overall|GPT-6 Astra Max Effort","aa-intelligence|GPT-6 Astra (max)"],"is_preliminary":false,"rank":3,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"chat:gpt-6-astra","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks.","aliases":["GPT-6 Astra","GPT-6 Astra Max Effort","GPT-6 Astra (max)","GPT-6 Astra (xhigh)","GPT-6 Astra (high)","GPT-6 Astra (medium)","GPT-6 Astra (low)","GPT-6 Astra (Non-reasoning)"]}]}],"deepLink":"https://lll.bz/llm?task=chat"},{"id":"russian","title":"Russian language","name":"Russian language","description":"For Russian-language conversation and writing.","category":"text","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/text/russian","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-1"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1521,"raw_unit":"Elo","ci_low":1509,"ci_high":1533,"rank_spread_min":1,"rank_spread_max":11,"sample_count":2706,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-1|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.2 (xHigh)","normalized_model_family":"muse-spark-1-2","base_model":"muse spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":3,"raw_score":1514,"raw_unit":"Elo","ci_low":1482,"ci_high":1546,"rank_spread_min":1,"rank_spread_max":39,"sample_count":330,"is_preliminary":false,"provider":"Meta","source_order":3}],"aggregation_source_results":["arena-1|muse-spark-1.2 (xHigh)"],"is_preliminary":false,"rank":2,"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:muse-spark-1-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":1510,"raw_unit":"Elo","ci_low":1477,"ci_high":1543,"rank_spread_min":1,"rank_spread_max":46,"sample_count":348,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-1|claude-fable-5.1-max"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.431","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.7-flash-high","normalized_model_family":"gemini-3-7-flash","base_model":"gemini 3.7 flash","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1518,"raw_unit":"Elo","ci_low":1494,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":27,"sample_count":615,"is_preliminary":true,"provider":"Google","source_order":2}],"aggregation_source_results":["arena-1|gemini-3.7-flash-high"],"is_preliminary":true},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1508,"raw_unit":"Elo","ci_low":1501,"ci_high":1515,"rank_spread_min":1,"rank_spread_max":22,"sample_count":8243,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1506,"raw_unit":"Elo","ci_low":1498,"ci_high":1514,"rank_spread_min":1,"rank_spread_max":23,"sample_count":7817,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-1|claude-opus-4-6"],"is_preliminary":false},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":6,"raw_score":1507,"raw_unit":"Elo","ci_low":1499,"ci_high":1515,"rank_spread_min":1,"rank_spread_max":24,"sample_count":6075,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1497,"raw_unit":"Elo","ci_low":1488,"ci_high":1506,"rank_spread_min":2,"rank_spread_max":32,"sample_count":6231,"is_preliminary":false,"provider":"Anthropic","source_order":11}],"aggregation_source_results":["arena-1|claude-opus-4-7-high"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":8,"raw_score":1501,"raw_unit":"Elo","ci_low":1491,"ci_high":1511,"rank_spread_min":1,"rank_spread_max":29,"sample_count":3818,"is_preliminary":false,"provider":"Anthropic","source_order":8},{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":13,"raw_score":1494,"raw_unit":"Elo","ci_low":1480,"ci_high":1508,"rank_spread_min":2,"rank_spread_max":45,"sample_count":1799,"is_preliminary":false,"provider":"Anthropic","source_order":13}],"aggregation_source_results":["arena-1|claude-opus-5-high"],"is_preliminary":false},{"model_id":"gemini-3-pro","base_model":"gemini 3 pro","display_name":"gemini 3 pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro","normalized_model_family":"gemini-3-pro","base_model":"gemini 3 pro","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1501,"raw_unit":"Elo","ci_low":1492,"ci_high":1510,"rank_spread_min":1,"rank_spread_max":29,"sample_count":4794,"is_preliminary":false,"provider":"Google","source_order":9}],"aggregation_source_results":["arena-1|gemini-3-pro"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1499,"raw_unit":"Elo","ci_low":1492,"ci_high":1506,"rank_spread_min":2,"rank_spread_max":27,"sample_count":11037,"is_preliminary":false,"provider":"Google","source_order":10}],"aggregation_source_results":["arena-1|gemini-3.1-pro-preview"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1495,"raw_unit":"Elo","ci_low":1486,"ci_high":1504,"rank_spread_min":2,"rank_spread_max":36,"sample_count":5083,"is_preliminary":false,"provider":"Anthropic","source_order":12},{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":23,"raw_score":1487,"raw_unit":"Elo","ci_low":1478,"ci_high":1496,"rank_spread_min":5,"rank_spread_max":46,"sample_count":4976,"is_preliminary":false,"provider":"Anthropic","source_order":23}],"aggregation_source_results":["arena-1|claude-opus-4-8-high"],"is_preliminary":false},{"model_id":"muse-spark-1-1","base_model":"muse spark 1.1","display_name":"muse spark 1.1","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.1","normalized_model_family":"muse-spark-1-1","base_model":"muse spark 1.1","variant":null,"reasoning_effort":null,"rank":14,"raw_score":1494,"raw_unit":"Elo","ci_low":1482,"ci_high":1506,"rank_spread_min":2,"rank_spread_max":41,"sample_count":2523,"is_preliminary":false,"provider":"Meta","source_order":14}],"aggregation_source_results":["arena-1|muse-spark-1.1"],"is_preliminary":false},{"model_id":"gemini-3-8-flash","base_model":"gemini 3.8 flash","display_name":"gemini 3.8 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.8-flash-high","normalized_model_family":"gemini-3-8-flash","base_model":"gemini 3.8 flash","variant":"High","reasoning_effort":"high","rank":15,"raw_score":1491,"raw_unit":"Elo","ci_low":1468,"ci_high":1514,"rank_spread_min":1,"rank_spread_max":54,"sample_count":576,"is_preliminary":true,"provider":"Google","source_order":15}],"aggregation_source_results":["arena-1|gemini-3.8-flash-high"],"is_preliminary":true},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.24465054,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":16,"raw_score":1491,"raw_unit":"Elo","ci_low":1477,"ci_high":1505,"rank_spread_min":2,"rank_spread_max":46,"sample_count":1987,"is_preliminary":false,"provider":"Moonshot","source_order":16}],"aggregation_source_results":["arena-1|kimi-k3-max"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.23981247,"mean_rank":17,"median_rank":17,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":17,"raw_score":1490,"raw_unit":"Elo","ci_low":1478,"ci_high":1502,"rank_spread_min":2,"rank_spread_max":46,"sample_count":2455,"is_preliminary":false,"provider":"OpenAI","source_order":17}],"aggregation_source_results":["arena-1|gpt-5.6-sol-xhigh"],"is_preliminary":false},{"model_id":"gemini-3-5-flash","base_model":"gemini 3.5 flash","display_name":"gemini 3.5 flash","official_model_id":null,"provider":"Google","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.23540891,"mean_rank":18,"median_rank":18,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-medium","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"Medium","reasoning_effort":"medium","rank":18,"raw_score":1490,"raw_unit":"Elo","ci_low":1479,"ci_high":1501,"rank_spread_min":2,"rank_spread_max":45,"sample_count":3430,"is_preliminary":false,"provider":"Google","source_order":18},{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-high","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"High","reasoning_effort":"high","rank":20,"raw_score":1490,"raw_unit":"Elo","ci_low":1480,"ci_high":1500,"rank_spread_min":3,"rank_spread_max":45,"sample_count":3551,"is_preliminary":false,"provider":"Google","source_order":20}],"aggregation_source_results":["arena-1|gemini-3.5-flash-medium"],"is_preliminary":false}],"candidate_count":104,"ranking":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1521,"raw_unit":"Elo","ci_low":1509,"ci_high":1533,"rank_spread_min":1,"rank_spread_max":11,"sample_count":2706,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-1|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.2 (xHigh)","normalized_model_family":"muse-spark-1-2","base_model":"muse spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":3,"raw_score":1514,"raw_unit":"Elo","ci_low":1482,"ci_high":1546,"rank_spread_min":1,"rank_spread_max":39,"sample_count":330,"is_preliminary":false,"provider":"Meta","source_order":3}],"aggregation_source_results":["arena-1|muse-spark-1.2 (xHigh)"],"is_preliminary":false,"rank":2,"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:muse-spark-1-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Muse Spark 1.2","muse-spark-1.2 (xHigh)"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":1510,"raw_unit":"Elo","ci_low":1477,"ci_high":1543,"rank_spread_min":1,"rank_spread_max":46,"sample_count":348,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-1|claude-fable-5.1-max"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.431","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1521,"raw_unit":"Elo","ci_low":1509,"ci_high":1533,"rank_spread_min":1,"rank_spread_max":11,"sample_count":2706,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-1|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.2 (xHigh)","normalized_model_family":"muse-spark-1-2","base_model":"muse spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":3,"raw_score":1514,"raw_unit":"Elo","ci_low":1482,"ci_high":1546,"rank_spread_min":1,"rank_spread_max":39,"sample_count":330,"is_preliminary":false,"provider":"Meta","source_order":3}],"aggregation_source_results":["arena-1|muse-spark-1.2 (xHigh)"],"is_preliminary":false,"rank":2,"modelId":"muse-spark-1-2","modelName":"Muse Spark 1.2","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:muse-spark-1-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Muse Spark 1.2","muse-spark-1.2 (xHigh)"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":1510,"raw_unit":"Elo","ci_low":1477,"ci_high":1543,"rank_spread_min":1,"rank_spread_max":46,"sample_count":348,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-1|claude-fable-5.1-max"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.431","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max"]}]}],"deepLink":"https://lll.bz/llm?task=russian"},{"id":"expert","title":"Expert analysis","name":"Expert analysis","description":"For difficult analytical and professional knowledge tasks.","category":"text","sourceName":"Arena, LiveBench, Scale Labs","sourceUrl":"https://arena.ai/leaderboard/text/expert","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-2","lb-Reasoning","scale-hle"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5","confidence":"medium","disagreement_status":"source_split","independent_source_count":3,"source_coverage":0.6666666666666666,"family_weights":{"Arena":0.5,"LiveBench":0.3,"Scale Labs":0.2},"ci_overlap":true,"winner_disagreement":true},"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.73788625,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1548,"raw_unit":"Elo","ci_low":1537,"ci_high":1559,"rank_spread_min":1,"rank_spread_max":13,"sample_count":2939,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":9,"raw_score":89.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-2|claude-fable-5","lb-Reasoning|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.738","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions."},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.55594559,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":1532,"raw_unit":"Elo","ci_low":1490,"ci_high":1574,"rank_spread_min":1,"rank_spread_max":65,"sample_count":211,"is_preliminary":false,"provider":"Anthropic","source_order":7},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":91.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-2|claude-fable-5.1-max","lb-Reasoning|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.556","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5-1","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions."},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.52056426,"mean_rank":9,"median_rank":9,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1547,"raw_unit":"Elo","ci_low":1538,"ci_high":1556,"rank_spread_min":1,"rank_spread_max":13,"sample_count":6409,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1534,"raw_unit":"Elo","ci_low":1526,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":18,"sample_count":7644,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6 (Non-Thinking)","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":16,"raw_score":19,"raw_unit":"percent","ci_low":17.46,"ci_high":20.54,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":19}],"aggregation_source_results":["arena-2|claude-opus-4-6-high","scale-hle|claude-opus-4-6 (Non-Thinking)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.521","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-opus-4-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 9.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions."}],"pending_evaluation":[],"candidates":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":92.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["lb-Reasoning|GPT-6 Astra Max Effort"],"is_preliminary":false},{"model_id":"gpt-5-4-pro-2026-03-05","base_model":"gpt 5.4 pro 2026 03 05","display_name":"gpt 5.4 pro 2026 03 05","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.4-pro-2026-03-05","normalized_model_family":"gpt-5-4-pro-2026-03-05","base_model":"gpt 5.4 pro 2026 03 05","variant":null,"reasoning_effort":null,"rank":1,"raw_score":44.32,"raw_unit":"percent","ci_low":42.37,"ci_high":46.27,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["scale-hle|gpt-5.4-pro-2026-03-05"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.47400371,"mean_rank":3.5,"median_rank":3.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1539,"raw_unit":"Elo","ci_low":1528,"ci_high":1550,"rank_spread_min":1,"rank_spread_max":17,"sample_count":3872,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":12,"raw_score":1518,"raw_unit":"Elo","ci_low":1503,"ci_high":1533,"rank_spread_min":3,"rank_spread_max":50,"sample_count":1859,"is_preliminary":false,"provider":"Anthropic","source_order":12},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 5 Opus Thinking Max Effort","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":91.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-2|claude-opus-5-high","lb-Reasoning|Claude 5 Opus Thinking Max Effort"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.43376421,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":8,"raw_score":1531,"raw_unit":"Elo","ci_low":1519,"ci_high":1543,"rank_spread_min":1,"rank_spread_max":26,"sample_count":2531,"is_preliminary":false,"provider":"OpenAI","source_order":8},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":91.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["arena-2|gpt-5.6-sol-xhigh","lb-Reasoning|GPT-5.6 Sol Max Effort"],"is_preliminary":false},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.40939959,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1534,"raw_unit":"Elo","ci_low":1526,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":18,"sample_count":6447,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":6,"raw_score":1533,"raw_unit":"Elo","ci_low":1524,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":19,"sample_count":6205,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":6,"raw_score":36.2,"raw_unit":"percent","ci_low":34.32,"ci_high":38.080000000000005,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":7}],"aggregation_source_results":["arena-2|claude-opus-4-7","scale-hle|claude-opus-4-7"],"is_preliminary":false},{"model_id":"kimi-k3-open","base_model":"Kimi K3\nopen","display_name":"Kimi K3\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi K3\nopen","normalized_model_family":"kimi-k3-open","base_model":"Kimi K3\nopen","variant":null,"reasoning_effort":null,"rank":5,"raw_score":90.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["lb-Reasoning|Kimi K3\nopen"],"is_preliminary":false},{"model_id":"gemini-3-pro-preview","base_model":"gemini 3 pro preview","display_name":"gemini 3 pro preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro-preview","normalized_model_family":"gemini-3-pro-preview","base_model":"gemini 3 pro preview","variant":null,"reasoning_effort":null,"rank":5,"raw_score":37.52,"raw_unit":"percent","ci_low":35.620000000000005,"ci_high":39.42,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["scale-hle|gemini-3-pro-preview"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.37267664,"mean_rank":17.333333333333332,"median_rank":21,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":21,"raw_score":1509,"raw_unit":"Elo","ci_low":1502,"ci_high":1516,"rank_spread_min":9,"rank_spread_max":52,"sample_count":10221,"is_preliminary":false,"provider":"Google","source_order":21},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro Preview High","normalized_model_family":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","variant":"High","reasoning_effort":"high","rank":30,"raw_score":84,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":30},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview (thinking high)","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":"High","reasoning_effort":"high","rank":1,"raw_score":46.44,"raw_unit":"percent","ci_low":44.48,"ci_high":48.4,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["arena-2|gemini-3.1-pro-preview","lb-Reasoning|Gemini 3.1 Pro Preview High","scale-hle|gemini-3.1-pro-preview (thinking high)"],"is_preliminary":false},{"model_id":"gpt-5-4-2026-03-05","base_model":"gpt 5.4 2026 03 05","display_name":"gpt 5.4 2026 03 05","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.4-2026-03-05 (xhigh thinking)","normalized_model_family":"gpt-5-4-2026-03-05","base_model":"gpt 5.4 2026 03 05","variant":"Xhigh","reasoning_effort":"xhigh","rank":6,"raw_score":36.24,"raw_unit":"percent","ci_low":34.36,"ci_high":38.120000000000005,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["scale-hle|gpt-5.4-2026-03-05 (xhigh thinking)"],"is_preliminary":false},{"model_id":"claude-opus-4-6-thinking","base_model":"claude opus 4.6 thinking","display_name":"claude opus 4.6 thinking","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-thinking-max","normalized_model_family":"claude-opus-4-6-thinking","base_model":"claude opus 4.6 thinking","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":34.44,"raw_unit":"percent","ci_low":32.58,"ci_high":36.3,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":8}],"aggregation_source_results":["scale-hle|claude-opus-4-6-thinking-max"],"is_preliminary":false},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":9,"raw_score":1528,"raw_unit":"Elo","ci_low":1513,"ci_high":1543,"rank_spread_min":1,"rank_spread_max":31,"sample_count":1619,"is_preliminary":false,"provider":"Moonshot","source_order":9}],"aggregation_source_results":["arena-2|kimi-k3-max"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 xHigh Effort","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":9,"raw_score":89.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["lb-Reasoning|Muse Spark 1.3 xHigh Effort"],"is_preliminary":false}],"candidate_count":170,"ranking":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.73788625,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1548,"raw_unit":"Elo","ci_low":1537,"ci_high":1559,"rank_spread_min":1,"rank_spread_max":13,"sample_count":2939,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":9,"raw_score":89.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-2|claude-fable-5","lb-Reasoning|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.738","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.55594559,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":1532,"raw_unit":"Elo","ci_low":1490,"ci_high":1574,"rank_spread_min":1,"rank_spread_max":65,"sample_count":211,"is_preliminary":false,"provider":"Anthropic","source_order":7},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":91.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-2|claude-fable-5.1-max","lb-Reasoning|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.556","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5-1","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","aliases":["Claude Fable 5.1","claude-fable-5.1-max","Claude Fable 5.1 Max Effort","Fable 5.1 (xhigh)"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.52056426,"mean_rank":9,"median_rank":9,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1547,"raw_unit":"Elo","ci_low":1538,"ci_high":1556,"rank_spread_min":1,"rank_spread_max":13,"sample_count":6409,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1534,"raw_unit":"Elo","ci_low":1526,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":18,"sample_count":7644,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6 (Non-Thinking)","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":16,"raw_score":19,"raw_unit":"percent","ci_low":17.46,"ci_high":20.54,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":19}],"aggregation_source_results":["arena-2|claude-opus-4-6-high","scale-hle|claude-opus-4-6 (Non-Thinking)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.521","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-opus-4-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 9.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","aliases":["Claude Opus 4.6","claude-opus-4-6-high","claude-opus-4-6","claude-opus-4-6 (Non-Thinking)"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.73788625,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1548,"raw_unit":"Elo","ci_low":1537,"ci_high":1559,"rank_spread_min":1,"rank_spread_max":13,"sample_count":2939,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":9,"raw_score":89.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-2|claude-fable-5","lb-Reasoning|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.738","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.55594559,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":1532,"raw_unit":"Elo","ci_low":1490,"ci_high":1574,"rank_spread_min":1,"rank_spread_max":65,"sample_count":211,"is_preliminary":false,"provider":"Anthropic","source_order":7},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":91.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-2|claude-fable-5.1-max","lb-Reasoning|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.556","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5-1","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","aliases":["Claude Fable 5.1","claude-fable-5.1-max","Claude Fable 5.1 Max Effort","Fable 5.1 (xhigh)"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.52056426,"mean_rank":9,"median_rank":9,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1547,"raw_unit":"Elo","ci_low":1538,"ci_high":1556,"rank_spread_min":1,"rank_spread_max":13,"sample_count":6409,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1534,"raw_unit":"Elo","ci_low":1526,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":18,"sample_count":7644,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6 (Non-Thinking)","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":16,"raw_score":19,"raw_unit":"percent","ci_low":17.46,"ci_high":20.54,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":19}],"aggregation_source_results":["arena-2|claude-opus-4-6-high","scale-hle|claude-opus-4-6 (Non-Thinking)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.521","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-opus-4-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 9.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions.","aliases":["Claude Opus 4.6","claude-opus-4-6-high","claude-opus-4-6","claude-opus-4-6 (Non-Thinking)"]}]}],"deepLink":"https://lll.bz/llm?task=expert"},{"id":"math","title":"Mathematics","name":"Mathematics","description":"For hard calculations, proofs and multi-step maths.","category":"text","sourceName":"Arena, LiveBench, Scale Labs","sourceUrl":"https://arena.ai/leaderboard/text/math","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-3","lb-Mathematics","scale-hle"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5-1","confidence":"medium","disagreement_status":"source_split","independent_source_count":3,"source_coverage":0.6666666666666666,"family_weights":{"Arena":0.25,"LiveBench":0.6,"Scale Labs":0.15},"ci_overlap":false,"winner_disagreement":true},"models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["lb-Mathematics|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"math:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.59812463,"mean_rank":2.5,"median_rank":2.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1529,"raw_unit":"Elo","ci_low":1513,"ci_high":1545,"rank_spread_min":1,"rank_spread_max":15,"sample_count":1331,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-3|claude-fable-5","lb-Mathematics|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.598","sourceUrl":"https://arena.ai/leaderboard/text/math","likeKey":"math:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score."},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.42086169,"mean_rank":4.5,"median_rank":4.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1529,"raw_unit":"Elo","ci_low":1507,"ci_high":1551,"rank_spread_min":1,"rank_spread_max":18,"sample_count":740,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1526,"raw_unit":"Elo","ci_low":1510,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":16,"sample_count":1523,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 5 Opus Thinking Max Effort","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":95.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-3|claude-opus-5-max","lb-Mathematics|Claude 5 Opus Thinking Max Effort"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.421","sourceUrl":"https://arena.ai/leaderboard/text/math","likeKey":"math:claude-opus-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 4.50; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score."}],"pending_evaluation":[],"candidates":[{"model_id":"gpt-5-4-pro-2026-03-05","base_model":"gpt 5.4 pro 2026 03 05","display_name":"gpt 5.4 pro 2026 03 05","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.4-pro-2026-03-05","normalized_model_family":"gpt-5-4-pro-2026-03-05","base_model":"gpt 5.4 pro 2026 03 05","variant":null,"reasoning_effort":null,"rank":1,"raw_score":44.32,"raw_unit":"percent","ci_low":42.37,"ci_high":46.27,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["scale-hle|gpt-5.4-pro-2026-03-05"],"is_preliminary":false},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":96.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["lb-Mathematics|GPT-6 Astra Max Effort"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.41796021,"mean_rank":12.5,"median_rank":12.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":22,"raw_score":1485,"raw_unit":"Elo","ci_low":1467,"ci_high":1503,"rank_spread_min":5,"rank_spread_max":62,"sample_count":1033,"is_preliminary":false,"provider":"OpenAI","source_order":22},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":96.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["arena-3|gpt-5.6-sol-xhigh","lb-Mathematics|GPT-5.6 Sol Max Effort"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 xHigh Effort","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":5,"raw_score":95.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["lb-Mathematics|Muse Spark 1.3 xHigh Effort"],"is_preliminary":false},{"model_id":"gemini-3-pro-preview","base_model":"gemini 3 pro preview","display_name":"gemini 3 pro preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro-preview","normalized_model_family":"gemini-3-pro-preview","base_model":"gemini 3 pro preview","variant":null,"reasoning_effort":null,"rank":5,"raw_score":37.52,"raw_unit":"percent","ci_low":35.620000000000005,"ci_high":39.42,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["scale-hle|gemini-3-pro-preview"],"is_preliminary":false},{"model_id":"glm-5-3","base_model":"glm 5.3","display_name":"glm 5.3","official_model_id":null,"provider":"Z.ai","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-max","normalized_model_family":"glm-5-3","base_model":"glm 5.3","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":1514,"raw_unit":"Elo","ci_low":1482,"ci_high":1546,"rank_spread_min":1,"rank_spread_max":46,"sample_count":300,"is_preliminary":false,"provider":"Z.ai","source_order":6}],"aggregation_source_results":["arena-3|glm-5.3-max"],"is_preliminary":false},{"model_id":"gpt-5-4-2026-03-05","base_model":"gpt 5.4 2026 03 05","display_name":"gpt 5.4 2026 03 05","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.4-2026-03-05 (xhigh thinking)","normalized_model_family":"gpt-5-4-2026-03-05","base_model":"gpt 5.4 2026 03 05","variant":"Xhigh","reasoning_effort":"xhigh","rank":6,"raw_score":36.24,"raw_unit":"percent","ci_low":34.36,"ci_high":38.120000000000005,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["scale-hle|gpt-5.4-2026-03-05 (xhigh thinking)"],"is_preliminary":false},{"model_id":"claude-opus-4-6-thinking","base_model":"claude opus 4.6 thinking","display_name":"claude opus 4.6 thinking","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-thinking-max","normalized_model_family":"claude-opus-4-6-thinking","base_model":"claude opus 4.6 thinking","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":34.44,"raw_unit":"percent","ci_low":32.58,"ci_high":36.3,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":8}],"aggregation_source_results":["scale-hle|claude-opus-4-6-thinking-max"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.35255438,"mean_rank":8.5,"median_rank":8.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.5","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1502,"raw_unit":"Elo","ci_low":1491,"ci_high":1513,"rank_spread_min":2,"rank_spread_max":37,"sample_count":3239,"is_preliminary":false,"provider":"OpenAI","source_order":12},{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-high","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":"High","reasoning_effort":"high","rank":18,"raw_score":1491,"raw_unit":"Elo","ci_low":1480,"ci_high":1502,"rank_spread_min":5,"rank_spread_max":50,"sample_count":3170,"is_preliminary":false,"provider":"OpenAI","source_order":18},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5 Thinking xHigh Effort","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":5,"raw_score":95.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":6}],"aggregation_source_results":["arena-3|gpt-5.5","lb-Mathematics|GPT-5.5 Thinking xHigh Effort"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.34266311,"mean_rank":14,"median_rank":20,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":21,"raw_score":1489,"raw_unit":"Elo","ci_low":1480,"ci_high":1498,"rank_spread_min":5,"rank_spread_max":50,"sample_count":5406,"is_preliminary":false,"provider":"Google","source_order":21},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro Preview High","normalized_model_family":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","variant":"High","reasoning_effort":"high","rank":20,"raw_score":91,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":20},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview (thinking high)","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":"High","reasoning_effort":"high","rank":1,"raw_score":46.44,"raw_unit":"percent","ci_low":44.48,"ci_high":48.4,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["arena-3|gemini-3.1-pro-preview","lb-Mathematics|Gemini 3.1 Pro Preview High","scale-hle|gemini-3.1-pro-preview (thinking high)"],"is_preliminary":false},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.33352696,"mean_rank":10.5,"median_rank":10.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":5,"raw_score":1517,"raw_unit":"Elo","ci_low":1507,"ci_high":1527,"rank_spread_min":1,"rank_spread_max":18,"sample_count":3706,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1506,"raw_unit":"Elo","ci_low":1496,"ci_high":1516,"rank_spread_min":1,"rank_spread_max":29,"sample_count":4122,"is_preliminary":false,"provider":"Anthropic","source_order":7},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6 (Non-Thinking)","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":16,"raw_score":19,"raw_unit":"percent","ci_low":17.46,"ci_high":20.54,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":19}],"aggregation_source_results":["arena-3|claude-opus-4-6-high","scale-hle|claude-opus-4-6 (Non-Thinking)"],"is_preliminary":false},{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.31742592,"mean_rank":8,"median_rank":8,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.7-flash-high","normalized_model_family":"gemini-3-7-flash","base_model":"gemini 3.7 flash","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1524,"raw_unit":"Elo","ci_low":1491,"ci_high":1557,"rank_spread_min":1,"rank_spread_max":38,"sample_count":313,"is_preliminary":true,"provider":"Google","source_order":4},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.7 Flash High","normalized_model_family":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","variant":"High","reasoning_effort":"high","rank":12,"raw_score":93.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":12}],"aggregation_source_results":["arena-3|gemini-3.7-flash-high","lb-Mathematics|Gemini 3.7 Flash High"],"is_preliminary":true}],"candidate_count":171,"ranking":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["lb-Mathematics|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"math:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","aliases":["Claude Fable 5.1","Claude Fable 5.1 Max Effort","Fable 5.1 (xhigh)"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.59812463,"mean_rank":2.5,"median_rank":2.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1529,"raw_unit":"Elo","ci_low":1513,"ci_high":1545,"rank_spread_min":1,"rank_spread_max":15,"sample_count":1331,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-3|claude-fable-5","lb-Mathematics|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.598","sourceUrl":"https://arena.ai/leaderboard/text/math","likeKey":"math:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.42086169,"mean_rank":4.5,"median_rank":4.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1529,"raw_unit":"Elo","ci_low":1507,"ci_high":1551,"rank_spread_min":1,"rank_spread_max":18,"sample_count":740,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1526,"raw_unit":"Elo","ci_low":1510,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":16,"sample_count":1523,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 5 Opus Thinking Max Effort","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":95.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-3|claude-opus-5-max","lb-Mathematics|Claude 5 Opus Thinking Max Effort"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.421","sourceUrl":"https://arena.ai/leaderboard/text/math","likeKey":"math:claude-opus-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 4.50; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","aliases":["Claude Opus 5","claude-opus-5-max","claude-opus-5-high","Claude 5 Opus Thinking Max Effort"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["lb-Mathematics|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"math:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","aliases":["Claude Fable 5.1","Claude Fable 5.1 Max Effort","Fable 5.1 (xhigh)"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.59812463,"mean_rank":2.5,"median_rank":2.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1529,"raw_unit":"Elo","ci_low":1513,"ci_high":1545,"rank_spread_min":1,"rank_spread_max":15,"sample_count":1331,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-3|claude-fable-5","lb-Mathematics|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.598","sourceUrl":"https://arena.ai/leaderboard/text/math","likeKey":"math:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.42086169,"mean_rank":4.5,"median_rank":4.5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1529,"raw_unit":"Elo","ci_low":1507,"ci_high":1551,"rank_spread_min":1,"rank_spread_max":18,"sample_count":740,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1526,"raw_unit":"Elo","ci_low":1510,"ci_high":1542,"rank_spread_min":1,"rank_spread_max":16,"sample_count":1523,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 5 Opus Thinking Max Effort","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":95.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-3|claude-opus-5-max","lb-Mathematics|Claude 5 Opus Thinking Max Effort"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.421","sourceUrl":"https://arena.ai/leaderboard/text/math","likeKey":"math:claude-opus-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 4.50; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score.","aliases":["Claude Opus 5","claude-opus-5-max","claude-opus-5-high","Claude 5 Opus Thinking Max Effort"]}]}],"deepLink":"https://lll.bz/llm?task=math"},{"id":"instructions","title":"Instruction following","name":"Instruction following","description":"For prompts with detailed constraints and required formats.","category":"text","sourceName":"Arena, Artificial Analysis, LiveBench","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-4","lb-Instruction Following","aa-if"],"consensus":{"method":"weighted_reciprocal_rank","winner":"grok-4-3","confidence":"medium","disagreement_status":"source_split","independent_source_count":3,"source_coverage":1,"family_weights":{"Arena":1,"Artificial Analysis":1,"LiveBench":1},"ci_overlap":false,"winner_disagreement":true},"models":[{"model_id":"grok-4-3","base_model":"Grok 4.3","display_name":"Grok 4.3","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.44489779,"mean_rank":49.333333333333336,"median_rank":40,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.3","normalized_model_family":"grok-4-3","base_model":"grok 4.3","variant":null,"reasoning_effort":null,"rank":107,"raw_score":1416,"raw_unit":"Elo","ci_low":1411,"ci_high":1421,"rank_spread_min":86,"rank_spread_max":130,"sample_count":22801,"is_preliminary":false,"provider":"SpaceXAI","source_order":107},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":null,"reasoning_effort":null,"rank":40,"raw_score":62.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":40},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (medium)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":83.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (high)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"High","reasoning_effort":"high","rank":5,"raw_score":81.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["arena-4|grok-4.3","lb-Instruction Following|Grok 4.3","aa-if|Grok 4.3 (medium)"],"is_preliminary":false,"rank":1,"modelId":"grok-4-3","modelName":"Grok 4.3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.445","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:grok-4-3","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 49.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.42540059,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1512,"raw_unit":"Elo","ci_low":1505,"ci_high":1519,"rank_spread_min":1,"rank_spread_max":7,"sample_count":9607,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":75.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":10,"raw_score":63.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["arena-4|claude-fable-5","lb-Instruction Following|Claude Fable 5 Max Effort","aa-if|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.425","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 6.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result."},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.375,"mean_rank":9,"median_rank":9,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1481,"raw_unit":"Elo","ci_low":1476,"ci_high":1486,"rank_spread_min":9,"rank_spread_max":31,"sample_count":34766,"is_preliminary":false,"provider":"Google","source_order":15},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro Preview High","normalized_model_family":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","variant":"High","reasoning_effort":"high","rank":3,"raw_score":79.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-4|gemini-3.1-pro-preview","lb-Instruction Following|Gemini 3.1 Pro Preview High"],"is_preliminary":false,"rank":3,"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.375","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:gemini-3-1-pro-preview","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 9.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1514,"raw_unit":"Elo","ci_low":1509,"ci_high":1519,"rank_spread_min":1,"rank_spread_max":4,"sample_count":22974,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1500,"raw_unit":"Elo","ci_low":1495,"ci_high":1505,"rank_spread_min":2,"rank_spread_max":13,"sample_count":25180,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-4|claude-opus-4-6-high"],"is_preliminary":false},{"model_id":"gemini-3-8-flash","base_model":"gemini 3.8 flash","display_name":"gemini 3.8 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.650515,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.8-flash-high","normalized_model_family":"gemini-3-8-flash","base_model":"gemini 3.8 flash","variant":"High","reasoning_effort":"high","rank":9,"raw_score":1491,"raw_unit":"Elo","ci_low":1477,"ci_high":1505,"rank_spread_min":2,"rank_spread_max":31,"sample_count":1816,"is_preliminary":true,"provider":"Google","source_order":9},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.8 Flash High","normalized_model_family":"gemini-3-8-flash","base_model":"Gemini 3.8 Flash","variant":"High","reasoning_effort":"high","rank":1,"raw_score":81.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-4|gemini-3.8-flash-high","lb-Instruction Following|Gemini 3.8 Flash High"],"is_preliminary":true},{"model_id":"grok-4-20-0309","base_model":"Grok 4.20 0309","display_name":"Grok 4.20 0309","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.20 0309","normalized_model_family":"grok-4-20-0309","base_model":"Grok 4.20 0309","variant":null,"reasoning_effort":null,"rank":2,"raw_score":82.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["aa-if|Grok 4.20 0309"],"is_preliminary":false},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1503,"raw_unit":"Elo","ci_low":1497,"ci_high":1509,"rank_spread_min":1,"rank_spread_max":11,"sample_count":20827,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1493,"raw_unit":"Elo","ci_low":1487,"ci_high":1499,"rank_spread_min":3,"rank_spread_max":16,"sample_count":21351,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-4|claude-opus-4-7-high"],"is_preliminary":false},{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.45058395,"mean_rank":7,"median_rank":7,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.7-flash-high","normalized_model_family":"gemini-3-7-flash","base_model":"gemini 3.7 flash","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1485,"raw_unit":"Elo","ci_low":1471,"ci_high":1499,"rank_spread_min":3,"rank_spread_max":37,"sample_count":2045,"is_preliminary":true,"provider":"Google","source_order":12},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.7 Flash High","normalized_model_family":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","variant":"High","reasoning_effort":"high","rank":2,"raw_score":79.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["arena-4|gemini-3.7-flash-high","lb-Instruction Following|Gemini 3.7 Flash High"],"is_preliminary":true},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 xHigh Effort","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":4,"raw_score":78,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["lb-Instruction Following|Muse Spark 1.3 xHigh Effort"],"is_preliminary":false},{"model_id":"nemotron-3-ultra","base_model":"Nemotron 3 Ultra","display_name":"Nemotron 3 Ultra","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Nemotron 3 Ultra","normalized_model_family":"nemotron-3-ultra","base_model":"Nemotron 3 Ultra","variant":null,"reasoning_effort":null,"rank":4,"raw_score":81.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["aa-if|Nemotron 3 Ultra"],"is_preliminary":false},{"model_id":"qwen-3-8-flash-next-open","base_model":"Qwen 3.8 Flash Next\nopen","display_name":"Qwen 3.8 Flash Next\nopen","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen 3.8 Flash Next\nopen","normalized_model_family":"qwen-3-8-flash-next-open","base_model":"Qwen 3.8 Flash Next\nopen","variant":null,"reasoning_effort":null,"rank":5,"raw_score":77.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["lb-Instruction Following|Qwen 3.8 Flash Next\nopen"],"is_preliminary":false},{"model_id":"grok-4-20-0309-v2","base_model":"Grok 4.20 0309 v2","display_name":"Grok 4.20 0309 v2","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.20 0309 v2","normalized_model_family":"grok-4-20-0309-v2","base_model":"Grok 4.20 0309 v2","variant":null,"reasoning_effort":null,"rank":6,"raw_score":81.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["aa-if|Grok 4.20 0309 v2"],"is_preliminary":false},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":75.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":7}],"aggregation_source_results":["lb-Instruction Following|GPT-6 Astra Max Effort"],"is_preliminary":false},{"model_id":"minimax-m3","base_model":"minimax m3","display_name":"minimax m3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.32335937,"mean_rank":41,"median_rank":48,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-m3","normalized_model_family":"minimax-m3","base_model":"minimax m3","variant":null,"reasoning_effort":null,"rank":73,"raw_score":1435,"raw_unit":"Elo","ci_low":1429,"ci_high":1441,"rank_spread_min":55,"rank_spread_max":98,"sample_count":15420,"is_preliminary":false,"provider":"MiniMax","source_order":73},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax M3","normalized_model_family":"minimax-m3","base_model":"Minimax M3","variant":null,"reasoning_effort":null,"rank":48,"raw_score":57.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":48},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax-M3","normalized_model_family":"minimax-m3","base_model":"MiniMax-M3","variant":null,"reasoning_effort":null,"rank":2,"raw_score":82.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-4|minimax-m3","lb-Instruction Following|Minimax M3","aa-if|MiniMax-M3"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.3333333333333333,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":8,"raw_score":1492,"raw_unit":"Elo","ci_low":1486,"ci_high":1498,"rank_spread_min":3,"rank_spread_max":16,"sample_count":16979,"is_preliminary":false,"provider":"Anthropic","source_order":8},{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":19,"raw_score":1477,"raw_unit":"Elo","ci_low":1471,"ci_high":1483,"rank_spread_min":9,"rank_spread_max":37,"sample_count":17375,"is_preliminary":false,"provider":"Anthropic","source_order":19}],"aggregation_source_results":["arena-4|claude-opus-4-8-high"],"is_preliminary":false}],"candidate_count":136,"ranking":[{"model_id":"grok-4-3","base_model":"Grok 4.3","display_name":"Grok 4.3","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.44489779,"mean_rank":49.333333333333336,"median_rank":40,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.3","normalized_model_family":"grok-4-3","base_model":"grok 4.3","variant":null,"reasoning_effort":null,"rank":107,"raw_score":1416,"raw_unit":"Elo","ci_low":1411,"ci_high":1421,"rank_spread_min":86,"rank_spread_max":130,"sample_count":22801,"is_preliminary":false,"provider":"SpaceXAI","source_order":107},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":null,"reasoning_effort":null,"rank":40,"raw_score":62.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":40},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (medium)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":83.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (high)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"High","reasoning_effort":"high","rank":5,"raw_score":81.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["arena-4|grok-4.3","lb-Instruction Following|Grok 4.3","aa-if|Grok 4.3 (medium)"],"is_preliminary":false,"rank":1,"modelId":"grok-4-3","modelName":"Grok 4.3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.445","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:grok-4-3","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 49.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","aliases":["Grok 4.3","grok-4.3","Grok 4.3","Grok 4.3 (medium)","Grok 4.3 (high)"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.42540059,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1512,"raw_unit":"Elo","ci_low":1505,"ci_high":1519,"rank_spread_min":1,"rank_spread_max":7,"sample_count":9607,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":75.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":10,"raw_score":63.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["arena-4|claude-fable-5","lb-Instruction Following|Claude Fable 5 Max Effort","aa-if|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.425","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 6.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort","Claude Fable 5 (with fallback)"]},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.375,"mean_rank":9,"median_rank":9,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1481,"raw_unit":"Elo","ci_low":1476,"ci_high":1486,"rank_spread_min":9,"rank_spread_max":31,"sample_count":34766,"is_preliminary":false,"provider":"Google","source_order":15},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro Preview High","normalized_model_family":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","variant":"High","reasoning_effort":"high","rank":3,"raw_score":79.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-4|gemini-3.1-pro-preview","lb-Instruction Following|Gemini 3.1 Pro Preview High"],"is_preliminary":false,"rank":3,"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.375","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:gemini-3-1-pro-preview","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 9.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","aliases":["Gemini 3.1 Pro Preview","gemini-3.1-pro-preview","Gemini 3.1 Pro Preview High"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"grok-4-3","base_model":"Grok 4.3","display_name":"Grok 4.3","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.44489779,"mean_rank":49.333333333333336,"median_rank":40,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.3","normalized_model_family":"grok-4-3","base_model":"grok 4.3","variant":null,"reasoning_effort":null,"rank":107,"raw_score":1416,"raw_unit":"Elo","ci_low":1411,"ci_high":1421,"rank_spread_min":86,"rank_spread_max":130,"sample_count":22801,"is_preliminary":false,"provider":"SpaceXAI","source_order":107},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":null,"reasoning_effort":null,"rank":40,"raw_score":62.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":40},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (medium)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":83.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (high)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"High","reasoning_effort":"high","rank":5,"raw_score":81.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["arena-4|grok-4.3","lb-Instruction Following|Grok 4.3","aa-if|Grok 4.3 (medium)"],"is_preliminary":false,"rank":1,"modelId":"grok-4-3","modelName":"Grok 4.3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.445","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:grok-4-3","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 49.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","aliases":["Grok 4.3","grok-4.3","Grok 4.3","Grok 4.3 (medium)","Grok 4.3 (high)"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.42540059,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1512,"raw_unit":"Elo","ci_low":1505,"ci_high":1519,"rank_spread_min":1,"rank_spread_max":7,"sample_count":9607,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":75.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":10,"raw_score":63.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["arena-4|claude-fable-5","lb-Instruction Following|Claude Fable 5 Max Effort","aa-if|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.425","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 6.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","aliases":["Claude Fable 5","claude-fable-5","Claude Fable 5 Max Effort","Claude Fable 5 (with fallback)"]},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.375,"mean_rank":9,"median_rank":9,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1481,"raw_unit":"Elo","ci_low":1476,"ci_high":1486,"rank_spread_min":9,"rank_spread_max":31,"sample_count":34766,"is_preliminary":false,"provider":"Google","source_order":15},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro Preview High","normalized_model_family":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","variant":"High","reasoning_effort":"high","rank":3,"raw_score":79.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-4|gemini-3.1-pro-preview","lb-Instruction Following|Gemini 3.1 Pro Preview High"],"is_preliminary":false,"rank":3,"modelId":"gemini-3-1-pro-preview","modelName":"Gemini 3.1 Pro Preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.375","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:gemini-3-1-pro-preview","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 9.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result.","aliases":["Gemini 3.1 Pro Preview","gemini-3.1-pro-preview","Gemini 3.1 Pro Preview High"]}]}],"deepLink":"https://lll.bz/llm?task=instructions"},{"id":"writing","title":"Copywriting","name":"Copywriting","description":"For persuasive, creative and polished marketing text.","category":"text","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-5","arena-writing2"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5","confidence":"low","disagreement_status":"source_split","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":true},"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":5480,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1505,"raw_unit":"Elo","ci_low":1497,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":8,"sample_count":7328,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-5|claude-fable-5","arena-writing2|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.67810359,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":1487,"raw_unit":"Elo","ci_low":1462,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":30,"sample_count":608,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1526,"raw_unit":"Elo","ci_low":1504,"ci_high":1548,"rank_spread_min":1,"rank_spread_max":7,"sample_count":782,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-5|claude-fable-5.1-max","arena-writing2|claude-fable-5.1-max"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.678","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.56546488,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1500,"raw_unit":"Elo","ci_low":1493,"ci_high":1507,"rank_spread_min":1,"rank_spread_max":6,"sample_count":12678,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1479,"raw_unit":"Elo","ci_low":1472,"ci_high":1486,"rank_spread_min":3,"rank_spread_max":22,"sample_count":12724,"is_preliminary":false,"provider":"Anthropic","source_order":9},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1502,"raw_unit":"Elo","ci_low":1496,"ci_high":1508,"rank_spread_min":1,"rank_spread_max":9,"sample_count":18186,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1494,"raw_unit":"Elo","ci_low":1488,"ci_high":1500,"rank_spread_min":2,"rank_spread_max":10,"sample_count":18365,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-5|claude-opus-4-6-high","arena-writing2|claude-opus-4-6-high"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.565","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"gemini-3-8-flash","base_model":"gemini 3.8 flash","display_name":"gemini 3.8 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.8-flash-high","normalized_model_family":"gemini-3-8-flash","base_model":"gemini 3.8 flash","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1495,"raw_unit":"Elo","ci_low":1476,"ci_high":1514,"rank_spread_min":1,"rank_spread_max":19,"sample_count":1086,"is_preliminary":true,"provider":"Google","source_order":4},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.8-flash-high","normalized_model_family":"gemini-3-8-flash","base_model":"gemini 3.8 flash","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1501,"raw_unit":"Elo","ci_low":1484,"ci_high":1518,"rank_spread_min":1,"rank_spread_max":15,"sample_count":1391,"is_preliminary":true,"provider":"Google","source_order":4}],"aggregation_source_results":["arena-5|gemini-3.8-flash-high","arena-writing2|gemini-3.8-flash-high"],"is_preliminary":true},{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.400515,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.7-flash-high","normalized_model_family":"gemini-3-7-flash","base_model":"gemini 3.7 flash","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1496,"raw_unit":"Elo","ci_low":1478,"ci_high":1514,"rank_spread_min":1,"rank_spread_max":18,"sample_count":1203,"is_preliminary":true,"provider":"Google","source_order":3},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.7-flash-high","normalized_model_family":"gemini-3-7-flash","base_model":"gemini 3.7 flash","variant":"High","reasoning_effort":"high","rank":9,"raw_score":1489,"raw_unit":"Elo","ci_low":1473,"ci_high":1505,"rank_spread_min":1,"rank_spread_max":23,"sample_count":1491,"is_preliminary":true,"provider":"Google","source_order":9}],"aggregation_source_results":["arena-5|gemini-3.7-flash-high","arena-writing2|gemini-3.7-flash-high"],"is_preliminary":true},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.35115884,"mean_rank":6.5,"median_rank":6.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":5,"raw_score":1489,"raw_unit":"Elo","ci_low":1482,"ci_high":1496,"rank_spread_min":1,"rank_spread_max":15,"sample_count":10536,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1481,"raw_unit":"Elo","ci_low":1474,"ci_high":1488,"rank_spread_min":3,"rank_spread_max":21,"sample_count":10800,"is_preliminary":false,"provider":"Anthropic","source_order":8},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":8,"raw_score":1491,"raw_unit":"Elo","ci_low":1485,"ci_high":1497,"rank_spread_min":3,"rank_spread_max":16,"sample_count":14988,"is_preliminary":false,"provider":"Anthropic","source_order":8},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1479,"raw_unit":"Elo","ci_low":1473,"ci_high":1485,"rank_spread_min":7,"rank_spread_max":23,"sample_count":15372,"is_preliminary":false,"provider":"Anthropic","source_order":11}],"aggregation_source_results":["arena-5|claude-opus-4-7-high","arena-writing2|claude-opus-4-7-high"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.32854548,"mean_rank":8.5,"median_rank":8.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1475,"raw_unit":"Elo","ci_low":1467,"ci_high":1483,"rank_spread_min":3,"rank_spread_max":29,"sample_count":7630,"is_preliminary":false,"provider":"Anthropic","source_order":12},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":13,"raw_score":1471,"raw_unit":"Elo","ci_low":1460,"ci_high":1482,"rank_spread_min":3,"rank_spread_max":32,"sample_count":3754,"is_preliminary":false,"provider":"Anthropic","source_order":13},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":5,"raw_score":1500,"raw_unit":"Elo","ci_low":1491,"ci_high":1509,"rank_spread_min":1,"rank_spread_max":10,"sample_count":4815,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":6,"raw_score":1500,"raw_unit":"Elo","ci_low":1493,"ci_high":1507,"rank_spread_min":1,"rank_spread_max":9,"sample_count":9820,"is_preliminary":false,"provider":"Anthropic","source_order":6}],"aggregation_source_results":["arena-5|claude-opus-5-high","arena-writing2|claude-opus-5-max"],"is_preliminary":false},{"model_id":"gemini-3-pro","base_model":"gemini 3 pro","display_name":"gemini 3 pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.29799143,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro","normalized_model_family":"gemini-3-pro","base_model":"gemini 3 pro","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1483,"raw_unit":"Elo","ci_low":1475,"ci_high":1491,"rank_spread_min":3,"rank_spread_max":20,"sample_count":6236,"is_preliminary":false,"provider":"Google","source_order":7},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro","normalized_model_family":"gemini-3-pro","base_model":"gemini 3 pro","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1478,"raw_unit":"Elo","ci_low":1471,"ci_high":1485,"rank_spread_min":7,"rank_spread_max":23,"sample_count":9182,"is_preliminary":false,"provider":"Google","source_order":13}],"aggregation_source_results":["arena-5|gemini-3-pro","arena-writing2|gemini-3-pro"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1479,"raw_unit":"Elo","ci_low":1473,"ci_high":1485,"rank_spread_min":3,"rank_spread_max":21,"sample_count":17972,"is_preliminary":false,"provider":"Google","source_order":10},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1480,"raw_unit":"Elo","ci_low":1475,"ci_high":1485,"rank_spread_min":7,"rank_spread_max":20,"sample_count":25496,"is_preliminary":false,"provider":"Google","source_order":10}],"aggregation_source_results":["arena-5|gemini-3.1-pro-preview","arena-writing2|gemini-3.1-pro-preview"],"is_preliminary":false},{"model_id":"gemini-3-5-flash","base_model":"gemini 3.5 flash","display_name":"gemini 3.5 flash","official_model_id":null,"provider":"Google","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.25744435,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-medium","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"Medium","reasoning_effort":"medium","rank":16,"raw_score":1467,"raw_unit":"Elo","ci_low":1458,"ci_high":1476,"rank_spread_min":6,"rank_spread_max":36,"sample_count":6242,"is_preliminary":false,"provider":"Google","source_order":16},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-high","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"High","reasoning_effort":"high","rank":20,"raw_score":1465,"raw_unit":"Elo","ci_low":1457,"ci_high":1473,"rank_spread_min":9,"rank_spread_max":39,"sample_count":6320,"is_preliminary":false,"provider":"Google","source_order":20},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-high","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1479,"raw_unit":"Elo","ci_low":1472,"ci_high":1486,"rank_spread_min":7,"rank_spread_max":23,"sample_count":8677,"is_preliminary":false,"provider":"Google","source_order":12},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-medium","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"Medium","reasoning_effort":"medium","rank":16,"raw_score":1472,"raw_unit":"Elo","ci_low":1465,"ci_high":1479,"rank_spread_min":9,"rank_spread_max":28,"sample_count":8627,"is_preliminary":false,"provider":"Google","source_order":16}],"aggregation_source_results":["arena-5|gemini-3.5-flash-medium","arena-writing2|gemini-3.5-flash-high"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.25159338,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":11,"raw_score":1477,"raw_unit":"Elo","ci_low":1467,"ci_high":1487,"rank_spread_min":3,"rank_spread_max":29,"sample_count":4670,"is_preliminary":false,"provider":"OpenAI","source_order":11},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":21,"raw_score":1465,"raw_unit":"Elo","ci_low":1457,"ci_high":1473,"rank_spread_min":10,"rank_spread_max":36,"sample_count":6120,"is_preliminary":false,"provider":"OpenAI","source_order":21}],"aggregation_source_results":["arena-5|gpt-5.6-sol-xhigh","arena-writing2|gpt-5.6-sol-xhigh"],"is_preliminary":false},{"model_id":"gemini-3-6-flash","base_model":"gemini 3.6 flash","display_name":"gemini 3.6 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.24788525,"mean_rank":15.5,"median_rank":15.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.6-flash-high","normalized_model_family":"gemini-3-6-flash","base_model":"gemini 3.6 flash","variant":"High","reasoning_effort":"high","rank":14,"raw_score":1469,"raw_unit":"Elo","ci_low":1459,"ci_high":1479,"rank_spread_min":4,"rank_spread_max":36,"sample_count":4485,"is_preliminary":false,"provider":"Google","source_order":14},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.6-flash-high","normalized_model_family":"gemini-3-6-flash","base_model":"gemini 3.6 flash","variant":"High","reasoning_effort":"high","rank":17,"raw_score":1471,"raw_unit":"Elo","ci_low":1462,"ci_high":1480,"rank_spread_min":9,"rank_spread_max":30,"sample_count":5916,"is_preliminary":false,"provider":"Google","source_order":17}],"aggregation_source_results":["arena-5|gemini-3.6-flash-high","arena-writing2|gemini-3.6-flash-high"],"is_preliminary":false},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.24568347,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":18,"raw_score":1466,"raw_unit":"Elo","ci_low":1453,"ci_high":1479,"rank_spread_min":4,"rank_spread_max":44,"sample_count":2604,"is_preliminary":false,"provider":"Alibaba","source_order":18},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":14,"raw_score":1473,"raw_unit":"Elo","ci_low":1462,"ci_high":1484,"rank_spread_min":8,"rank_spread_max":30,"sample_count":3375,"is_preliminary":false,"provider":"Alibaba","source_order":14}],"aggregation_source_results":["arena-5|qwen3.8-max","arena-writing2|qwen3.8-max"],"is_preliminary":false},{"model_id":"glm-5-3","base_model":"glm 5.3","display_name":"glm 5.3","official_model_id":null,"provider":"Z.ai","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.24490623,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-max","normalized_model_family":"glm-5-3","base_model":"glm 5.3","variant":"Max","reasoning_effort":"max","rank":17,"raw_score":1467,"raw_unit":"Elo","ci_low":1452,"ci_high":1482,"rank_spread_min":3,"rank_spread_max":48,"sample_count":1719,"is_preliminary":false,"provider":"Z.ai","source_order":17},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-max","normalized_model_family":"glm-5-3","base_model":"glm 5.3","variant":"Max","reasoning_effort":"max","rank":15,"raw_score":1473,"raw_unit":"Elo","ci_low":1460,"ci_high":1486,"rank_spread_min":7,"rank_spread_max":35,"sample_count":2204,"is_preliminary":false,"provider":"Z.ai","source_order":15}],"aggregation_source_results":["arena-5|glm-5.3-max","arena-writing2|glm-5.3-max"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.22335825,"mean_rank":21.5,"median_rank":21.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":19,"raw_score":1465,"raw_unit":"Elo","ci_low":1458,"ci_high":1472,"rank_spread_min":10,"rank_spread_max":36,"sample_count":9218,"is_preliminary":false,"provider":"Anthropic","source_order":19},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":22,"raw_score":1463,"raw_unit":"Elo","ci_low":1456,"ci_high":1470,"rank_spread_min":10,"rank_spread_max":39,"sample_count":9276,"is_preliminary":false,"provider":"Anthropic","source_order":22},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":24,"raw_score":1462,"raw_unit":"Elo","ci_low":1455,"ci_high":1469,"rank_spread_min":14,"rank_spread_max":40,"sample_count":12750,"is_preliminary":false,"provider":"Anthropic","source_order":24},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":31,"raw_score":1454,"raw_unit":"Elo","ci_low":1447,"ci_high":1461,"rank_spread_min":18,"rank_spread_max":45,"sample_count":12764,"is_preliminary":false,"provider":"Anthropic","source_order":31}],"aggregation_source_results":["arena-5|claude-opus-4-8","arena-writing2|claude-opus-4-8-high"],"is_preliminary":false}],"candidate_count":115,"ranking":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":5480,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1505,"raw_unit":"Elo","ci_low":1497,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":8,"sample_count":7328,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-5|claude-fable-5","arena-writing2|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5","claude-fable-5"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.67810359,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":1487,"raw_unit":"Elo","ci_low":1462,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":30,"sample_count":608,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1526,"raw_unit":"Elo","ci_low":1504,"ci_high":1548,"rank_spread_min":1,"rank_spread_max":7,"sample_count":782,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-5|claude-fable-5.1-max","arena-writing2|claude-fable-5.1-max"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.678","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max","claude-fable-5.1-max"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.56546488,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1500,"raw_unit":"Elo","ci_low":1493,"ci_high":1507,"rank_spread_min":1,"rank_spread_max":6,"sample_count":12678,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1479,"raw_unit":"Elo","ci_low":1472,"ci_high":1486,"rank_spread_min":3,"rank_spread_max":22,"sample_count":12724,"is_preliminary":false,"provider":"Anthropic","source_order":9},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1502,"raw_unit":"Elo","ci_low":1496,"ci_high":1508,"rank_spread_min":1,"rank_spread_max":9,"sample_count":18186,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1494,"raw_unit":"Elo","ci_low":1488,"ci_high":1500,"rank_spread_min":2,"rank_spread_max":10,"sample_count":18365,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-5|claude-opus-4-6-high","arena-writing2|claude-opus-4-6-high"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.565","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.6","claude-opus-4-6-high","claude-opus-4-6","claude-opus-4-6-high","claude-opus-4-6"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":5480,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1505,"raw_unit":"Elo","ci_low":1497,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":8,"sample_count":7328,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-5|claude-fable-5","arena-writing2|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5","claude-fable-5"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.67810359,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":6,"raw_score":1487,"raw_unit":"Elo","ci_low":1462,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":30,"sample_count":608,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1526,"raw_unit":"Elo","ci_low":1504,"ci_high":1548,"rank_spread_min":1,"rank_spread_max":7,"sample_count":782,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-5|claude-fable-5.1-max","arena-writing2|claude-fable-5.1-max"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.678","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max","claude-fable-5.1-max"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.56546488,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1500,"raw_unit":"Elo","ci_low":1493,"ci_high":1507,"rank_spread_min":1,"rank_spread_max":6,"sample_count":12678,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1479,"raw_unit":"Elo","ci_low":1472,"ci_high":1486,"rank_spread_min":3,"rank_spread_max":22,"sample_count":12724,"is_preliminary":false,"provider":"Anthropic","source_order":9},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1502,"raw_unit":"Elo","ci_low":1496,"ci_high":1508,"rank_spread_min":1,"rank_spread_max":9,"sample_count":18186,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1494,"raw_unit":"Elo","ci_low":1488,"ci_high":1500,"rank_spread_min":2,"rank_spread_max":10,"sample_count":18365,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-5|claude-opus-4-6-high","arena-writing2|claude-opus-4-6-high"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.565","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.6","claude-opus-4-6-high","claude-opus-4-6","claude-opus-4-6-high","claude-opus-4-6"]}]}],"deepLink":"https://lll.bz/llm?task=writing"},{"id":"research","title":"Search and research","name":"Search and research","description":"For web search, evidence gathering and sourced answers.","category":"text","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/search","sourceDate":"2026-08-24","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-9"],"consensus":{"method":"weighted_reciprocal_rank","winner":"gpt-5-6-sol","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":1257,"raw_unit":"Elo","ci_low":1250,"ci_high":1264,"rank_spread_min":1,"rank_spread_max":2,"sample_count":29663,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-9|gpt-5.6-sol-xhigh"],"is_preliminary":false,"rank":1,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-search","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1253,"raw_unit":"Elo","ci_low":1248,"ci_high":1258,"rank_spread_min":1,"rank_spread_max":2,"sample_count":134699,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-9|claude-opus-4-6-search"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-search","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1242,"raw_unit":"Elo","ci_low":1237,"ci_high":1247,"rank_spread_min":3,"rank_spread_max":5,"sample_count":89873,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["arena-9|gpt-5.5-search"],"is_preliminary":false,"rank":3,"modelId":"gpt-5-5","modelName":"GPT-5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","rank":null,"evaluation_status":"pending_evaluation","note":"New release — awaiting comparable task-level evidence.","source_results":[]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","rank":null,"evaluation_status":"pending_evaluation","note":"New release — awaiting comparable task-level evidence.","source_results":[]}],"candidates":[{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1233,"raw_unit":"Elo","ci_low":1228,"ci_high":1238,"rank_spread_min":3,"rank_spread_max":6,"sample_count":91394,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-9|claude-opus-4-7"],"is_preliminary":false},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1230,"raw_unit":"Elo","ci_low":1222,"ci_high":1238,"rank_spread_min":3,"rank_spread_max":7,"sample_count":41795,"is_preliminary":false,"provider":"Anthropic","source_order":5}],"aggregation_source_results":["arena-9|claude-fable-5"],"is_preliminary":false},{"model_id":"ernie-5-1","base_model":"ernie 5.1","display_name":"ernie 5.1","official_model_id":null,"provider":"Baidu","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"ernie-5.1","normalized_model_family":"ernie-5-1","base_model":"ernie 5.1","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1227,"raw_unit":"Elo","ci_low":1217,"ci_high":1237,"rank_spread_min":4,"rank_spread_max":8,"sample_count":3788,"is_preliminary":false,"provider":"Baidu","source_order":6}],"aggregation_source_results":["arena-9|ernie-5.1"],"is_preliminary":false},{"model_id":"claude-sonnet-4-6","base_model":"claude sonnet 4.6","display_name":"claude sonnet 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-sonnet-4-6-search","normalized_model_family":"claude-sonnet-4-6","base_model":"claude sonnet 4.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1221,"raw_unit":"Elo","ci_low":1216,"ci_high":1226,"rank_spread_min":5,"rank_spread_max":8,"sample_count":134905,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-9|claude-sonnet-4-6-search"],"is_preliminary":false},{"model_id":"grok-4-5","base_model":"grok 4.5","display_name":"grok 4.5","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"grok-4.5","normalized_model_family":"grok-4-5","base_model":"grok 4.5","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1213,"raw_unit":"Elo","ci_low":1206,"ci_high":1220,"rank_spread_min":6,"rank_spread_max":13,"sample_count":31505,"is_preliminary":false,"provider":"SpaceXAI","source_order":8}],"aggregation_source_results":["arena-9|grok-4.5"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-grounding","base_model":"gemini 3.1 pro grounding","display_name":"gemini 3.1 pro grounding","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-grounding","normalized_model_family":"gemini-3-1-pro-grounding","base_model":"gemini 3.1 pro grounding","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1210,"raw_unit":"Elo","ci_low":1205,"ci_high":1215,"rank_spread_min":8,"rank_spread_max":13,"sample_count":113282,"is_preliminary":false,"provider":"Google","source_order":9}],"aggregation_source_results":["arena-9|gemini-3.1-pro-grounding"],"is_preliminary":false},{"model_id":"gemini-3-pro-grounding","base_model":"gemini 3 pro grounding","display_name":"gemini 3 pro grounding","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro-grounding","normalized_model_family":"gemini-3-pro-grounding","base_model":"gemini 3 pro grounding","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1207,"raw_unit":"Elo","ci_low":1201,"ci_high":1213,"rank_spread_min":8,"rank_spread_max":16,"sample_count":37024,"is_preliminary":false,"provider":"Google","source_order":10}],"aggregation_source_results":["arena-9|gemini-3-pro-grounding"],"is_preliminary":false},{"model_id":"gpt-5-2","base_model":"gpt 5.2","display_name":"gpt 5.2","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.2-search","normalized_model_family":"gpt-5-2","base_model":"gpt 5.2","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1207,"raw_unit":"Elo","ci_low":1201,"ci_high":1213,"rank_spread_min":8,"rank_spread_max":16,"sample_count":52712,"is_preliminary":false,"provider":"OpenAI","source_order":11}],"aggregation_source_results":["arena-9|gpt-5.2-search"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1204,"raw_unit":"Elo","ci_low":1198,"ci_high":1210,"rank_spread_min":8,"rank_spread_max":17,"sample_count":70998,"is_preliminary":false,"provider":"Anthropic","source_order":12}],"aggregation_source_results":["arena-9|claude-opus-4-8"],"is_preliminary":false},{"model_id":"grok-4-20-multi-agent-beta-0309","base_model":"grok 4.20 multi agent beta 0309","display_name":"grok 4.20 multi agent beta 0309","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"grok-4.20-multi-agent-beta-0309","normalized_model_family":"grok-4-20-multi-agent-beta-0309","base_model":"grok 4.20 multi agent beta 0309","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1204,"raw_unit":"Elo","ci_low":1199,"ci_high":1209,"rank_spread_min":8,"rank_spread_max":17,"sample_count":109553,"is_preliminary":false,"provider":"SpaceXAI","source_order":13}],"aggregation_source_results":["arena-9|grok-4.20-multi-agent-beta-0309"],"is_preliminary":false},{"model_id":"gpt-5-1","base_model":"gpt 5.1","display_name":"gpt 5.1","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.1-search","normalized_model_family":"gpt-5-1","base_model":"gpt 5.1","variant":null,"reasoning_effort":null,"rank":14,"raw_score":1199,"raw_unit":"Elo","ci_low":1194,"ci_high":1204,"rank_spread_min":10,"rank_spread_max":18,"sample_count":59909,"is_preliminary":false,"provider":"OpenAI","source_order":14}],"aggregation_source_results":["arena-9|gpt-5.1-search"],"is_preliminary":false},{"model_id":"gemini-3-flash-grounding","base_model":"gemini 3 flash grounding","display_name":"gemini 3 flash grounding","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gemini-3-flash-grounding","normalized_model_family":"gemini-3-flash-grounding","base_model":"gemini 3 flash grounding","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1198,"raw_unit":"Elo","ci_low":1193,"ci_high":1203,"rank_spread_min":10,"rank_spread_max":18,"sample_count":149334,"is_preliminary":false,"provider":"Google","source_order":15}],"aggregation_source_results":["arena-9|gemini-3-flash-grounding"],"is_preliminary":false}],"candidate_count":31,"ranking":[{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":1257,"raw_unit":"Elo","ci_low":1250,"ci_high":1264,"rank_spread_min":1,"rank_spread_max":2,"sample_count":29663,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-9|gpt-5.6-sol-xhigh"],"is_preliminary":false,"rank":1,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.6 Sol","gpt-5.6-sol-xhigh"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-search","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1253,"raw_unit":"Elo","ci_low":1248,"ci_high":1258,"rank_spread_min":1,"rank_spread_max":2,"sample_count":134699,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-9|claude-opus-4-6-search"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.6","claude-opus-4-6-search"]},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-search","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1242,"raw_unit":"Elo","ci_low":1237,"ci_high":1247,"rank_spread_min":3,"rank_spread_max":5,"sample_count":89873,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["arena-9|gpt-5.5-search"],"is_preliminary":false,"rank":3,"modelId":"gpt-5-5","modelName":"GPT-5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.5","gpt-5.5-search"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":1257,"raw_unit":"Elo","ci_low":1250,"ci_high":1264,"rank_spread_min":1,"rank_spread_max":2,"sample_count":29663,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-9|gpt-5.6-sol-xhigh"],"is_preliminary":false,"rank":1,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.6 Sol","gpt-5.6-sol-xhigh"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-search","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1253,"raw_unit":"Elo","ci_low":1248,"ci_high":1258,"rank_spread_min":1,"rank_spread_max":2,"sample_count":134699,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-9|claude-opus-4-6-search"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.6","claude-opus-4-6-search"]},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-search","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1242,"raw_unit":"Elo","ci_low":1237,"ci_high":1247,"rank_spread_min":3,"rank_spread_max":5,"sample_count":89873,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["arena-9|gpt-5.5-search"],"is_preliminary":false,"rank":3,"modelId":"gpt-5-5","modelName":"GPT-5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.5","gpt-5.5-search"]}]}],"deepLink":"https://lll.bz/llm?task=research"},{"id":"documents","title":"PDF and documents","name":"PDF and documents","description":"For understanding long documents, PDFs and mixed document content.","category":"text","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/document","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-6"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-opus-5","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1520,"raw_unit":"Elo","ci_low":1505,"ci_high":1535,"rank_spread_min":1,"rank_spread_max":4,"sample_count":1663,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-6|claude-opus-5-high"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1510,"raw_unit":"Elo","ci_low":1504,"ci_high":1516,"rank_spread_min":1,"rank_spread_max":6,"sample_count":37271,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1506,"raw_unit":"Elo","ci_low":1499,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":24973,"is_preliminary":false,"provider":"Anthropic","source_order":3}],"aggregation_source_results":["arena-6|claude-opus-4-6"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":5792,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-6|claude-fable-5"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.431","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","rank":null,"evaluation_status":"pending_evaluation","note":"New release — awaiting comparable task-level evidence.","source_results":[]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","rank":null,"evaluation_status":"pending_evaluation","note":"New release — awaiting comparable task-level evidence.","source_results":[]}],"candidates":[{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1498,"raw_unit":"Elo","ci_low":1491,"ci_high":1505,"rank_spread_min":2,"rank_spread_max":9,"sample_count":18990,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":6,"raw_score":1497,"raw_unit":"Elo","ci_low":1490,"ci_high":1504,"rank_spread_min":2,"rank_spread_max":9,"sample_count":18793,"is_preliminary":false,"provider":"Anthropic","source_order":6}],"aggregation_source_results":["arena-6|claude-opus-4-7"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-high","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1485,"raw_unit":"Elo","ci_low":1478,"ci_high":1492,"rank_spread_min":5,"rank_spread_max":15,"sample_count":16816,"is_preliminary":false,"provider":"OpenAI","source_order":7},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.5","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1480,"raw_unit":"Elo","ci_low":1473,"ci_high":1487,"rank_spread_min":7,"rank_spread_max":19,"sample_count":17286,"is_preliminary":false,"provider":"OpenAI","source_order":9}],"aggregation_source_results":["arena-6|gpt-5.5-high"],"is_preliminary":false},{"model_id":"claude-sonnet-4-6","base_model":"claude sonnet 4.6","display_name":"claude sonnet 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-sonnet-4-6","normalized_model_family":"claude-sonnet-4-6","base_model":"claude sonnet 4.6","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1483,"raw_unit":"Elo","ci_low":1477,"ci_high":1489,"rank_spread_min":7,"rank_spread_max":17,"sample_count":54427,"is_preliminary":false,"provider":"Anthropic","source_order":8}],"aggregation_source_results":["arena-6|claude-sonnet-4-6"],"is_preliminary":false},{"model_id":"gpt-5-6-terra","base_model":"gpt 5.6 terra","display_name":"gpt 5.6 terra","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-terra-xhigh","normalized_model_family":"gpt-5-6-terra","base_model":"gpt 5.6 terra","variant":"Xhigh","reasoning_effort":"xhigh","rank":10,"raw_score":1479,"raw_unit":"Elo","ci_low":1466,"ci_high":1492,"rank_spread_min":5,"rank_spread_max":20,"sample_count":1969,"is_preliminary":false,"provider":"OpenAI","source_order":10}],"aggregation_source_results":["arena-6|gpt-5.6-terra-xhigh"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":11,"raw_score":1479,"raw_unit":"Elo","ci_low":1462,"ci_high":1496,"rank_spread_min":4,"rank_spread_max":21,"sample_count":1152,"is_preliminary":false,"provider":"OpenAI","source_order":11}],"aggregation_source_results":["arena-6|gpt-5.6-sol-xhigh"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1475,"raw_unit":"Elo","ci_low":1467,"ci_high":1483,"rank_spread_min":7,"rank_spread_max":20,"sample_count":8388,"is_preliminary":false,"provider":"Anthropic","source_order":12},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":16,"raw_score":1469,"raw_unit":"Elo","ci_low":1461,"ci_high":1477,"rank_spread_min":8,"rank_spread_max":22,"sample_count":8193,"is_preliminary":false,"provider":"Anthropic","source_order":16}],"aggregation_source_results":["arena-6|claude-opus-4-8-high"],"is_preliminary":false},{"model_id":"muse-spark-1-1","base_model":"muse spark 1.1","display_name":"muse spark 1.1","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.1","normalized_model_family":"muse-spark-1-1","base_model":"muse spark 1.1","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1472,"raw_unit":"Elo","ci_low":1459,"ci_high":1485,"rank_spread_min":7,"rank_spread_max":22,"sample_count":2054,"is_preliminary":false,"provider":"Meta","source_order":13}],"aggregation_source_results":["arena-6|muse-spark-1.1"],"is_preliminary":false},{"model_id":"claude-sonnet-5","base_model":"claude sonnet 5","display_name":"claude sonnet 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-sonnet-5-high","normalized_model_family":"claude-sonnet-5","base_model":"claude sonnet 5","variant":"High","reasoning_effort":"high","rank":14,"raw_score":1470,"raw_unit":"Elo","ci_low":1460,"ci_high":1480,"rank_spread_min":7,"rank_spread_max":22,"sample_count":3601,"is_preliminary":false,"provider":"Anthropic","source_order":14}],"aggregation_source_results":["arena-6|claude-sonnet-5-high"],"is_preliminary":false},{"model_id":"gpt-5-4","base_model":"gpt 5.4","display_name":"gpt 5.4","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.4","normalized_model_family":"gpt-5-4","base_model":"gpt 5.4","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1470,"raw_unit":"Elo","ci_low":1463,"ci_high":1477,"rank_spread_min":8,"rank_spread_max":21,"sample_count":29809,"is_preliminary":false,"provider":"OpenAI","source_order":15}],"aggregation_source_results":["arena-6|gpt-5.4"],"is_preliminary":false},{"model_id":"gemini-3-5-flash","base_model":"gemini 3.5 flash","display_name":"gemini 3.5 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.23981247,"mean_rank":17,"median_rank":17,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-high","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"High","reasoning_effort":"high","rank":17,"raw_score":1465,"raw_unit":"Elo","ci_low":1450,"ci_high":1480,"rank_spread_min":7,"rank_spread_max":26,"sample_count":1372,"is_preliminary":false,"provider":"Google","source_order":17},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-medium","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"Medium","reasoning_effort":"medium","rank":18,"raw_score":1465,"raw_unit":"Elo","ci_low":1455,"ci_high":1475,"rank_spread_min":9,"rank_spread_max":23,"sample_count":3689,"is_preliminary":false,"provider":"Google","source_order":18}],"aggregation_source_results":["arena-6|gemini-3.5-flash-high"],"is_preliminary":false},{"model_id":"gpt-5-6-luna","base_model":"gpt 5.6 luna","display_name":"gpt 5.6 luna","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.23137821,"mean_rank":19,"median_rank":19,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-luna-xhigh","normalized_model_family":"gpt-5-6-luna","base_model":"gpt 5.6 luna","variant":"Xhigh","reasoning_effort":"xhigh","rank":19,"raw_score":1462,"raw_unit":"Elo","ci_low":1449,"ci_high":1475,"rank_spread_min":9,"rank_spread_max":26,"sample_count":1888,"is_preliminary":false,"provider":"OpenAI","source_order":19}],"aggregation_source_results":["arena-6|gpt-5.6-luna-xhigh"],"is_preliminary":false},{"model_id":"claude-opus-4-5-20251101","base_model":"claude opus 4.5 20251101","display_name":"claude opus 4.5 20251101","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.22767025,"mean_rank":20,"median_rank":20,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-5-20251101","normalized_model_family":"claude-opus-4-5-20251101","base_model":"claude opus 4.5 20251101","variant":null,"reasoning_effort":null,"rank":20,"raw_score":1462,"raw_unit":"Elo","ci_low":1452,"ci_high":1472,"rank_spread_min":10,"rank_spread_max":25,"sample_count":7965,"is_preliminary":false,"provider":"Anthropic","source_order":20}],"aggregation_source_results":["arena-6|claude-opus-4-5-20251101"],"is_preliminary":false}],"candidate_count":30,"ranking":[{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1520,"raw_unit":"Elo","ci_low":1505,"ci_high":1535,"rank_spread_min":1,"rank_spread_max":4,"sample_count":1663,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-6|claude-opus-5-high"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 5","claude-opus-5-high"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1510,"raw_unit":"Elo","ci_low":1504,"ci_high":1516,"rank_spread_min":1,"rank_spread_max":6,"sample_count":37271,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1506,"raw_unit":"Elo","ci_low":1499,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":24973,"is_preliminary":false,"provider":"Anthropic","source_order":3}],"aggregation_source_results":["arena-6|claude-opus-4-6"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.6","claude-opus-4-6","claude-opus-4-6-high"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":5792,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-6|claude-fable-5"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.431","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1520,"raw_unit":"Elo","ci_low":1505,"ci_high":1535,"rank_spread_min":1,"rank_spread_max":4,"sample_count":1663,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-6|claude-opus-5-high"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 5","claude-opus-5-high"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1510,"raw_unit":"Elo","ci_low":1504,"ci_high":1516,"rank_spread_min":1,"rank_spread_max":6,"sample_count":37271,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":3,"raw_score":1506,"raw_unit":"Elo","ci_low":1499,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":24973,"is_preliminary":false,"provider":"Anthropic","source_order":3}],"aggregation_source_results":["arena-6|claude-opus-4-6"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-6","modelName":"Claude Opus 4.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-4-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.6","claude-opus-4-6","claude-opus-4-6-high"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":5792,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-6|claude-fable-5"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.431","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]}]}],"deepLink":"https://lll.bz/llm?task=documents"},{"id":"coding","title":"Terminal software engineering","name":"Terminal software engineering","description":"For repository work, terminal coding and software engineering.","category":"code","sourceName":"Terminal-Bench","sourceUrl":"https://www.tbench.ai/","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["terminal"],"consensus":{"method":"weighted_reciprocal_rank","winner":"gpt-6-astra","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Terminal-Bench":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Codex / (max)","reasoning_effort":"max","rank":1,"raw_score":58.2,"raw_unit":"percent","ci_low":55.400000000000006,"ci_high":61,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["terminal|GPT-6 Astra (max)"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Codex / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Claude Code / (max)","reasoning_effort":"max","rank":2,"raw_score":57.9,"raw_unit":"percent","ci_low":54.1,"ci_high":61.699999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["terminal|Fable 5.1 (max)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Claude Code / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus 5 (max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Claude Code / (max)","reasoning_effort":"max","rank":3,"raw_score":51.8,"raw_unit":"percent","ci_low":48.4,"ci_high":55.199999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["terminal|Opus 5 (max)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Claude Code / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5 (max)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Claude Code / (max)","reasoning_effort":"max","rank":4,"raw_score":44.5,"raw_unit":"percent","ci_low":40.7,"ci_high":48.3,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["terminal|Fable 5 (max)"],"is_preliminary":false},{"model_id":"glm-5-3","base_model":"GLM-5.3","display_name":"GLM-5.3","official_model_id":null,"provider":null,"variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GLM-5.3 (max)","normalized_model_family":"glm-5-3","base_model":"GLM-5.3","variant":"Claude Code / (max)","reasoning_effort":"max","rank":5,"raw_score":41.8,"raw_unit":"percent","ci_low":38.599999999999994,"ci_high":45,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["terminal|GLM-5.3 (max)"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol (max)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Codex / (max)","reasoning_effort":"max","rank":6,"raw_score":37.3,"raw_unit":"percent","ci_low":33.5,"ci_high":41.099999999999994,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":6}],"aggregation_source_results":["terminal|GPT-5.6 Sol (max)"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus 4.8 (max)","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"Claude Code / (max)","reasoning_effort":"max","rank":7,"raw_score":23.6,"raw_unit":"percent","ci_low":20,"ci_high":27.200000000000003,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":7}],"aggregation_source_results":["terminal|Opus 4.8 (max)"],"is_preliminary":false},{"model_id":"gpt-5-6-terra","base_model":"GPT-5.6 Terra","display_name":"GPT-5.6 Terra","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Terra (max)","normalized_model_family":"gpt-5-6-terra","base_model":"GPT-5.6 Terra","variant":"Codex / (max)","reasoning_effort":"max","rank":8,"raw_score":21.5,"raw_unit":"percent","ci_low":18.2,"ci_high":24.8,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":8}],"aggregation_source_results":["terminal|GPT-5.6 Terra (max)"],"is_preliminary":false},{"model_id":"grok-4-6","base_model":"Grok 4.6","display_name":"Grok 4.6","official_model_id":null,"provider":"SpaceXAI","variant":"Grok Build / (high)","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.6 (high)","normalized_model_family":"grok-4-6","base_model":"Grok 4.6","variant":"Grok Build / (high)","reasoning_effort":"high","rank":9,"raw_score":20.3,"raw_unit":"percent","ci_low":17.2,"ci_high":23.400000000000002,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":9}],"aggregation_source_results":["terminal|Grok 4.6 (high)"],"is_preliminary":false},{"model_id":"gemini-3-8-flash","base_model":"Gemini 3.8 Flash","display_name":"Gemini 3.8 Flash","official_model_id":null,"provider":"Google","variant":"mini-SWE-agent / (high)","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.8 Flash (high)","normalized_model_family":"gemini-3-8-flash","base_model":"Gemini 3.8 Flash","variant":"mini-SWE-agent / (high)","reasoning_effort":"high","rank":10,"raw_score":19.1,"raw_unit":"percent","ci_low":15.700000000000001,"ci_high":22.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["terminal|Gemini 3.8 Flash (high)"],"is_preliminary":false},{"model_id":"gpt-5-6-luna","base_model":"GPT-5.6 Luna","display_name":"GPT-5.6 Luna","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Luna (max)","normalized_model_family":"gpt-5-6-luna","base_model":"GPT-5.6 Luna","variant":"Codex / (max)","reasoning_effort":"max","rank":11,"raw_score":17.3,"raw_unit":"percent","ci_low":14.5,"ci_high":20.1,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":11}],"aggregation_source_results":["terminal|GPT-5.6 Luna (max)"],"is_preliminary":false},{"model_id":"grok-4-5","base_model":"Grok 4.5","display_name":"Grok 4.5","official_model_id":null,"provider":"SpaceXAI","variant":"Grok Build / (high)","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.5 (high)","normalized_model_family":"grok-4-5","base_model":"Grok 4.5","variant":"Grok Build / (high)","reasoning_effort":"high","rank":12,"raw_score":12.4,"raw_unit":"percent","ci_low":9.8,"ci_high":15,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":12}],"aggregation_source_results":["terminal|Grok 4.5 (high)"],"is_preliminary":false},{"model_id":"claude-sonnet-5","base_model":"Claude Sonnet 5","display_name":"Claude Sonnet 5","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonnet 5 (max)","normalized_model_family":"claude-sonnet-5","base_model":"Claude Sonnet 5","variant":"Claude Code / (max)","reasoning_effort":"max","rank":12,"raw_score":12.4,"raw_unit":"percent","ci_low":9.3,"ci_high":15.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":13}],"aggregation_source_results":["terminal|Sonnet 5 (max)"],"is_preliminary":false},{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","variant":"mini-SWE-agent / (high)","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.7 Flash (high)","normalized_model_family":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","variant":"mini-SWE-agent / (high)","reasoning_effort":"high","rank":14,"raw_score":11.2,"raw_unit":"percent","ci_low":8.799999999999999,"ci_high":13.6,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":14}],"aggregation_source_results":["terminal|Gemini 3.7 Flash (high)"],"is_preliminary":false}],"candidate_count":11,"ranking":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Codex / (max)","reasoning_effort":"max","rank":1,"raw_score":58.2,"raw_unit":"percent","ci_low":55.400000000000006,"ci_high":61,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["terminal|GPT-6 Astra (max)"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Codex / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","GPT-6 Astra (max)"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Claude Code / (max)","reasoning_effort":"max","rank":2,"raw_score":57.9,"raw_unit":"percent","ci_low":54.1,"ci_high":61.699999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["terminal|Fable 5.1 (max)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Claude Code / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","Fable 5.1 (max)"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus 5 (max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Claude Code / (max)","reasoning_effort":"max","rank":3,"raw_score":51.8,"raw_unit":"percent","ci_low":48.4,"ci_high":55.199999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["terminal|Opus 5 (max)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Claude Code / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 5","Opus 5 (max)"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Codex / (max)","reasoning_effort":"max","rank":1,"raw_score":58.2,"raw_unit":"percent","ci_low":55.400000000000006,"ci_high":61,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["terminal|GPT-6 Astra (max)"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Codex / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","GPT-6 Astra (max)"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Claude Code / (max)","reasoning_effort":"max","rank":2,"raw_score":57.9,"raw_unit":"percent","ci_low":54.1,"ci_high":61.699999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["terminal|Fable 5.1 (max)"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Claude Code / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","Fable 5.1 (max)"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Claude Code / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus 5 (max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Claude Code / (max)","reasoning_effort":"max","rank":3,"raw_score":51.8,"raw_unit":"percent","ci_low":48.4,"ci_high":55.199999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["terminal|Opus 5 (max)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Claude Code / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 5","Opus 5 (max)"]}]}],"deepLink":"https://lll.bz/llm?task=coding"},{"id":"webdev","title":"Web development","name":"Web development","description":"For building and editing interactive web interfaces.","category":"code","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/code","sourceDate":"2026-09-05","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-10"],"consensus":{"method":"weighted_reciprocal_rank","winner":"gpt-6-astra","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1797,"raw_unit":"Elo","ci_low":1773,"ci_high":1821,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1199,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-10|gpt-6-astra-max"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1762,"raw_unit":"Elo","ci_low":1746,"ci_high":1778,"rank_spread_min":1,"rank_spread_max":2,"sample_count":2275,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-10|claude-fable-5.1-max"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1688,"raw_unit":"Elo","ci_low":1680,"ci_high":1696,"rank_spread_min":3,"rank_spread_max":6,"sample_count":10904,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1661,"raw_unit":"Elo","ci_low":1654,"ci_high":1668,"rank_spread_min":5,"rank_spread_max":7,"sample_count":10928,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-10|claude-opus-5-max"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"qwen3-8-max-0902","base_model":"qwen3.8 max 0902","display_name":"qwen3.8 max 0902","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max-0902","normalized_model_family":"qwen3-8-max-0902","base_model":"qwen3.8 max 0902","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1686,"raw_unit":"Elo","ci_low":1670,"ci_high":1702,"rank_spread_min":3,"rank_spread_max":6,"sample_count":1868,"is_preliminary":true,"provider":"Alibaba","source_order":4}],"aggregation_source_results":["arena-10|qwen3.8-max-0902"],"is_preliminary":true},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":5,"raw_score":1674,"raw_unit":"Elo","ci_low":1663,"ci_high":1685,"rank_spread_min":3,"rank_spread_max":7,"sample_count":4546,"is_preliminary":false,"provider":"Moonshot","source_order":5}],"aggregation_source_results":["arena-10|kimi-k3-max"],"is_preliminary":false},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1670,"raw_unit":"Elo","ci_low":1658,"ci_high":1682,"rank_spread_min":3,"rank_spread_max":7,"sample_count":3223,"is_preliminary":true,"provider":"Alibaba","source_order":6}],"aggregation_source_results":["arena-10|qwen3.8-max"],"is_preliminary":true},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1629,"raw_unit":"Elo","ci_low":1621,"ci_high":1637,"rank_spread_min":8,"rank_spread_max":14,"sample_count":9356,"is_preliminary":false,"provider":"Anthropic","source_order":8}],"aggregation_source_results":["arena-10|claude-fable-5"],"is_preliminary":false},{"model_id":"qwen3-8-flash-next","base_model":"qwen3.8 flash next","display_name":"qwen3.8 flash next","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-flash-next","normalized_model_family":"qwen3-8-flash-next","base_model":"qwen3.8 flash next","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1626,"raw_unit":"Elo","ci_low":1612,"ci_high":1640,"rank_spread_min":8,"rank_spread_max":15,"sample_count":2158,"is_preliminary":true,"provider":"Alibaba","source_order":9}],"aggregation_source_results":["arena-10|qwen3.8-flash-next"],"is_preliminary":true},{"model_id":"grok-4-6","base_model":"Grok 4.6","display_name":"Grok 4.6","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.6-high","normalized_model_family":"grok-4-6","base_model":"grok 4.6","variant":"High","reasoning_effort":"high","rank":10,"raw_score":1625,"raw_unit":"Elo","ci_low":1614,"ci_high":1636,"rank_spread_min":8,"rank_spread_max":15,"sample_count":3487,"is_preliminary":false,"provider":"SpaceXAI","source_order":10}],"aggregation_source_results":["arena-10|grok-4.6-high"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"muse spark 1.3","display_name":"muse spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.3 (xHigh)","normalized_model_family":"muse-spark-1-3","base_model":"muse spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":11,"raw_score":1622,"raw_unit":"Elo","ci_low":1604,"ci_high":1640,"rank_spread_min":8,"rank_spread_max":16,"sample_count":1274,"is_preliminary":false,"provider":"Meta","source_order":11}],"aggregation_source_results":["arena-10|muse-spark-1.3 (xHigh)"],"is_preliminary":false},{"model_id":"hy4-preview","base_model":"hy4 preview","display_name":"hy4 preview","official_model_id":null,"provider":"Tencent","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"hy4-preview","normalized_model_family":"hy4-preview","base_model":"hy4 preview","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1621,"raw_unit":"Elo","ci_low":1605,"ci_high":1637,"rank_spread_min":8,"rank_spread_max":15,"sample_count":1661,"is_preliminary":true,"provider":"Tencent","source_order":12}],"aggregation_source_results":["arena-10|hy4-preview"],"is_preliminary":true},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh (codex-harness)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":13,"raw_score":1617,"raw_unit":"Elo","ci_low":1610,"ci_high":1624,"rank_spread_min":8,"rank_spread_max":15,"sample_count":11014,"is_preliminary":false,"provider":"OpenAI","source_order":13}],"aggregation_source_results":["arena-10|gpt-5.6-sol-xhigh (codex-harness)"],"is_preliminary":false},{"model_id":"glm-5-3","base_model":"glm 5.3","display_name":"glm 5.3","official_model_id":null,"provider":"Z.ai","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-max","normalized_model_family":"glm-5-3","base_model":"glm 5.3","variant":"Max","reasoning_effort":"max","rank":14,"raw_score":1609,"raw_unit":"Elo","ci_low":1597,"ci_high":1621,"rank_spread_min":8,"rank_spread_max":17,"sample_count":2930,"is_preliminary":false,"provider":"Z.ai","source_order":14}],"aggregation_source_results":["arena-10|glm-5.3-max"],"is_preliminary":false},{"model_id":"glm-5-3-flash","base_model":"glm 5.3 flash","display_name":"glm 5.3 flash","official_model_id":null,"provider":"Z.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-flash","normalized_model_family":"glm-5-3-flash","base_model":"glm 5.3 flash","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1605,"raw_unit":"Elo","ci_low":1590,"ci_high":1620,"rank_spread_min":9,"rank_spread_max":19,"sample_count":1961,"is_preliminary":false,"provider":"Z.ai","source_order":15}],"aggregation_source_results":["arena-10|glm-5.3-flash"],"is_preliminary":false},{"model_id":"qwen3-8-27b","base_model":"qwen3.8 27b","display_name":"qwen3.8 27b","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.24465054,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-27b","normalized_model_family":"qwen3-8-27b","base_model":"qwen3.8 27b","variant":null,"reasoning_effort":null,"rank":16,"raw_score":1594,"raw_unit":"Elo","ci_low":1583,"ci_high":1605,"rank_spread_min":13,"rank_spread_max":20,"sample_count":3543,"is_preliminary":false,"provider":"Alibaba","source_order":16}],"aggregation_source_results":["arena-10|qwen3.8-27b"],"is_preliminary":false}],"candidate_count":95,"ranking":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1797,"raw_unit":"Elo","ci_low":1773,"ci_high":1821,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1199,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-10|gpt-6-astra-max"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","gpt-6-astra-max"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1762,"raw_unit":"Elo","ci_low":1746,"ci_high":1778,"rank_spread_min":1,"rank_spread_max":2,"sample_count":2275,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-10|claude-fable-5.1-max"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1688,"raw_unit":"Elo","ci_low":1680,"ci_high":1696,"rank_spread_min":3,"rank_spread_max":6,"sample_count":10904,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1661,"raw_unit":"Elo","ci_low":1654,"ci_high":1668,"rank_spread_min":5,"rank_spread_max":7,"sample_count":10928,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-10|claude-opus-5-max"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 5","claude-opus-5-max","claude-opus-5-high"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1797,"raw_unit":"Elo","ci_low":1773,"ci_high":1821,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1199,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-10|gpt-6-astra-max"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","gpt-6-astra-max"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1762,"raw_unit":"Elo","ci_low":1746,"ci_high":1778,"rank_spread_min":1,"rank_spread_max":2,"sample_count":2275,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-10|claude-fable-5.1-max"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1688,"raw_unit":"Elo","ci_low":1680,"ci_high":1696,"rank_spread_min":3,"rank_spread_max":6,"sample_count":10904,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1661,"raw_unit":"Elo","ci_low":1654,"ci_high":1668,"rank_spread_min":5,"rank_spread_max":7,"sample_count":10928,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-10|claude-opus-5-max"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 5","claude-opus-5-max","claude-opus-5-high"]}]}],"deepLink":"https://lll.bz/llm?task=webdev"},{"id":"agents","title":"AI agents","name":"AI agents","description":"For autonomous multi-step work with tools and external environments.","category":"code","sourceName":"Arena, Scale Labs","sourceUrl":"https://arena.ai/leaderboard/agent","sourceDate":"2026-09-05","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-agent","scale-hil"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5-1","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":2,"source_coverage":1,"family_weights":{"Arena":0.75,"Scale Labs":0.25},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (Max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":15.87,"raw_unit":"percent","ci_low":13.03,"ci_high":18.71,"rank_spread_min":1,"rank_spread_max":3,"sample_count":6796,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":null,"reasoning_effort":null,"rank":1,"raw_score":61.5,"raw_unit":"percent","ci_low":55.03,"ci_high":67.97,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-agent|Claude Fable 5.1 (Max)","scale-hil|Claude Fable 5.1"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload."},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.72319732,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (High)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":2,"raw_score":12.68,"raw_unit":"percent","ci_low":10.95,"ci_high":14.41,"rank_spread_min":1,"rank_spread_max":4,"sample_count":22594,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (Max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":11.67,"raw_unit":"percent","ci_low":9.71,"ci_high":13.629999999999999,"rank_spread_min":1,"rank_spread_max":6,"sample_count":18112,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":57,"raw_unit":"percent","ci_low":51.519999999999996,"ci_high":62.480000000000004,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["arena-agent|Claude Opus 5 (High)","scale-hil|Claude Opus 5"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.723","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-opus-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.57300742,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (High)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"High","reasoning_effort":"high","rank":4,"raw_score":10.23,"raw_unit":"percent","ci_low":8.77,"ci_high":11.690000000000001,"rank_spread_min":2,"rank_spread_max":7,"sample_count":36204,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":56.33,"raw_unit":"percent","ci_low":50.83,"ci_high":61.83,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-agent|Claude Fable 5 (High)","scale-hil|Claude Fable 5"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.573","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload."}],"pending_evaluation":[],"candidates":[{"model_id":"gemini-3-1-pro","base_model":"Gemini 3.1 Pro","display_name":"Gemini 3.1 Pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro","normalized_model_family":"gemini-3-1-pro","base_model":"Gemini 3.1 Pro","variant":null,"reasoning_effort":null,"rank":2,"raw_score":35.33,"raw_unit":"percent","ci_low":29.759999999999998,"ci_high":40.9,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":9}],"aggregation_source_results":["scale-hil|Gemini 3.1 Pro"],"is_preliminary":false},{"model_id":"grok-4-20","base_model":"Grok-4.20","display_name":"Grok-4.20","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok-4.20","normalized_model_family":"grok-4-20","base_model":"Grok-4.20","variant":null,"reasoning_effort":null,"rank":2,"raw_score":20,"raw_unit":"percent","ci_low":13.91,"ci_high":26.09,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":12}],"aggregation_source_results":["scale-hil|Grok-4.20"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.44787204,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"GPT 5.6 Sol (xHigh)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":5,"raw_score":9.31,"raw_unit":"percent","ci_low":7.82,"ci_high":10.8,"rank_spread_min":3,"rank_spread_max":10,"sample_count":29730,"is_preliminary":false,"provider":"OpenAI","source_order":5},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT 5.6 Sol","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":null,"reasoning_effort":null,"rank":2,"raw_score":32.33,"raw_unit":"percent","ci_low":26.839999999999996,"ci_high":37.82,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["arena-agent|GPT 5.6 Sol (xHigh)","scale-hil|GPT 5.6 Sol"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.42488783,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.8 (High)","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":6,"raw_score":9.17,"raw_unit":"percent","ci_low":7.6899999999999995,"ci_high":10.65,"rank_spread_min":3,"rank_spread_max":10,"sample_count":38148,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":29,"raw_score":1.85,"raw_unit":"percent","ci_low":-0.96,"ci_high":4.66,"rank_spread_min":12,"rank_spread_max":38,"sample_count":33690,"is_preliminary":false,"provider":"Anthropic","source_order":29},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":2,"raw_score":35.33,"raw_unit":"percent","ci_low":29.759999999999998,"ci_high":40.9,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":8}],"aggregation_source_results":["arena-agent|Claude Opus 4.8 (High)","scale-hil|Claude Opus 4.8"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.38350494,"mean_rank":5.5,"median_rank":5.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"GPT 5.5 (xHigh)","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":9,"raw_score":7.21,"raw_unit":"percent","ci_low":6.13,"ci_high":8.29,"rank_spread_min":5,"rank_spread_max":19,"sample_count":51255,"is_preliminary":false,"provider":"OpenAI","source_order":9},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"GPT 5.5 (High)","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"High","reasoning_effort":"high","rank":15,"raw_score":5.55,"raw_unit":"percent","ci_low":4.5,"ci_high":6.6,"rank_spread_min":8,"rank_spread_max":24,"sample_count":73882,"is_preliminary":false,"provider":"OpenAI","source_order":15},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"GPT 5.5","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":null,"reasoning_effort":null,"rank":21,"raw_score":4.39,"raw_unit":"percent","ci_low":3.4899999999999998,"ci_high":5.29,"rank_spread_min":11,"rank_spread_max":28,"sample_count":79166,"is_preliminary":false,"provider":"OpenAI","source_order":21},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":39.67,"raw_unit":"percent","ci_low":34.04,"ci_high":45.300000000000004,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["arena-agent|GPT 5.5 (xHigh)","scale-hil|GPT-5.5"],"is_preliminary":false},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.36693965,"mean_rank":6.5,"median_rank":6.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.7 (High)","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":11,"raw_score":6.03,"raw_unit":"percent","ci_low":4.54,"ci_high":7.5200000000000005,"rank_spread_min":7,"rank_spread_max":23,"sample_count":36571,"is_preliminary":false,"provider":"Anthropic","source_order":11},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":14,"raw_score":5.66,"raw_unit":"percent","ci_low":4.15,"ci_high":7.17,"rank_spread_min":8,"rank_spread_max":25,"sample_count":37121,"is_preliminary":false,"provider":"Anthropic","source_order":14},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":2,"raw_score":41.67,"raw_unit":"percent","ci_low":36.02,"ci_high":47.32,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["arena-agent|Claude Opus 4.7 (High)","scale-hil|Claude Opus 4.7"],"is_preliminary":false},{"model_id":"glm-5-2","base_model":"GLM 5.2","display_name":"GLM 5.2","official_model_id":null,"provider":"Z.ai","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.36041105,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"GLM 5.2 (Max)","normalized_model_family":"glm-5-2","base_model":"GLM 5.2","variant":"Max","reasoning_effort":"max","rank":12,"raw_score":6.03,"raw_unit":"percent","ci_low":5.2700000000000005,"ci_high":6.79,"rank_spread_min":8,"rank_spread_max":21,"sample_count":69385,"is_preliminary":false,"provider":"Z.ai","source_order":12},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GLM 5.2","normalized_model_family":"glm-5-2","base_model":"GLM 5.2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":43.67,"raw_unit":"percent","ci_low":38.02,"ci_high":49.32,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["arena-agent|GLM 5.2 (Max)","scale-hil|GLM 5.2"],"is_preliminary":false},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Kimi K3 (Max)","normalized_model_family":"kimi-k3","base_model":"Kimi K3","variant":"Max","reasoning_effort":"max","rank":7,"raw_score":7.96,"raw_unit":"percent","ci_low":7.28,"ci_high":8.64,"rank_spread_min":5,"rank_spread_max":12,"sample_count":97915,"is_preliminary":false,"provider":"Moonshot","source_order":7}],"aggregation_source_results":["arena-agent|Kimi K3 (Max)"],"is_preliminary":false},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.32848512,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":20,"raw_score":4.65,"raw_unit":"percent","ci_low":3.24,"ci_high":6.0600000000000005,"rank_spread_min":9,"rank_spread_max":29,"sample_count":36366,"is_preliminary":false,"provider":"Anthropic","source_order":20},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 4.6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":38.33,"raw_unit":"percent","ci_low":32.71,"ci_high":43.949999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":7}],"aggregation_source_results":["arena-agent|Claude Opus 4.6","scale-hil|Claude Opus 4.6"],"is_preliminary":false},{"model_id":"claude-sonnet-5","base_model":"Claude Sonnet 5","display_name":"Claude Sonnet 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Sonnet 5 (High)","normalized_model_family":"claude-sonnet-5","base_model":"Claude Sonnet 5","variant":"High","reasoning_effort":"high","rank":8,"raw_score":7.41,"raw_unit":"percent","ci_low":5.46,"ci_high":9.36,"rank_spread_min":4,"rank_spread_max":20,"sample_count":28662,"is_preliminary":false,"provider":"Anthropic","source_order":8}],"aggregation_source_results":["arena-agent|Claude Sonnet 5 (High)"],"is_preliminary":false},{"model_id":"kimi-k2-6","base_model":"Kimi K2.6","display_name":"Kimi K2.6","official_model_id":null,"provider":"Moonshot","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30170148,"mean_rank":19,"median_rank":19,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Kimi K2.6","normalized_model_family":"kimi-k2-6","base_model":"Kimi K2.6","variant":null,"reasoning_effort":null,"rank":36,"raw_score":0.29,"raw_unit":"percent","ci_low":-2.51,"ci_high":3.09,"rank_spread_min":24,"rank_spread_max":46,"sample_count":11279,"is_preliminary":false,"provider":"Moonshot","source_order":36},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi-k2.6","normalized_model_family":"kimi-k2-6","base_model":"Kimi-k2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":18.67,"raw_unit":"percent","ci_low":13.880000000000003,"ci_high":23.46,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":13}],"aggregation_source_results":["arena-agent|Kimi K2.6","scale-hil|Kimi-k2.6"],"is_preliminary":false},{"model_id":"gemini-3-5-flash","base_model":"Gemini 3.5 Flash","display_name":"Gemini 3.5 Flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.29681921,"mean_rank":21.5,"median_rank":21.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Gemini 3.5 Flash (High)","normalized_model_family":"gemini-3-5-flash","base_model":"Gemini 3.5 Flash","variant":"High","reasoning_effort":"high","rank":41,"raw_score":3.48,"raw_unit":"percent","ci_low":2.62,"ci_high":4.34,"rank_spread_min":38,"rank_spread_max":48,"sample_count":94447,"is_preliminary":false,"provider":"Google","source_order":40},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Gemini 3.5 Flash (Medium)","normalized_model_family":"gemini-3-5-flash","base_model":"Gemini 3.5 Flash","variant":"Medium","reasoning_effort":"medium","rank":47,"raw_score":4.71,"raw_unit":"percent","ci_low":3.19,"ci_high":6.23,"rank_spread_min":39,"rank_spread_max":49,"sample_count":13762,"is_preliminary":false,"provider":"Google","source_order":46},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.5 Flash","normalized_model_family":"gemini-3-5-flash","base_model":"Gemini 3.5 Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":27.67,"raw_unit":"percent","ci_low":22.35,"ci_high":32.99,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":11}],"aggregation_source_results":["arena-agent|Gemini 3.5 Flash (High)","scale-hil|Gemini 3.5 Flash"],"is_preliminary":false}],"candidate_count":50,"ranking":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (Max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":15.87,"raw_unit":"percent","ci_low":13.03,"ci_high":18.71,"rank_spread_min":1,"rank_spread_max":3,"sample_count":6796,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":null,"reasoning_effort":null,"rank":1,"raw_score":61.5,"raw_unit":"percent","ci_low":55.03,"ci_high":67.97,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-agent|Claude Fable 5.1 (Max)","scale-hil|Claude Fable 5.1"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","aliases":["Claude Fable 5.1","Claude Fable 5.1 (Max)","Claude Fable 5.1"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.72319732,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (High)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":2,"raw_score":12.68,"raw_unit":"percent","ci_low":10.95,"ci_high":14.41,"rank_spread_min":1,"rank_spread_max":4,"sample_count":22594,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (Max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":11.67,"raw_unit":"percent","ci_low":9.71,"ci_high":13.629999999999999,"rank_spread_min":1,"rank_spread_max":6,"sample_count":18112,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":57,"raw_unit":"percent","ci_low":51.519999999999996,"ci_high":62.480000000000004,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["arena-agent|Claude Opus 5 (High)","scale-hil|Claude Opus 5"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.723","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-opus-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","aliases":["Claude Opus 5","Claude Opus 5 (High)","Claude Opus 5 (Max)","Claude Opus 5"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.57300742,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (High)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"High","reasoning_effort":"high","rank":4,"raw_score":10.23,"raw_unit":"percent","ci_low":8.77,"ci_high":11.690000000000001,"rank_spread_min":2,"rank_spread_max":7,"sample_count":36204,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":56.33,"raw_unit":"percent","ci_low":50.83,"ci_high":61.83,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-agent|Claude Fable 5 (High)","scale-hil|Claude Fable 5"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.573","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","aliases":["Claude Fable 5","Claude Fable 5 (High)","Claude Fable 5"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (Max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":15.87,"raw_unit":"percent","ci_low":13.03,"ci_high":18.71,"rank_spread_min":1,"rank_spread_max":3,"sample_count":6796,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":null,"reasoning_effort":null,"rank":1,"raw_score":61.5,"raw_unit":"percent","ci_low":55.03,"ci_high":67.97,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-agent|Claude Fable 5.1 (Max)","scale-hil|Claude Fable 5.1"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","aliases":["Claude Fable 5.1","Claude Fable 5.1 (Max)","Claude Fable 5.1"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.72319732,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (High)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":2,"raw_score":12.68,"raw_unit":"percent","ci_low":10.95,"ci_high":14.41,"rank_spread_min":1,"rank_spread_max":4,"sample_count":22594,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5 (Max)","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":11.67,"raw_unit":"percent","ci_low":9.71,"ci_high":13.629999999999999,"rank_spread_min":1,"rank_spread_max":6,"sample_count":18112,"is_preliminary":false,"provider":"Anthropic","source_order":3},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Opus 5","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":57,"raw_unit":"percent","ci_low":51.519999999999996,"ci_high":62.480000000000004,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["arena-agent|Claude Opus 5 (High)","scale-hil|Claude Opus 5"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.723","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-opus-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","aliases":["Claude Opus 5","Claude Opus 5 (High)","Claude Opus 5 (Max)","Claude Opus 5"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.57300742,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (High)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"High","reasoning_effort":"high","rank":4,"raw_score":10.23,"raw_unit":"percent","ci_low":8.77,"ci_high":11.690000000000001,"rank_spread_min":2,"rank_spread_max":7,"sample_count":36204,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":56.33,"raw_unit":"percent","ci_low":50.83,"ci_high":61.83,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["arena-agent|Claude Fable 5 (High)","scale-hil|Claude Fable 5"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.573","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload.","aliases":["Claude Fable 5","Claude Fable 5 (High)","Claude Fable 5"]}]}],"deepLink":"https://lll.bz/llm?task=agents"},{"id":"vision","title":"Image understanding","name":"Image understanding","description":"For reasoning about photos, diagrams and visual content.","category":"image","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/vision","sourceDate":"2026-08-27","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-7"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1313,"raw_unit":"Elo","ci_low":1305,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":6,"sample_count":10002,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-7|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1301,"raw_unit":"Elo","ci_low":1294,"ci_high":1308,"rank_spread_min":1,"rank_spread_max":11,"sample_count":21137,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1299,"raw_unit":"Elo","ci_low":1292,"ci_high":1306,"rank_spread_min":1,"rank_spread_max":14,"sample_count":21457,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-7|claude-opus-4-7-high"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1300,"raw_unit":"Elo","ci_low":1292,"ci_high":1308,"rank_spread_min":1,"rank_spread_max":15,"sample_count":7244,"is_preliminary":false,"provider":"Alibaba","source_order":3}],"aggregation_source_results":["arena-7|qwen3.8-max"],"is_preliminary":false,"rank":3,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:qwen3-8-max","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":5,"raw_score":1299,"raw_unit":"Elo","ci_low":1292,"ci_high":1306,"rank_spread_min":1,"rank_spread_max":14,"sample_count":20883,"is_preliminary":false,"provider":"Anthropic","source_order":5},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1293,"raw_unit":"Elo","ci_low":1286,"ci_high":1300,"rank_spread_min":2,"rank_spread_max":24,"sample_count":25210,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-7|claude-opus-4-6-high"],"is_preliminary":false},{"model_id":"muse-spark","base_model":"muse spark","display_name":"muse spark","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark","normalized_model_family":"muse-spark","base_model":"muse spark","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1294,"raw_unit":"Elo","ci_low":1285,"ci_high":1303,"rank_spread_min":2,"rank_spread_max":25,"sample_count":5585,"is_preliminary":false,"provider":"Meta","source_order":6}],"aggregation_source_results":["arena-7|muse-spark"],"is_preliminary":false},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.2 (xHigh)","normalized_model_family":"muse-spark-1-2","base_model":"muse spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":8,"raw_score":1292,"raw_unit":"Elo","ci_low":1277,"ci_high":1307,"rank_spread_min":1,"rank_spread_max":29,"sample_count":1844,"is_preliminary":false,"provider":"Meta","source_order":8}],"aggregation_source_results":["arena-7|muse-spark-1.2 (xHigh)"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":9,"raw_score":1290,"raw_unit":"Elo","ci_low":1282,"ci_high":1298,"rank_spread_min":2,"rank_spread_max":26,"sample_count":8271,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-7|claude-opus-5-high"],"is_preliminary":false},{"model_id":"gemini-3-pro","base_model":"gemini 3 pro","display_name":"gemini 3 pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro","normalized_model_family":"gemini-3-pro","base_model":"gemini 3 pro","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1289,"raw_unit":"Elo","ci_low":1281,"ci_high":1297,"rank_spread_min":2,"rank_spread_max":27,"sample_count":13019,"is_preliminary":false,"provider":"Google","source_order":10}],"aggregation_source_results":["arena-7|gemini-3-pro"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.5","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1286,"raw_unit":"Elo","ci_low":1279,"ci_high":1293,"rank_spread_min":3,"rank_spread_max":27,"sample_count":21389,"is_preliminary":false,"provider":"OpenAI","source_order":11},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-high","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":"High","reasoning_effort":"high","rank":15,"raw_score":1284,"raw_unit":"Elo","ci_low":1277,"ci_high":1291,"rank_spread_min":6,"rank_spread_max":29,"sample_count":20121,"is_preliminary":false,"provider":"OpenAI","source_order":15}],"aggregation_source_results":["arena-7|gpt-5.5"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1285,"raw_unit":"Elo","ci_low":1278,"ci_high":1292,"rank_spread_min":3,"rank_spread_max":28,"sample_count":13521,"is_preliminary":false,"provider":"Anthropic","source_order":12},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":21,"raw_score":1279,"raw_unit":"Elo","ci_low":1272,"ci_high":1286,"rank_spread_min":6,"rank_spread_max":32,"sample_count":13980,"is_preliminary":false,"provider":"Anthropic","source_order":21}],"aggregation_source_results":["arena-7|claude-opus-4-8-high"],"is_preliminary":false},{"model_id":"gemini-3-6-flash","base_model":"gemini 3.6 flash","display_name":"gemini 3.6 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.6-flash-high","normalized_model_family":"gemini-3-6-flash","base_model":"gemini 3.6 flash","variant":"High","reasoning_effort":"high","rank":13,"raw_score":1285,"raw_unit":"Elo","ci_low":1274,"ci_high":1296,"rank_spread_min":2,"rank_spread_max":31,"sample_count":3816,"is_preliminary":false,"provider":"Google","source_order":13}],"aggregation_source_results":["arena-7|gemini-3.6-flash-high"],"is_preliminary":false},{"model_id":"gemini-3-5-flash","base_model":"gemini 3.5 flash","display_name":"gemini 3.5 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-high","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"High","reasoning_effort":"high","rank":14,"raw_score":1284,"raw_unit":"Elo","ci_low":1276,"ci_high":1292,"rank_spread_min":3,"rank_spread_max":29,"sample_count":8259,"is_preliminary":false,"provider":"Google","source_order":14},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-medium","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"Medium","reasoning_effort":"medium","rank":16,"raw_score":1283,"raw_unit":"Elo","ci_low":1275,"ci_high":1291,"rank_spread_min":6,"rank_spread_max":31,"sample_count":8261,"is_preliminary":false,"provider":"Google","source_order":16}],"aggregation_source_results":["arena-7|gemini-3.5-flash-high"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.23981247,"mean_rank":17,"median_rank":17,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":17,"raw_score":1282,"raw_unit":"Elo","ci_low":1273,"ci_high":1291,"rank_spread_min":5,"rank_spread_max":32,"sample_count":5837,"is_preliminary":false,"provider":"OpenAI","source_order":17}],"aggregation_source_results":["arena-7|gpt-5.6-sol-xhigh"],"is_preliminary":false},{"model_id":"grok-4-5","base_model":"grok 4.5","display_name":"grok 4.5","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.23540891,"mean_rank":18,"median_rank":18,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.5","normalized_model_family":"grok-4-5","base_model":"grok 4.5","variant":null,"reasoning_effort":null,"rank":18,"raw_score":1282,"raw_unit":"Elo","ci_low":1273,"ci_high":1291,"rank_spread_min":6,"rank_spread_max":32,"sample_count":6401,"is_preliminary":false,"provider":"SpaceXAI","source_order":18}],"aggregation_source_results":["arena-7|grok-4.5"],"is_preliminary":false},{"model_id":"gpt-5-4","base_model":"gpt 5.4","display_name":"gpt 5.4","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.23137821,"mean_rank":19,"median_rank":19,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.4-high","normalized_model_family":"gpt-5-4","base_model":"gpt 5.4","variant":"High","reasoning_effort":"high","rank":19,"raw_score":1281,"raw_unit":"Elo","ci_low":1274,"ci_high":1288,"rank_spread_min":6,"rank_spread_max":31,"sample_count":23263,"is_preliminary":false,"provider":"OpenAI","source_order":19},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.4","normalized_model_family":"gpt-5-4","base_model":"gpt 5.4","variant":null,"reasoning_effort":null,"rank":20,"raw_score":1281,"raw_unit":"Elo","ci_low":1274,"ci_high":1288,"rank_spread_min":6,"rank_spread_max":32,"sample_count":21245,"is_preliminary":false,"provider":"OpenAI","source_order":20}],"aggregation_source_results":["arena-7|gpt-5.4-high"],"is_preliminary":false}],"candidate_count":103,"ranking":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1313,"raw_unit":"Elo","ci_low":1305,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":6,"sample_count":10002,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-7|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1301,"raw_unit":"Elo","ci_low":1294,"ci_high":1308,"rank_spread_min":1,"rank_spread_max":11,"sample_count":21137,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1299,"raw_unit":"Elo","ci_low":1292,"ci_high":1306,"rank_spread_min":1,"rank_spread_max":14,"sample_count":21457,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-7|claude-opus-4-7-high"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.7","claude-opus-4-7-high","claude-opus-4-7"]},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1300,"raw_unit":"Elo","ci_low":1292,"ci_high":1308,"rank_spread_min":1,"rank_spread_max":15,"sample_count":7244,"is_preliminary":false,"provider":"Alibaba","source_order":3}],"aggregation_source_results":["arena-7|qwen3.8-max"],"is_preliminary":false,"rank":3,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:qwen3-8-max","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen3.8 Max","qwen3.8-max"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1313,"raw_unit":"Elo","ci_low":1305,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":6,"sample_count":10002,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-7|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1301,"raw_unit":"Elo","ci_low":1294,"ci_high":1308,"rank_spread_min":1,"rank_spread_max":11,"sample_count":21137,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1299,"raw_unit":"Elo","ci_low":1292,"ci_high":1306,"rank_spread_min":1,"rank_spread_max":14,"sample_count":21457,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["arena-7|claude-opus-4-7-high"],"is_preliminary":false,"rank":2,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.7","claude-opus-4-7-high","claude-opus-4-7"]},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1300,"raw_unit":"Elo","ci_low":1292,"ci_high":1308,"rank_spread_min":1,"rank_spread_max":15,"sample_count":7244,"is_preliminary":false,"provider":"Alibaba","source_order":3}],"aggregation_source_results":["arena-7|qwen3.8-max"],"is_preliminary":false,"rank":3,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:qwen3-8-max","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen3.8 Max","qwen3.8-max"]}]}],"deepLink":"https://lll.bz/llm?task=vision"},{"id":"ocr","title":"Text from image (OCR)","name":"Text from image (OCR)","description":"For reading text embedded in images and scanned content.","category":"image","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["ocr"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1329,"raw_unit":"Elo","ci_low":1320,"ci_high":1338,"rank_spread_min":1,"rank_spread_max":5,"sample_count":7174,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["ocr|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1315,"raw_unit":"Elo","ci_low":1306,"ci_high":1324,"rank_spread_min":1,"rank_spread_max":13,"sample_count":5092,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["ocr|qwen3.8-max"],"is_preliminary":false,"rank":2,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:qwen3-8-max","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1314,"raw_unit":"Elo","ci_low":1307,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":12,"sample_count":15512,"is_preliminary":false,"provider":null,"source_order":3},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1314,"raw_unit":"Elo","ci_low":1307,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":12,"sample_count":15236,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["ocr|claude-opus-4-7"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6-high","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":"High","reasoning_effort":"high","rank":5,"raw_score":1313,"raw_unit":"Elo","ci_low":1306,"ci_high":1320,"rank_spread_min":2,"rank_spread_max":12,"sample_count":14892,"is_preliminary":false,"provider":null,"source_order":5},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-6","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1310,"raw_unit":"Elo","ci_low":1303,"ci_high":1317,"rank_spread_min":2,"rank_spread_max":15,"sample_count":18221,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["ocr|claude-opus-4-6-high"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1308,"raw_unit":"Elo","ci_low":1299,"ci_high":1317,"rank_spread_min":2,"rank_spread_max":23,"sample_count":5652,"is_preliminary":false,"provider":null,"source_order":7}],"aggregation_source_results":["ocr|claude-opus-5-high"],"is_preliminary":false},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.2 (xHigh)","normalized_model_family":"muse-spark-1-2","base_model":"muse spark 1.2","variant":"Xhigh","reasoning_effort":"xhigh","rank":8,"raw_score":1306,"raw_unit":"Elo","ci_low":1289,"ci_high":1323,"rank_spread_min":1,"rank_spread_max":31,"sample_count":1265,"is_preliminary":false,"provider":null,"source_order":8}],"aggregation_source_results":["ocr|muse-spark-1.2 (xHigh)"],"is_preliminary":false},{"model_id":"gemini-3-pro","base_model":"gemini 3 pro","display_name":"gemini 3 pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro","normalized_model_family":"gemini-3-pro","base_model":"gemini 3 pro","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1302,"raw_unit":"Elo","ci_low":1294,"ci_high":1310,"rank_spread_min":2,"rank_spread_max":28,"sample_count":7957,"is_preliminary":false,"provider":null,"source_order":9}],"aggregation_source_results":["ocr|gemini-3-pro"],"is_preliminary":false},{"model_id":"muse-spark","base_model":"muse spark","display_name":"muse spark","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark","normalized_model_family":"muse-spark","base_model":"muse spark","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1302,"raw_unit":"Elo","ci_low":1292,"ci_high":1312,"rank_spread_min":2,"rank_spread_max":28,"sample_count":4021,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["ocr|muse-spark"],"is_preliminary":false},{"model_id":"gemini-3-6-flash","base_model":"gemini 3.6 flash","display_name":"gemini 3.6 flash","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.6-flash-high","normalized_model_family":"gemini-3-6-flash","base_model":"gemini 3.6 flash","variant":"High","reasoning_effort":"high","rank":11,"raw_score":1301,"raw_unit":"Elo","ci_low":1289,"ci_high":1313,"rank_spread_min":2,"rank_spread_max":31,"sample_count":2553,"is_preliminary":false,"provider":null,"source_order":11}],"aggregation_source_results":["ocr|gemini-3.6-flash-high"],"is_preliminary":false},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8-high","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1301,"raw_unit":"Elo","ci_low":1293,"ci_high":1309,"rank_spread_min":2,"rank_spread_max":28,"sample_count":9631,"is_preliminary":false,"provider":null,"source_order":12},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-8","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":17,"raw_score":1294,"raw_unit":"Elo","ci_low":1286,"ci_high":1302,"rank_spread_min":7,"rank_spread_max":32,"sample_count":9913,"is_preliminary":false,"provider":null,"source_order":17}],"aggregation_source_results":["ocr|claude-opus-4-8-high"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.5","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1298,"raw_unit":"Elo","ci_low":1291,"ci_high":1305,"rank_spread_min":6,"rank_spread_max":28,"sample_count":15235,"is_preliminary":false,"provider":null,"source_order":13},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.5-high","normalized_model_family":"gpt-5-5","base_model":"gpt 5.5","variant":"High","reasoning_effort":"high","rank":15,"raw_score":1297,"raw_unit":"Elo","ci_low":1290,"ci_high":1304,"rank_spread_min":7,"rank_spread_max":30,"sample_count":14226,"is_preliminary":false,"provider":null,"source_order":15}],"aggregation_source_results":["ocr|gpt-5.5"],"is_preliminary":false},{"model_id":"gemini-3-5-flash","base_model":"gemini 3.5 flash","display_name":"gemini 3.5 flash","official_model_id":null,"provider":"Google","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-medium","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"Medium","reasoning_effort":"medium","rank":14,"raw_score":1297,"raw_unit":"Elo","ci_low":1288,"ci_high":1306,"rank_spread_min":5,"rank_spread_max":31,"sample_count":5727,"is_preliminary":false,"provider":null,"source_order":14},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.5-flash-high","normalized_model_family":"gemini-3-5-flash","base_model":"gemini 3.5 flash","variant":"High","reasoning_effort":"high","rank":22,"raw_score":1293,"raw_unit":"Elo","ci_low":1284,"ci_high":1302,"rank_spread_min":7,"rank_spread_max":33,"sample_count":5808,"is_preliminary":false,"provider":null,"source_order":22}],"aggregation_source_results":["ocr|gemini-3.5-flash-medium"],"is_preliminary":false},{"model_id":"gpt-5-4","base_model":"gpt 5.4","display_name":"gpt 5.4","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.24465054,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.4-high","normalized_model_family":"gpt-5-4","base_model":"gpt 5.4","variant":"High","reasoning_effort":"high","rank":16,"raw_score":1296,"raw_unit":"Elo","ci_low":1289,"ci_high":1303,"rank_spread_min":7,"rank_spread_max":30,"sample_count":16707,"is_preliminary":false,"provider":null,"source_order":16},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.4","normalized_model_family":"gpt-5-4","base_model":"gpt 5.4","variant":null,"reasoning_effort":null,"rank":21,"raw_score":1293,"raw_unit":"Elo","ci_low":1286,"ci_high":1300,"rank_spread_min":7,"rank_spread_max":32,"sample_count":15297,"is_preliminary":false,"provider":null,"source_order":21}],"aggregation_source_results":["ocr|gpt-5.4-high"],"is_preliminary":false},{"model_id":"grok-4-5","base_model":"grok 4.5","display_name":"grok 4.5","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.23540891,"mean_rank":18,"median_rank":18,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.5","normalized_model_family":"grok-4-5","base_model":"grok 4.5","variant":null,"reasoning_effort":null,"rank":18,"raw_score":1294,"raw_unit":"Elo","ci_low":1284,"ci_high":1304,"rank_spread_min":6,"rank_spread_max":33,"sample_count":4388,"is_preliminary":false,"provider":null,"source_order":18}],"aggregation_source_results":["ocr|grok-4.5"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.23137821,"mean_rank":19,"median_rank":19,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-pro-preview","normalized_model_family":"gemini-3-1-pro-preview","base_model":"gemini 3.1 pro preview","variant":null,"reasoning_effort":null,"rank":19,"raw_score":1294,"raw_unit":"Elo","ci_low":1288,"ci_high":1300,"rank_spread_min":8,"rank_spread_max":31,"sample_count":27497,"is_preliminary":false,"provider":null,"source_order":19}],"aggregation_source_results":["ocr|gemini-3.1-pro-preview"],"is_preliminary":false}],"candidate_count":92,"ranking":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1329,"raw_unit":"Elo","ci_low":1320,"ci_high":1338,"rank_spread_min":1,"rank_spread_max":5,"sample_count":7174,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["ocr|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1315,"raw_unit":"Elo","ci_low":1306,"ci_high":1324,"rank_spread_min":1,"rank_spread_max":13,"sample_count":5092,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["ocr|qwen3.8-max"],"is_preliminary":false,"rank":2,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:qwen3-8-max","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen3.8 Max","qwen3.8-max"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1314,"raw_unit":"Elo","ci_low":1307,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":12,"sample_count":15512,"is_preliminary":false,"provider":null,"source_order":3},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1314,"raw_unit":"Elo","ci_low":1307,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":12,"sample_count":15236,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["ocr|claude-opus-4-7"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.7","claude-opus-4-7","claude-opus-4-7-high"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1329,"raw_unit":"Elo","ci_low":1320,"ci_high":1338,"rank_spread_min":1,"rank_spread_max":5,"sample_count":7174,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["ocr|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","claude-fable-5"]},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1315,"raw_unit":"Elo","ci_low":1306,"ci_high":1324,"rank_spread_min":1,"rank_spread_max":13,"sample_count":5092,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["ocr|qwen3.8-max"],"is_preliminary":false,"rank":2,"modelId":"qwen3-8-max","modelName":"Qwen3.8 Max","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:qwen3-8-max","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen3.8 Max","qwen3.8-max"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1314,"raw_unit":"Elo","ci_low":1307,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":12,"sample_count":15512,"is_preliminary":false,"provider":null,"source_order":3},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-4-7-high","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":"High","reasoning_effort":"high","rank":4,"raw_score":1314,"raw_unit":"Elo","ci_low":1307,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":12,"sample_count":15236,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["ocr|claude-opus-4-7"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.7","claude-opus-4-7","claude-opus-4-7-high"]}]}],"deepLink":"https://lll.bz/llm?task=ocr"},{"id":"image-generation","title":"Image generation","name":"Image generation","description":"For generating images from natural-language prompts.","category":"image","sourceName":"Arena, Artificial Analysis","sourceUrl":"https://arena.ai/leaderboard/text-to-image","sourceDate":"2026-09-04","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Independent image preference sources; configurations are retained separately.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-12","aa-17"],"consensus":{"method":"weighted_reciprocal_rank","winner":"gpt-image-2","confidence":"medium","disagreement_status":"clear_winner","independent_source_count":2,"source_coverage":1,"family_weights":{"Arena":1,"Artificial Analysis":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1382,"raw_unit":"Elo","ci_low":1378,"ci_high":1386,"rank_spread_min":1,"rank_spread_max":1,"sample_count":77830,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1178,"raw_unit":"Elo","ci_low":1168,"ci_high":1188,"rank_spread_min":1,"rank_spread_max":1,"sample_count":14585,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-12|gpt-image-2 (medium)","aa-17|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately."},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1332,"raw_unit":"Elo","ci_low":1325,"ci_high":1339,"rank_spread_min":2,"rank_spread_max":3,"sample_count":10086,"is_preliminary":false,"provider":"Microsoft AI","source_order":2},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1149,"raw_unit":"Elo","ci_low":1137,"ci_high":1161,"rank_spread_min":2,"rank_spread_max":2,"sample_count":6351,"is_preliminary":false,"provider":"Microsoft AI","source_order":2}],"aggregation_source_results":["arena-12|mai-image-2.6","aa-17|MAI-Image-2.6"],"is_preliminary":false,"rank":2,"modelId":"mai-image-2-6","modelName":"MAI-Image 2.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:mai-image-2-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately."},{"model_id":"reve-2-1","base_model":"Reve 2.1","display_name":"Reve 2.1","official_model_id":null,"provider":"Reve","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"reve-2.1","normalized_model_family":"reve-2-1","base_model":"Reve 2.1","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1301,"raw_unit":"Elo","ci_low":1293,"ci_high":1309,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7576,"is_preliminary":false,"provider":"Reve","source_order":4},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Reve 2.1","normalized_model_family":"reve-2-1","base_model":"Reve 2.1","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1127,"raw_unit":"Elo","ci_low":1118,"ci_high":1136,"rank_spread_min":3,"rank_spread_max":4,"sample_count":16045,"is_preliminary":false,"provider":"Reve","source_order":3}],"aggregation_source_results":["arena-12|reve-2.1","aa-17|Reve 2.1"],"is_preliminary":false,"rank":3,"modelId":"reve-2-1","modelName":"Reve 2.1","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:reve-2-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately."}],"pending_evaluation":[],"candidates":[{"model_id":"grok-imagine-image-2-0","base_model":"Grok Imagine Image 2.0","display_name":"Grok Imagine Image 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"Low","reasoning_effort":"low","evaluation_status":"partially_evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-image-2.0 (low)","normalized_model_family":"grok-imagine-image-2-0","base_model":"grok imagine image 2.0","variant":"Low","reasoning_effort":"low","rank":3,"raw_score":1315,"raw_unit":"Elo","ci_low":1303,"ci_high":1327,"rank_spread_min":2,"rank_spread_max":4,"sample_count":2682,"is_preliminary":true,"provider":"SpaceXAI","source_order":3}],"aggregation_source_results":["arena-12|grok-imagine-image-2.0 (low)"],"is_preliminary":true},{"model_id":"nano-banana-2","base_model":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","display_name":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Nano Banana 2 (Gemini 3.1 Flash Image)","normalized_model_family":"nano-banana-2","base_model":"Nano Banana 2","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1121,"raw_unit":"Elo","ci_low":1112,"ci_high":1130,"rank_spread_min":3,"rank_spread_max":6,"sample_count":15772,"is_preliminary":false,"provider":"Google","source_order":4}],"aggregation_source_results":["aa-17|Nano Banana 2 (Gemini 3.1 Flash Image)"],"is_preliminary":false},{"model_id":"muse-image","base_model":"Muse Image","display_name":"Muse Image","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1279,"raw_unit":"Elo","ci_low":1273,"ci_high":1285,"rank_spread_min":5,"rank_spread_max":6,"sample_count":24856,"is_preliminary":false,"provider":"Meta","source_order":5},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1116,"raw_unit":"Elo","ci_low":1105,"ci_high":1127,"rank_spread_min":4,"rank_spread_max":7,"sample_count":5640,"is_preliminary":false,"provider":"Meta","source_order":5}],"aggregation_source_results":["arena-12|muse-image","aa-17|Muse Image"],"is_preliminary":false},{"model_id":"reve-2-0","base_model":"reve 2.0","display_name":"reve 2.0","official_model_id":null,"provider":"Reve","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"reve-2.0","normalized_model_family":"reve-2-0","base_model":"reve 2.0","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1270,"raw_unit":"Elo","ci_low":1264,"ci_high":1276,"rank_spread_min":5,"rank_spread_max":7,"sample_count":14636,"is_preliminary":false,"provider":"Reve","source_order":6}],"aggregation_source_results":["arena-12|reve-2.0"],"is_preliminary":false},{"model_id":"gpt-image-1-5","base_model":"GPT Image 1.5","display_name":"GPT Image 1.5","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 1.5 (high)","normalized_model_family":"gpt-image-1-5","base_model":"GPT Image 1.5","variant":"High","reasoning_effort":"high","rank":6,"raw_score":1114,"raw_unit":"Elo","ci_low":1105,"ci_high":1123,"rank_spread_min":4,"rank_spread_max":7,"sample_count":14082,"is_preliminary":false,"provider":"OpenAI","source_order":6}],"aggregation_source_results":["aa-17|GPT Image 1.5 (high)"],"is_preliminary":false},{"model_id":"gemini-3-1-flash-image-web-search","base_model":"gemini 3.1 flash image [web search]","display_name":"gemini 3.1 flash image [web search]","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-flash-image (nano-banana-2) [web-search]","normalized_model_family":"gemini-3-1-flash-image-web-search","base_model":"gemini 3.1 flash image [web search]","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1261,"raw_unit":"Elo","ci_low":1256,"ci_high":1266,"rank_spread_min":6,"rank_spread_max":11,"sample_count":40649,"is_preliminary":false,"provider":"Google","source_order":7}],"aggregation_source_results":["arena-12|gemini-3.1-flash-image (nano-banana-2) [web-search]"],"is_preliminary":false},{"model_id":"mai-image-2-6-flash","base_model":"MAI-Image-2.6-Flash","display_name":"MAI-Image-2.6-Flash","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6-Flash","normalized_model_family":"mai-image-2-6-flash","base_model":"MAI-Image-2.6-Flash","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1099,"raw_unit":"Elo","ci_low":1089,"ci_high":1109,"rank_spread_min":8,"rank_spread_max":10,"sample_count":5162,"is_preliminary":false,"provider":"Microsoft AI","source_order":8}],"aggregation_source_results":["aa-17|MAI-Image-2.6-Flash"],"is_preliminary":false},{"model_id":"mai-image-2-5","base_model":"mai image 2.5","display_name":"mai image 2.5","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31119908,"mean_rank":8.5,"median_rank":8.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.5","normalized_model_family":"mai-image-2-5","base_model":"mai image 2.5","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1254,"raw_unit":"Elo","ci_low":1250,"ci_high":1258,"rank_spread_min":7,"rank_spread_max":11,"sample_count":57295,"is_preliminary":false,"provider":"Microsoft AI","source_order":10},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.5","normalized_model_family":"mai-image-2-5","base_model":"MAI-Image-2.5","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1112,"raw_unit":"Elo","ci_low":1103,"ci_high":1121,"rank_spread_min":5,"rank_spread_max":7,"sample_count":14344,"is_preliminary":false,"provider":"Microsoft AI","source_order":7}],"aggregation_source_results":["arena-12|mai-image-2.5","aa-17|MAI-Image-2.5"],"is_preliminary":false},{"model_id":"nano-banana-pro","base_model":"Nano Banana Pro","display_name":"Nano Banana Pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Nano Banana Pro (Gemini 3 Pro Image)","normalized_model_family":"nano-banana-pro","base_model":"Nano Banana Pro","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1099,"raw_unit":"Elo","ci_low":1090,"ci_high":1108,"rank_spread_min":8,"rank_spread_max":10,"sample_count":14219,"is_preliminary":false,"provider":"Google","source_order":9}],"aggregation_source_results":["aa-17|Nano Banana Pro (Gemini 3 Pro Image)"],"is_preliminary":false},{"model_id":"mai-image-2-5-pro","base_model":"MAI-Image-2.5-Pro","display_name":"MAI-Image-2.5-Pro","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.5-Pro","normalized_model_family":"mai-image-2-5-pro","base_model":"MAI-Image-2.5-Pro","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1096,"raw_unit":"Elo","ci_low":1087,"ci_high":1105,"rank_spread_min":8,"rank_spread_max":11,"sample_count":11535,"is_preliminary":false,"provider":"Microsoft AI","source_order":10}],"aggregation_source_results":["aa-17|MAI-Image-2.5-Pro"],"is_preliminary":false},{"model_id":"seedream-5-0-pro","base_model":"seedream 5.0 pro","display_name":"seedream 5.0 pro","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28905721,"mean_rank":10.5,"median_rank":10.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"seedream-5.0-pro","normalized_model_family":"seedream-5-0-pro","base_model":"seedream 5.0 pro","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1258,"raw_unit":"Elo","ci_low":1254,"ci_high":1262,"rank_spread_min":7,"rank_spread_max":11,"sample_count":59484,"is_preliminary":false,"provider":"Bytedance","source_order":8},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Seedream 5.0 Pro","normalized_model_family":"seedream-5-0-pro","base_model":"Seedream 5.0 Pro","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1083,"raw_unit":"Elo","ci_low":1074,"ci_high":1092,"rank_spread_min":11,"rank_spread_max":14,"sample_count":11918,"is_preliminary":false,"provider":"ByteDance Seed","source_order":13}],"aggregation_source_results":["arena-12|seedream-5.0-pro","aa-17|Seedream 5.0 Pro"],"is_preliminary":false},{"model_id":"qwen-image-3-0-pro","base_model":"qwen image 3.0 pro","display_name":"qwen image 3.0 pro","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28563408,"mean_rank":10.5,"median_rank":10.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen-image-3.0-pro","normalized_model_family":"qwen-image-3-0-pro","base_model":"qwen image 3.0 pro","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1254,"raw_unit":"Elo","ci_low":1247,"ci_high":1261,"rank_spread_min":7,"rank_spread_max":12,"sample_count":10923,"is_preliminary":false,"provider":"Alibaba","source_order":9},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen-Image-3.0-Pro","normalized_model_family":"qwen-image-3-0-pro","base_model":"Qwen-Image-3.0-Pro","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1086,"raw_unit":"Elo","ci_low":1075,"ci_high":1097,"rank_spread_min":10,"rank_spread_max":14,"sample_count":5551,"is_preliminary":false,"provider":"Alibaba","source_order":12}],"aggregation_source_results":["arena-12|qwen-image-3.0-pro","aa-17|Qwen-Image-3.0-Pro"],"is_preliminary":false}],"candidate_count":144,"ranking":[{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1382,"raw_unit":"Elo","ci_low":1378,"ci_high":1386,"rank_spread_min":1,"rank_spread_max":1,"sample_count":77830,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1178,"raw_unit":"Elo","ci_low":1168,"ci_high":1188,"rank_spread_min":1,"rank_spread_max":1,"sample_count":14585,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-12|gpt-image-2 (medium)","aa-17|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately.","aliases":["GPT Image 2","gpt-image-2 (medium)","GPT Image 2 (high)"]},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1332,"raw_unit":"Elo","ci_low":1325,"ci_high":1339,"rank_spread_min":2,"rank_spread_max":3,"sample_count":10086,"is_preliminary":false,"provider":"Microsoft AI","source_order":2},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1149,"raw_unit":"Elo","ci_low":1137,"ci_high":1161,"rank_spread_min":2,"rank_spread_max":2,"sample_count":6351,"is_preliminary":false,"provider":"Microsoft AI","source_order":2}],"aggregation_source_results":["arena-12|mai-image-2.6","aa-17|MAI-Image-2.6"],"is_preliminary":false,"rank":2,"modelId":"mai-image-2-6","modelName":"MAI-Image 2.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:mai-image-2-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately.","aliases":["MAI-Image 2.6","mai-image-2.6","MAI-Image-2.6"]},{"model_id":"reve-2-1","base_model":"Reve 2.1","display_name":"Reve 2.1","official_model_id":null,"provider":"Reve","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"reve-2.1","normalized_model_family":"reve-2-1","base_model":"Reve 2.1","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1301,"raw_unit":"Elo","ci_low":1293,"ci_high":1309,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7576,"is_preliminary":false,"provider":"Reve","source_order":4},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Reve 2.1","normalized_model_family":"reve-2-1","base_model":"Reve 2.1","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1127,"raw_unit":"Elo","ci_low":1118,"ci_high":1136,"rank_spread_min":3,"rank_spread_max":4,"sample_count":16045,"is_preliminary":false,"provider":"Reve","source_order":3}],"aggregation_source_results":["arena-12|reve-2.1","aa-17|Reve 2.1"],"is_preliminary":false,"rank":3,"modelId":"reve-2-1","modelName":"Reve 2.1","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:reve-2-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately.","aliases":["Reve 2.1","reve-2.1","Reve 2.1"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1382,"raw_unit":"Elo","ci_low":1378,"ci_high":1386,"rank_spread_min":1,"rank_spread_max":1,"sample_count":77830,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1178,"raw_unit":"Elo","ci_low":1168,"ci_high":1188,"rank_spread_min":1,"rank_spread_max":1,"sample_count":14585,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-12|gpt-image-2 (medium)","aa-17|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately.","aliases":["GPT Image 2","gpt-image-2 (medium)","GPT Image 2 (high)"]},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1332,"raw_unit":"Elo","ci_low":1325,"ci_high":1339,"rank_spread_min":2,"rank_spread_max":3,"sample_count":10086,"is_preliminary":false,"provider":"Microsoft AI","source_order":2},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1149,"raw_unit":"Elo","ci_low":1137,"ci_high":1161,"rank_spread_min":2,"rank_spread_max":2,"sample_count":6351,"is_preliminary":false,"provider":"Microsoft AI","source_order":2}],"aggregation_source_results":["arena-12|mai-image-2.6","aa-17|MAI-Image-2.6"],"is_preliminary":false,"rank":2,"modelId":"mai-image-2-6","modelName":"MAI-Image 2.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:mai-image-2-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately.","aliases":["MAI-Image 2.6","mai-image-2.6","MAI-Image-2.6"]},{"model_id":"reve-2-1","base_model":"Reve 2.1","display_name":"Reve 2.1","official_model_id":null,"provider":"Reve","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"reve-2.1","normalized_model_family":"reve-2-1","base_model":"Reve 2.1","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1301,"raw_unit":"Elo","ci_low":1293,"ci_high":1309,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7576,"is_preliminary":false,"provider":"Reve","source_order":4},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Reve 2.1","normalized_model_family":"reve-2-1","base_model":"Reve 2.1","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1127,"raw_unit":"Elo","ci_low":1118,"ci_high":1136,"rank_spread_min":3,"rank_spread_max":4,"sample_count":16045,"is_preliminary":false,"provider":"Reve","source_order":3}],"aggregation_source_results":["arena-12|reve-2.1","aa-17|Reve 2.1"],"is_preliminary":false,"rank":3,"modelId":"reve-2-1","modelName":"Reve 2.1","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:reve-2-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately.","aliases":["Reve 2.1","reve-2.1","Reve 2.1"]}]}],"deepLink":"https://lll.bz/llm?task=image-generation"},{"id":"image-editing","title":"Image editing","name":"Image editing","description":"For editing existing images from text instructions.","category":"image","sourceName":"Arena, Artificial Analysis","sourceUrl":"https://arena.ai/leaderboard/image-edit","sourceDate":"2026-09-03","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-13","aa-18"],"consensus":{"method":"weighted_reciprocal_rank","winner":"gpt-image-2","confidence":"medium","disagreement_status":"source_split","independent_source_count":2,"source_coverage":1,"family_weights":{"Arena":1,"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":true},"models":[{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1461,"raw_unit":"Elo","ci_low":1457,"ci_high":1465,"rank_spread_min":1,"rank_spread_max":1,"sample_count":228827,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1117,"raw_unit":"Elo","ci_low":1107,"ci_high":1127,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11046,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-13|gpt-image-2 (medium)","aa-18|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier."},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1439,"raw_unit":"Elo","ci_low":1429,"ci_high":1449,"rank_spread_min":2,"rank_spread_max":3,"sample_count":5086,"is_preliminary":false,"provider":"Microsoft AI","source_order":2},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1122,"raw_unit":"Elo","ci_low":1112,"ci_high":1132,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11173,"is_preliminary":false,"provider":"Microsoft AI","source_order":1}],"aggregation_source_results":["arena-13|mai-image-2.6","aa-18|MAI-Image-2.6"],"is_preliminary":false,"rank":2,"modelId":"mai-image-2-6","modelName":"MAI-Image 2.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:mai-image-2-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier."},{"model_id":"muse-image","base_model":"Muse Image","display_name":"Muse Image","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1403,"raw_unit":"Elo","ci_low":1398,"ci_high":1408,"rank_spread_min":4,"rank_spread_max":5,"sample_count":76663,"is_preliminary":false,"provider":"Meta","source_order":4},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1105,"raw_unit":"Elo","ci_low":1095,"ci_high":1115,"rank_spread_min":3,"rank_spread_max":6,"sample_count":5493,"is_preliminary":false,"provider":"Meta","source_order":3}],"aggregation_source_results":["arena-13|muse-image","aa-18|Muse Image"],"is_preliminary":false,"rank":3,"modelId":"muse-image","modelName":"Muse Image","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:muse-image","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier."}],"pending_evaluation":[],"candidates":[{"model_id":"grok-imagine-image-2-0","base_model":"Grok Imagine Image 2.0","display_name":"Grok Imagine Image 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"Low","reasoning_effort":"low","evaluation_status":"partially_evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-image-2.0 (low)","normalized_model_family":"grok-imagine-image-2-0","base_model":"grok imagine image 2.0","variant":"Low","reasoning_effort":"low","rank":3,"raw_score":1439,"raw_unit":"Elo","ci_low":1431,"ci_high":1447,"rank_spread_min":2,"rank_spread_max":3,"sample_count":5941,"is_preliminary":true,"provider":"SpaceXAI","source_order":3}],"aggregation_source_results":["arena-13|grok-imagine-image-2.0 (low)"],"is_preliminary":true},{"model_id":"mai-image-2-6-flash","base_model":"MAI-Image-2.6-Flash","display_name":"MAI-Image-2.6-Flash","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6-Flash","normalized_model_family":"mai-image-2-6-flash","base_model":"MAI-Image-2.6-Flash","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1104,"raw_unit":"Elo","ci_low":1095,"ci_high":1113,"rank_spread_min":3,"rank_spread_max":5,"sample_count":5442,"is_preliminary":false,"provider":"Microsoft AI","source_order":4}],"aggregation_source_results":["aa-18|MAI-Image-2.6-Flash"],"is_preliminary":false},{"model_id":"nano-banana-2","base_model":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","display_name":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Nano Banana 2 (Gemini 3.1 Flash Image)","normalized_model_family":"nano-banana-2","base_model":"Nano Banana 2","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1104,"raw_unit":"Elo","ci_low":1094,"ci_high":1114,"rank_spread_min":3,"rank_spread_max":6,"sample_count":11089,"is_preliminary":false,"provider":"Google","source_order":5}],"aggregation_source_results":["aa-18|Nano Banana 2 (Gemini 3.1 Flash Image)"],"is_preliminary":false},{"model_id":"mai-image-2-5","base_model":"mai image 2.5","display_name":"mai image 2.5","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.37153,"mean_rank":5.5,"median_rank":5.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.5","normalized_model_family":"mai-image-2-5","base_model":"mai image 2.5","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1400,"raw_unit":"Elo","ci_low":1396,"ci_high":1404,"rank_spread_min":4,"rank_spread_max":6,"sample_count":174732,"is_preliminary":false,"provider":"Microsoft AI","source_order":5},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.5","normalized_model_family":"mai-image-2-5","base_model":"MAI-Image-2.5","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1095,"raw_unit":"Elo","ci_low":1085,"ci_high":1105,"rank_spread_min":3,"rank_spread_max":10,"sample_count":10719,"is_preliminary":false,"provider":"Microsoft AI","source_order":6}],"aggregation_source_results":["arena-13|mai-image-2.5","aa-18|MAI-Image-2.5"],"is_preliminary":false},{"model_id":"seedream-5-0-pro","base_model":"seedream 5.0 pro","display_name":"seedream 5.0 pro","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.34477026,"mean_rank":6.5,"median_rank":6.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"seedream-5.0-pro","normalized_model_family":"seedream-5-0-pro","base_model":"seedream 5.0 pro","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1394,"raw_unit":"Elo","ci_low":1390,"ci_high":1398,"rank_spread_min":5,"rank_spread_max":10,"sample_count":165349,"is_preliminary":false,"provider":"Bytedance","source_order":6},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Seedream 5.0 Pro","normalized_model_family":"seedream-5-0-pro","base_model":"Seedream 5.0 Pro","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1092,"raw_unit":"Elo","ci_low":1082,"ci_high":1102,"rank_spread_min":6,"rank_spread_max":10,"sample_count":10617,"is_preliminary":false,"provider":"ByteDance Seed","source_order":7}],"aggregation_source_results":["arena-13|seedream-5.0-pro","aa-18|Seedream 5.0 Pro"],"is_preliminary":false},{"model_id":"chatgpt-image-latest-high-fidelity","base_model":"chatgpt image latest high fidelity","display_name":"chatgpt image latest high fidelity","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"chatgpt-image-latest-high-fidelity (20251216)","normalized_model_family":"chatgpt-image-latest-high-fidelity","base_model":"chatgpt image latest high fidelity","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1390,"raw_unit":"Elo","ci_low":1387,"ci_high":1393,"rank_spread_min":6,"rank_spread_max":11,"sample_count":536869,"is_preliminary":false,"provider":"OpenAI","source_order":7}],"aggregation_source_results":["arena-13|chatgpt-image-latest-high-fidelity (20251216)"],"is_preliminary":false},{"model_id":"mai-image-2-5-pro","base_model":"MAI-Image-2.5-Pro","display_name":"MAI-Image-2.5-Pro","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.5-Pro","normalized_model_family":"mai-image-2-5-pro","base_model":"MAI-Image-2.5-Pro","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1090,"raw_unit":"Elo","ci_low":1080,"ci_high":1100,"rank_spread_min":6,"rank_spread_max":10,"sample_count":11111,"is_preliminary":false,"provider":"Microsoft AI","source_order":8}],"aggregation_source_results":["aa-18|MAI-Image-2.5-Pro"],"is_preliminary":false},{"model_id":"gemini-3-pro-image-2k","base_model":"gemini 3 pro image 2k","display_name":"gemini 3 pro image 2k","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3-pro-image-2k (nano-banana-pro)","normalized_model_family":"gemini-3-pro-image-2k","base_model":"gemini 3 pro image 2k","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1390,"raw_unit":"Elo","ci_low":1387,"ci_high":1393,"rank_spread_min":6,"rank_spread_max":11,"sample_count":548733,"is_preliminary":false,"provider":"Google","source_order":9}],"aggregation_source_results":["arena-13|gemini-3-pro-image-2k (nano-banana-pro)"],"is_preliminary":false},{"model_id":"nano-banana-pro","base_model":"Nano Banana Pro","display_name":"Nano Banana Pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Nano Banana Pro (Gemini 3 Pro Image)","normalized_model_family":"nano-banana-pro","base_model":"Nano Banana Pro","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1087,"raw_unit":"Elo","ci_low":1077,"ci_high":1097,"rank_spread_min":6,"rank_spread_max":11,"sample_count":11057,"is_preliminary":false,"provider":"Google","source_order":9}],"aggregation_source_results":["aa-18|Nano Banana Pro (Gemini 3 Pro Image)"],"is_preliminary":false},{"model_id":"gemini-3-1-flash-image-web-search","base_model":"gemini 3.1 flash image [web search]","display_name":"gemini 3.1 flash image [web search]","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-3.1-flash-image (nano-banana-2) [web-search]","normalized_model_family":"gemini-3-1-flash-image-web-search","base_model":"gemini 3.1 flash image [web search]","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1388,"raw_unit":"Elo","ci_low":1384,"ci_high":1392,"rank_spread_min":6,"rank_spread_max":11,"sample_count":150230,"is_preliminary":false,"provider":"Google","source_order":10}],"aggregation_source_results":["arena-13|gemini-3.1-flash-image (nano-banana-2) [web-search]"],"is_preliminary":false},{"model_id":"gpt-image-1-5","base_model":"GPT Image 1.5","display_name":"GPT Image 1.5","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 1.5 (high)","normalized_model_family":"gpt-image-1-5","base_model":"GPT Image 1.5","variant":"High","reasoning_effort":"high","rank":10,"raw_score":1087,"raw_unit":"Elo","ci_low":1077,"ci_high":1097,"rank_spread_min":6,"rank_spread_max":11,"sample_count":11037,"is_preliminary":false,"provider":"OpenAI","source_order":10}],"aggregation_source_results":["aa-18|GPT Image 1.5 (high)"],"is_preliminary":false},{"model_id":"grok-imagine-image-quality","base_model":"grok imagine image quality","display_name":"grok imagine image quality","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28905721,"mean_rank":10.5,"median_rank":10.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-image-quality (20260519)","normalized_model_family":"grok-imagine-image-quality","base_model":"grok imagine image quality","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1390,"raw_unit":"Elo","ci_low":1384,"ci_high":1396,"rank_spread_min":6,"rank_spread_max":11,"sample_count":35601,"is_preliminary":false,"provider":"SpaceXAI","source_order":8},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"grok-imagine-image-quality","normalized_model_family":"grok-imagine-image-quality","base_model":"grok imagine image quality","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1070,"raw_unit":"Elo","ci_low":1059,"ci_high":1081,"rank_spread_min":11,"rank_spread_max":14,"sample_count":3619,"is_preliminary":false,"provider":"SpaceXAI","source_order":13}],"aggregation_source_results":["arena-13|grok-imagine-image-quality (20260519)","aa-18|grok-imagine-image-quality"],"is_preliminary":false}],"candidate_count":96,"ranking":[{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1461,"raw_unit":"Elo","ci_low":1457,"ci_high":1465,"rank_spread_min":1,"rank_spread_max":1,"sample_count":228827,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1117,"raw_unit":"Elo","ci_low":1107,"ci_high":1127,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11046,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-13|gpt-image-2 (medium)","aa-18|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","aliases":["GPT Image 2","gpt-image-2 (medium)","GPT Image 2 (high)"]},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1439,"raw_unit":"Elo","ci_low":1429,"ci_high":1449,"rank_spread_min":2,"rank_spread_max":3,"sample_count":5086,"is_preliminary":false,"provider":"Microsoft AI","source_order":2},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1122,"raw_unit":"Elo","ci_low":1112,"ci_high":1132,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11173,"is_preliminary":false,"provider":"Microsoft AI","source_order":1}],"aggregation_source_results":["arena-13|mai-image-2.6","aa-18|MAI-Image-2.6"],"is_preliminary":false,"rank":2,"modelId":"mai-image-2-6","modelName":"MAI-Image 2.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:mai-image-2-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","aliases":["MAI-Image 2.6","mai-image-2.6","MAI-Image-2.6"]},{"model_id":"muse-image","base_model":"Muse Image","display_name":"Muse Image","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1403,"raw_unit":"Elo","ci_low":1398,"ci_high":1408,"rank_spread_min":4,"rank_spread_max":5,"sample_count":76663,"is_preliminary":false,"provider":"Meta","source_order":4},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1105,"raw_unit":"Elo","ci_low":1095,"ci_high":1115,"rank_spread_min":3,"rank_spread_max":6,"sample_count":5493,"is_preliminary":false,"provider":"Meta","source_order":3}],"aggregation_source_results":["arena-13|muse-image","aa-18|Muse Image"],"is_preliminary":false,"rank":3,"modelId":"muse-image","modelName":"Muse Image","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:muse-image","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","aliases":["Muse Image","muse-image","Muse Image"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1461,"raw_unit":"Elo","ci_low":1457,"ci_high":1465,"rank_spread_min":1,"rank_spread_max":1,"sample_count":228827,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1117,"raw_unit":"Elo","ci_low":1107,"ci_high":1127,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11046,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-13|gpt-image-2 (medium)","aa-18|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","aliases":["GPT Image 2","gpt-image-2 (medium)","GPT Image 2 (high)"]},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"mai-image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1439,"raw_unit":"Elo","ci_low":1429,"ci_high":1449,"rank_spread_min":2,"rank_spread_max":3,"sample_count":5086,"is_preliminary":false,"provider":"Microsoft AI","source_order":2},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAI-Image-2.6","normalized_model_family":"mai-image-2-6","base_model":"MAI-Image 2.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1122,"raw_unit":"Elo","ci_low":1112,"ci_high":1132,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11173,"is_preliminary":false,"provider":"Microsoft AI","source_order":1}],"aggregation_source_results":["arena-13|mai-image-2.6","aa-18|MAI-Image-2.6"],"is_preliminary":false,"rank":2,"modelId":"mai-image-2-6","modelName":"MAI-Image 2.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:mai-image-2-6","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","aliases":["MAI-Image 2.6","mai-image-2.6","MAI-Image-2.6"]},{"model_id":"muse-image","base_model":"Muse Image","display_name":"Muse Image","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1403,"raw_unit":"Elo","ci_low":1398,"ci_high":1408,"rank_spread_min":4,"rank_spread_max":5,"sample_count":76663,"is_preliminary":false,"provider":"Meta","source_order":4},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Image","normalized_model_family":"muse-image","base_model":"Muse Image","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1105,"raw_unit":"Elo","ci_low":1095,"ci_high":1115,"rank_spread_min":3,"rank_spread_max":6,"sample_count":5493,"is_preliminary":false,"provider":"Meta","source_order":3}],"aggregation_source_results":["arena-13|muse-image","aa-18|Muse Image"],"is_preliminary":false,"rank":3,"modelId":"muse-image","modelName":"Muse Image","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:muse-image","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier.","aliases":["Muse Image","muse-image","Muse Image"]}]}],"deepLink":"https://lll.bz/llm?task=image-editing"},{"id":"text-to-video","title":"Text → video","name":"Text → video","description":"For generating complete videos from text prompts.","category":"video","sourceName":"Arena, Artificial Analysis","sourceUrl":"https://arena.ai/leaderboard/text-to-video","sourceDate":"2026-09-04","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-14","aa-19"],"consensus":{"method":"weighted_reciprocal_rank","winner":"wan-3-0","confidence":"medium","disagreement_status":"source_split","independent_source_count":2,"source_coverage":1,"family_weights":{"Arena":1,"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":true},"models":[{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.75,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1494,"raw_unit":"Elo","ci_low":1475,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":1167,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1239,"raw_unit":"Elo","ci_low":1229,"ci_high":1249,"rank_spread_min":1,"rank_spread_max":3,"sample_count":5591,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-14|wan3.0","aa-19|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.750","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner."},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1511,"raw_unit":"Elo","ci_low":1501,"ci_high":1521,"rank_spread_min":1,"rank_spread_max":5,"sample_count":21934,"is_preliminary":false,"provider":"Google","source_order":2},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1238,"raw_unit":"Elo","ci_low":1232,"ci_high":1244,"rank_spread_min":1,"rank_spread_max":3,"sample_count":18134,"is_preliminary":false,"provider":"Google","source_order":2}],"aggregation_source_results":["arena-14|gemini-omni-flash","aa-19|Gemini Omni Flash"],"is_preliminary":false,"rank":2,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:gemini-omni-flash","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner."},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.40773244,"mean_rank":5.5,"median_rank":5.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1462,"raw_unit":"Elo","ci_low":1452,"ci_high":1472,"rank_spread_min":6,"rank_spread_max":9,"sample_count":7648,"is_preliminary":false,"provider":"MiniMax","source_order":8},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1235,"raw_unit":"Elo","ci_low":1225,"ci_high":1245,"rank_spread_min":1,"rank_spread_max":4,"sample_count":5451,"is_preliminary":false,"provider":"Fal","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1227,"raw_unit":"Elo","ci_low":1220,"ci_high":1234,"rank_spread_min":4,"rank_spread_max":5,"sample_count":8993,"is_preliminary":false,"provider":"MiniMax","source_order":4}],"aggregation_source_results":["arena-14|minimax-h3","aa-19|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":3,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.408","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner."}],"pending_evaluation":[],"candidates":[{"model_id":"gemini-omni-1-1-flash","base_model":"Gemini Omni 1.1 Flash","display_name":"Gemini Omni 1.1 Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-1.1-flash","normalized_model_family":"gemini-omni-1-1-flash","base_model":"Gemini Omni 1.1 Flash","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1515,"raw_unit":"Elo","ci_low":1500,"ci_high":1530,"rank_spread_min":1,"rank_spread_max":5,"sample_count":1777,"is_preliminary":false,"provider":"Google","source_order":1}],"aggregation_source_results":["arena-14|gemini-omni-1.1-flash"],"is_preliminary":false},{"model_id":"flux-3-video","base_model":"flux 3 video","display_name":"flux 3 video","official_model_id":null,"provider":"Black Forest Labs","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"flux-3-video","normalized_model_family":"flux-3-video","base_model":"flux 3 video","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1494,"raw_unit":"Elo","ci_low":1477,"ci_high":1511,"rank_spread_min":1,"rank_spread_max":7,"sample_count":1290,"is_preliminary":true,"provider":"Black Forest Labs","source_order":4}],"aggregation_source_results":["arena-14|flux-3-video"],"is_preliminary":true},{"model_id":"grok-imagine-video-1-5-agent","base_model":"grok imagine video 1.5 agent","display_name":"grok imagine video 1.5 agent","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-video-1.5-agent","normalized_model_family":"grok-imagine-video-1-5-agent","base_model":"grok imagine video 1.5 agent","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1491,"raw_unit":"Elo","ci_low":1472,"ci_high":1510,"rank_spread_min":1,"rank_spread_max":7,"sample_count":1195,"is_preliminary":true,"provider":"SpaceXAI","source_order":5}],"aggregation_source_results":["arena-14|grok-imagine-video-1.5-agent"],"is_preliminary":true},{"model_id":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","display_name":"Dreamina Seedance 2.0","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.36009307,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.0-720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"dreamina seedance 2.0","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1479,"raw_unit":"Elo","ci_low":1471,"ci_high":1487,"rank_spread_min":3,"rank_spread_max":9,"sample_count":52864,"is_preliminary":false,"provider":"Bytedance","source_order":7},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Dreamina Seedance 2.0 720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1222,"raw_unit":"Elo","ci_low":1217,"ci_high":1227,"rank_spread_min":5,"rank_spread_max":5,"sample_count":24839,"is_preliminary":false,"provider":"ByteDance Seed","source_order":5}],"aggregation_source_results":["arena-14|dreamina-seedance-2.0-720p","aa-19|Dreamina Seedance 2.0 720p"],"is_preliminary":false},{"model_id":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","display_name":"dreamina seedance 2.5","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.5-720p","normalized_model_family":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1482,"raw_unit":"Elo","ci_low":1470,"ci_high":1494,"rank_spread_min":3,"rank_spread_max":9,"sample_count":4066,"is_preliminary":false,"provider":"Bytedance","source_order":6}],"aggregation_source_results":["arena-14|dreamina-seedance-2.5-720p"],"is_preliminary":false},{"model_id":"wan2-7-260612","base_model":"Wan2.7-260612","display_name":"Wan2.7-260612","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan2.7-260612","normalized_model_family":"wan2-7-260612","base_model":"Wan2.7-260612","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1157,"raw_unit":"Elo","ci_low":1151,"ci_high":1163,"rank_spread_min":6,"rank_spread_max":6,"sample_count":19563,"is_preliminary":false,"provider":"Alibaba","source_order":6}],"aggregation_source_results":["aa-19|Wan2.7-260612"],"is_preliminary":false},{"model_id":"happyhorse-1-1","base_model":"HappyHorse-1.1","display_name":"HappyHorse-1.1","official_model_id":null,"provider":"Alibaba-ATH","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"HappyHorse-1.1","normalized_model_family":"happyhorse-1-1","base_model":"HappyHorse-1.1","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1146,"raw_unit":"Elo","ci_low":1140,"ci_high":1152,"rank_spread_min":7,"rank_spread_max":7,"sample_count":19585,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":7}],"aggregation_source_results":["aa-19|HappyHorse-1.1"],"is_preliminary":false},{"model_id":"happyhorse-1-0","base_model":"happyhorse 1.0","display_name":"happyhorse 1.0","official_model_id":null,"provider":"Alibaba-ATH","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30226485,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"happyhorse-1.0","normalized_model_family":"happyhorse-1-0","base_model":"happyhorse 1.0","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1427,"raw_unit":"Elo","ci_low":1414,"ci_high":1440,"rank_spread_min":10,"rank_spread_max":10,"sample_count":22116,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":10},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"HappyHorse-1.0","normalized_model_family":"happyhorse-1-0","base_model":"HappyHorse-1.0","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1122,"raw_unit":"Elo","ci_low":1116,"ci_high":1128,"rank_spread_min":8,"rank_spread_max":8,"sample_count":9784,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":8}],"aggregation_source_results":["arena-14|happyhorse-1.0","aa-19|HappyHorse-1.0"],"is_preliminary":false},{"model_id":"muse-video","base_model":"muse video","display_name":"muse video","official_model_id":null,"provider":"Meta","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-video","normalized_model_family":"muse-video","base_model":"muse video","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1456,"raw_unit":"Elo","ci_low":1441,"ci_high":1471,"rank_spread_min":6,"rank_spread_max":9,"sample_count":2178,"is_preliminary":false,"provider":"Meta","source_order":9}],"aggregation_source_results":["arena-14|muse-video"],"is_preliminary":false},{"model_id":"magi-2-preview","base_model":"MAGI-2 Preview","display_name":"MAGI-2 Preview","official_model_id":null,"provider":"Sand.ai","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAGI-2 Preview","normalized_model_family":"magi-2-preview","base_model":"MAGI-2 Preview","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1113,"raw_unit":"Elo","ci_low":1104,"ci_high":1122,"rank_spread_min":8,"rank_spread_max":11,"sample_count":5375,"is_preliminary":false,"provider":"Sand.ai","source_order":9}],"aggregation_source_results":["aa-19|MAGI-2 Preview"],"is_preliminary":false},{"model_id":"kling-3-0","base_model":"Kling 3.0","display_name":"Kling 3.0","official_model_id":null,"provider":"KlingAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kling 3.0 1080p (Pro)","normalized_model_family":"kling-3-0","base_model":"Kling 3.0","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1108,"raw_unit":"Elo","ci_low":1103,"ci_high":1113,"rank_spread_min":10,"rank_spread_max":11,"sample_count":22505,"is_preliminary":false,"provider":"KlingAI","source_order":10},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kling 3.0 720p (Standard)","normalized_model_family":"kling-3-0","base_model":"Kling 3.0","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1100,"raw_unit":"Elo","ci_low":1095,"ci_high":1105,"rank_spread_min":12,"rank_spread_max":13,"sample_count":21629,"is_preliminary":false,"provider":"KlingAI","source_order":13}],"aggregation_source_results":["aa-19|Kling 3.0 1080p (Pro)"],"is_preliminary":false},{"model_id":"sora-2-pro","base_model":"sora 2 pro","display_name":"sora 2 pro","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"sora-2-pro","normalized_model_family":"sora-2-pro","base_model":"sora 2 pro","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1367,"raw_unit":"Elo","ci_low":1360,"ci_high":1374,"rank_spread_min":11,"rank_spread_max":15,"sample_count":50415,"is_preliminary":false,"provider":"OpenAI","source_order":11}],"aggregation_source_results":["arena-14|sora-2-pro"],"is_preliminary":false}],"candidate_count":63,"ranking":[{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.75,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1494,"raw_unit":"Elo","ci_low":1475,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":1167,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1239,"raw_unit":"Elo","ci_low":1229,"ci_high":1249,"rank_spread_min":1,"rank_spread_max":3,"sample_count":5591,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-14|wan3.0","aa-19|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.750","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","aliases":["Wan 3.0","wan3.0","Wan 3.0"]},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1511,"raw_unit":"Elo","ci_low":1501,"ci_high":1521,"rank_spread_min":1,"rank_spread_max":5,"sample_count":21934,"is_preliminary":false,"provider":"Google","source_order":2},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1238,"raw_unit":"Elo","ci_low":1232,"ci_high":1244,"rank_spread_min":1,"rank_spread_max":3,"sample_count":18134,"is_preliminary":false,"provider":"Google","source_order":2}],"aggregation_source_results":["arena-14|gemini-omni-flash","aa-19|Gemini Omni Flash"],"is_preliminary":false,"rank":2,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:gemini-omni-flash","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","aliases":["Gemini Omni Flash","gemini-omni-flash","Gemini Omni Flash"]},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.40773244,"mean_rank":5.5,"median_rank":5.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1462,"raw_unit":"Elo","ci_low":1452,"ci_high":1472,"rank_spread_min":6,"rank_spread_max":9,"sample_count":7648,"is_preliminary":false,"provider":"MiniMax","source_order":8},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1235,"raw_unit":"Elo","ci_low":1225,"ci_high":1245,"rank_spread_min":1,"rank_spread_max":4,"sample_count":5451,"is_preliminary":false,"provider":"Fal","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1227,"raw_unit":"Elo","ci_low":1220,"ci_high":1234,"rank_spread_min":4,"rank_spread_max":5,"sample_count":8993,"is_preliminary":false,"provider":"MiniMax","source_order":4}],"aggregation_source_results":["arena-14|minimax-h3","aa-19|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":3,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.408","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","aliases":["MiniMax H3","minimax-h3","Minimax H3 Max (post-trained by fal)","MiniMax H3"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.75,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1494,"raw_unit":"Elo","ci_low":1475,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":1167,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1239,"raw_unit":"Elo","ci_low":1229,"ci_high":1249,"rank_spread_min":1,"rank_spread_max":3,"sample_count":5591,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-14|wan3.0","aa-19|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.750","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","aliases":["Wan 3.0","wan3.0","Wan 3.0"]},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1511,"raw_unit":"Elo","ci_low":1501,"ci_high":1521,"rank_spread_min":1,"rank_spread_max":5,"sample_count":21934,"is_preliminary":false,"provider":"Google","source_order":2},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1238,"raw_unit":"Elo","ci_low":1232,"ci_high":1244,"rank_spread_min":1,"rank_spread_max":3,"sample_count":18134,"is_preliminary":false,"provider":"Google","source_order":2}],"aggregation_source_results":["arena-14|gemini-omni-flash","aa-19|Gemini Omni Flash"],"is_preliminary":false,"rank":2,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:gemini-omni-flash","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","aliases":["Gemini Omni Flash","gemini-omni-flash","Gemini Omni Flash"]},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.40773244,"mean_rank":5.5,"median_rank":5.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1462,"raw_unit":"Elo","ci_low":1452,"ci_high":1472,"rank_spread_min":6,"rank_spread_max":9,"sample_count":7648,"is_preliminary":false,"provider":"MiniMax","source_order":8},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1235,"raw_unit":"Elo","ci_low":1225,"ci_high":1245,"rank_spread_min":1,"rank_spread_max":4,"sample_count":5451,"is_preliminary":false,"provider":"Fal","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1227,"raw_unit":"Elo","ci_low":1220,"ci_high":1234,"rank_spread_min":4,"rank_spread_max":5,"sample_count":8993,"is_preliminary":false,"provider":"MiniMax","source_order":4}],"aggregation_source_results":["arena-14|minimax-h3","aa-19|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":3,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.408","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner.","aliases":["MiniMax H3","minimax-h3","Minimax H3 Max (post-trained by fal)","MiniMax H3"]}]}],"deepLink":"https://lll.bz/llm?task=text-to-video"},{"id":"image-to-video","title":"Image → video","name":"Image → video","description":"For animating a still image into a generated video.","category":"video","sourceName":"Arena, Artificial Analysis","sourceUrl":"https://arena.ai/leaderboard/image-to-video","sourceDate":"2026-09-02","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-15","aa-20"],"consensus":{"method":"weighted_reciprocal_rank","winner":"minimax-h3","confidence":"medium","disagreement_status":"source_split","independent_source_count":2,"source_coverage":1,"family_weights":{"Arena":1,"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1497,"raw_unit":"Elo","ci_low":1491,"ci_high":1503,"rank_spread_min":1,"rank_spread_max":3,"sample_count":36137,"is_preliminary":false,"provider":"MiniMax","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1201,"raw_unit":"Elo","ci_low":1192,"ci_high":1210,"rank_spread_min":1,"rank_spread_max":2,"sample_count":5587,"is_preliminary":false,"provider":"Fal","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1187,"raw_unit":"Elo","ci_low":1179,"ci_high":1195,"rank_spread_min":2,"rank_spread_max":4,"sample_count":7465,"is_preliminary":false,"provider":"MiniMax","source_order":3}],"aggregation_source_results":["arena-15|minimax-h3","aa-20|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":1,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable."},{"model_id":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","display_name":"Dreamina Seedance 2.0","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.50889128,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.0-720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"dreamina seedance 2.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1477,"raw_unit":"Elo","ci_low":1469,"ci_high":1485,"rank_spread_min":2,"rank_spread_max":5,"sample_count":113611,"is_preliminary":false,"provider":"Bytedance","source_order":5},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Dreamina Seedance 2.0 720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1192,"raw_unit":"Elo","ci_low":1186,"ci_high":1198,"rank_spread_min":2,"rank_spread_max":3,"sample_count":18094,"is_preliminary":false,"provider":"ByteDance Seed","source_order":2}],"aggregation_source_results":["arena-15|dreamina-seedance-2.0-720p","aa-20|Dreamina Seedance 2.0 720p"],"is_preliminary":false,"rank":2,"modelId":"dreamina-seedance-2-0","modelName":"Dreamina Seedance 2.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.509","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:dreamina-seedance-2-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable."},{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.4434264,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1481,"raw_unit":"Elo","ci_low":1465,"ci_high":1497,"rank_spread_min":1,"rank_spread_max":6,"sample_count":1401,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1176,"raw_unit":"Elo","ci_low":1168,"ci_high":1184,"rank_spread_min":4,"rank_spread_max":5,"sample_count":7791,"is_preliminary":false,"provider":"Alibaba","source_order":5}],"aggregation_source_results":["arena-15|wan3.0","aa-20|Wan 3.0"],"is_preliminary":false,"rank":3,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.443","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable."}],"pending_evaluation":[],"candidates":[{"model_id":"gemini-omni-1-1-flash","base_model":"Gemini Omni 1.1 Flash","display_name":"Gemini Omni 1.1 Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-1.1-flash","normalized_model_family":"gemini-omni-1-1-flash","base_model":"Gemini Omni 1.1 Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1488,"raw_unit":"Elo","ci_low":1477,"ci_high":1499,"rank_spread_min":1,"rank_spread_max":5,"sample_count":3732,"is_preliminary":false,"provider":"Google","source_order":2}],"aggregation_source_results":["arena-15|gemini-omni-1.1-flash"],"is_preliminary":false},{"model_id":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","display_name":"dreamina seedance 2.5","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.5-720p","normalized_model_family":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1478,"raw_unit":"Elo","ci_low":1468,"ci_high":1488,"rank_spread_min":2,"rank_spread_max":6,"sample_count":6725,"is_preliminary":false,"provider":"Bytedance","source_order":4}],"aggregation_source_results":["arena-15|dreamina-seedance-2.5-720p"],"is_preliminary":false},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.39344187,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1462,"raw_unit":"Elo","ci_low":1456,"ci_high":1468,"rank_spread_min":4,"rank_spread_max":7,"sample_count":71006,"is_preliminary":false,"provider":"Google","source_order":6},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1180,"raw_unit":"Elo","ci_low":1173,"ci_high":1187,"rank_spread_min":3,"rank_spread_max":5,"sample_count":12746,"is_preliminary":false,"provider":"Google","source_order":4}],"aggregation_source_results":["arena-15|gemini-omni-flash","aa-20|Gemini Omni Flash"],"is_preliminary":false},{"model_id":"grok-imagine-video-1-5","base_model":"grok imagine video 1.5","display_name":"grok imagine video 1.5","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.34477026,"mean_rank":6.5,"median_rank":6.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-video-1.5-720p","normalized_model_family":"grok-imagine-video-1-5","base_model":"grok imagine video 1.5","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1456,"raw_unit":"Elo","ci_low":1451,"ci_high":1461,"rank_spread_min":6,"rank_spread_max":9,"sample_count":119111,"is_preliminary":false,"provider":"SpaceXAI","source_order":7},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"grok-imagine-video-1.5","normalized_model_family":"grok-imagine-video-1-5","base_model":"grok imagine video 1.5","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1110,"raw_unit":"Elo","ci_low":1103,"ci_high":1117,"rank_spread_min":6,"rank_spread_max":7,"sample_count":6454,"is_preliminary":false,"provider":"SpaceXAI","source_order":6}],"aggregation_source_results":["arena-15|grok-imagine-video-1.5-720p","aa-20|grok-imagine-video-1.5"],"is_preliminary":false},{"model_id":"happyhorse-1-1","base_model":"HappyHorse-1.1","display_name":"HappyHorse-1.1","official_model_id":null,"provider":"Alibaba-ATH","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"HappyHorse-1.1","normalized_model_family":"happyhorse-1-1","base_model":"HappyHorse-1.1","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1105,"raw_unit":"Elo","ci_low":1099,"ci_high":1111,"rank_spread_min":6,"rank_spread_max":8,"sample_count":14130,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":7}],"aggregation_source_results":["aa-20|HappyHorse-1.1"],"is_preliminary":false},{"model_id":"flux-3-video-20260811","base_model":"flux 3 video 20260811","display_name":"flux 3 video 20260811","official_model_id":null,"provider":"Black Forest Labs","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"flux-3-video-20260811","normalized_model_family":"flux-3-video-20260811","base_model":"flux 3 video 20260811","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1449,"raw_unit":"Elo","ci_low":1443,"ci_high":1455,"rank_spread_min":7,"rank_spread_max":9,"sample_count":20601,"is_preliminary":false,"provider":"Black Forest Labs","source_order":8}],"aggregation_source_results":["arena-15|flux-3-video-20260811"],"is_preliminary":false},{"model_id":"magi-2-preview","base_model":"MAGI-2 Preview","display_name":"MAGI-2 Preview","official_model_id":null,"provider":"Sand.ai","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MAGI-2 Preview","normalized_model_family":"magi-2-preview","base_model":"MAGI-2 Preview","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1100,"raw_unit":"Elo","ci_low":1093,"ci_high":1107,"rank_spread_min":7,"rank_spread_max":8,"sample_count":12044,"is_preliminary":false,"provider":"Sand.ai","source_order":8}],"aggregation_source_results":["aa-20|MAGI-2 Preview"],"is_preliminary":false},{"model_id":"happyhorse-1-0","base_model":"happyhorse 1.0","display_name":"happyhorse 1.0","official_model_id":null,"provider":"Alibaba-ATH","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"happyhorse-1.0","normalized_model_family":"happyhorse-1-0","base_model":"happyhorse 1.0","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1442,"raw_unit":"Elo","ci_low":1432,"ci_high":1452,"rank_spread_min":7,"rank_spread_max":10,"sample_count":70682,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":9},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"HappyHorse-1.0","normalized_model_family":"happyhorse-1-0","base_model":"HappyHorse-1.0","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1087,"raw_unit":"Elo","ci_low":1080,"ci_high":1094,"rank_spread_min":9,"rank_spread_max":12,"sample_count":8925,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":9}],"aggregation_source_results":["arena-15|happyhorse-1.0","aa-20|HappyHorse-1.0"],"is_preliminary":false},{"model_id":"wan2-7-i2v","base_model":"wan2.7 i2v","display_name":"wan2.7 i2v","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan2.7-i2v","normalized_model_family":"wan2-7-i2v","base_model":"wan2.7 i2v","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1428,"raw_unit":"Elo","ci_low":1423,"ci_high":1433,"rank_spread_min":9,"rank_spread_max":10,"sample_count":72878,"is_preliminary":false,"provider":"Alibaba","source_order":10}],"aggregation_source_results":["arena-15|wan2.7-i2v"],"is_preliminary":false},{"model_id":"veo-3-1","base_model":"Veo 3.1","display_name":"Veo 3.1","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Veo 3.1","normalized_model_family":"veo-3-1","base_model":"Veo 3.1","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1087,"raw_unit":"Elo","ci_low":1080,"ci_high":1094,"rank_spread_min":9,"rank_spread_max":12,"sample_count":8938,"is_preliminary":false,"provider":"Google","source_order":10}],"aggregation_source_results":["aa-20|Veo 3.1"],"is_preliminary":false},{"model_id":"skyreels-v4","base_model":"SkyReels V4","display_name":"SkyReels V4","official_model_id":null,"provider":"Skywork AI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"SkyReels V4","normalized_model_family":"skyreels-v4","base_model":"SkyReels V4","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1086,"raw_unit":"Elo","ci_low":1079,"ci_high":1093,"rank_spread_min":9,"rank_spread_max":12,"sample_count":5974,"is_preliminary":false,"provider":"Skywork AI","source_order":11}],"aggregation_source_results":["aa-20|SkyReels V4"],"is_preliminary":false},{"model_id":"grok-imagine-video","base_model":"grok imagine video","display_name":"grok imagine video","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27079624,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-video-720p","normalized_model_family":"grok-imagine-video","base_model":"grok imagine video","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1415,"raw_unit":"Elo","ci_low":1411,"ci_high":1419,"rank_spread_min":11,"rank_spread_max":11,"sample_count":536070,"is_preliminary":false,"provider":"SpaceXAI","source_order":11},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"grok-imagine-video","normalized_model_family":"grok-imagine-video","base_model":"grok imagine video","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1077,"raw_unit":"Elo","ci_low":1071,"ci_high":1083,"rank_spread_min":12,"rank_spread_max":15,"sample_count":17847,"is_preliminary":false,"provider":"SpaceXAI","source_order":13}],"aggregation_source_results":["arena-15|grok-imagine-video-720p","aa-20|grok-imagine-video"],"is_preliminary":false}],"candidate_count":61,"ranking":[{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1497,"raw_unit":"Elo","ci_low":1491,"ci_high":1503,"rank_spread_min":1,"rank_spread_max":3,"sample_count":36137,"is_preliminary":false,"provider":"MiniMax","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1201,"raw_unit":"Elo","ci_low":1192,"ci_high":1210,"rank_spread_min":1,"rank_spread_max":2,"sample_count":5587,"is_preliminary":false,"provider":"Fal","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1187,"raw_unit":"Elo","ci_low":1179,"ci_high":1195,"rank_spread_min":2,"rank_spread_max":4,"sample_count":7465,"is_preliminary":false,"provider":"MiniMax","source_order":3}],"aggregation_source_results":["arena-15|minimax-h3","aa-20|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":1,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","aliases":["MiniMax H3","minimax-h3","Minimax H3 Max (post-trained by fal)","MiniMax H3"]},{"model_id":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","display_name":"Dreamina Seedance 2.0","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.50889128,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.0-720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"dreamina seedance 2.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1477,"raw_unit":"Elo","ci_low":1469,"ci_high":1485,"rank_spread_min":2,"rank_spread_max":5,"sample_count":113611,"is_preliminary":false,"provider":"Bytedance","source_order":5},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Dreamina Seedance 2.0 720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1192,"raw_unit":"Elo","ci_low":1186,"ci_high":1198,"rank_spread_min":2,"rank_spread_max":3,"sample_count":18094,"is_preliminary":false,"provider":"ByteDance Seed","source_order":2}],"aggregation_source_results":["arena-15|dreamina-seedance-2.0-720p","aa-20|Dreamina Seedance 2.0 720p"],"is_preliminary":false,"rank":2,"modelId":"dreamina-seedance-2-0","modelName":"Dreamina Seedance 2.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.509","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:dreamina-seedance-2-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","aliases":["Dreamina Seedance 2.0","dreamina-seedance-2.0-720p","Dreamina Seedance 2.0 720p"]},{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.4434264,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1481,"raw_unit":"Elo","ci_low":1465,"ci_high":1497,"rank_spread_min":1,"rank_spread_max":6,"sample_count":1401,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1176,"raw_unit":"Elo","ci_low":1168,"ci_high":1184,"rank_spread_min":4,"rank_spread_max":5,"sample_count":7791,"is_preliminary":false,"provider":"Alibaba","source_order":5}],"aggregation_source_results":["arena-15|wan3.0","aa-20|Wan 3.0"],"is_preliminary":false,"rank":3,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.443","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","aliases":["Wan 3.0","wan3.0","Wan 3.0"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1497,"raw_unit":"Elo","ci_low":1491,"ci_high":1503,"rank_spread_min":1,"rank_spread_max":3,"sample_count":36137,"is_preliminary":false,"provider":"MiniMax","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1201,"raw_unit":"Elo","ci_low":1192,"ci_high":1210,"rank_spread_min":1,"rank_spread_max":2,"sample_count":5587,"is_preliminary":false,"provider":"Fal","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1187,"raw_unit":"Elo","ci_low":1179,"ci_high":1195,"rank_spread_min":2,"rank_spread_max":4,"sample_count":7465,"is_preliminary":false,"provider":"MiniMax","source_order":3}],"aggregation_source_results":["arena-15|minimax-h3","aa-20|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":1,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","aliases":["MiniMax H3","minimax-h3","Minimax H3 Max (post-trained by fal)","MiniMax H3"]},{"model_id":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","display_name":"Dreamina Seedance 2.0","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.50889128,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.0-720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"dreamina seedance 2.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1477,"raw_unit":"Elo","ci_low":1469,"ci_high":1485,"rank_spread_min":2,"rank_spread_max":5,"sample_count":113611,"is_preliminary":false,"provider":"Bytedance","source_order":5},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Dreamina Seedance 2.0 720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1192,"raw_unit":"Elo","ci_low":1186,"ci_high":1198,"rank_spread_min":2,"rank_spread_max":3,"sample_count":18094,"is_preliminary":false,"provider":"ByteDance Seed","source_order":2}],"aggregation_source_results":["arena-15|dreamina-seedance-2.0-720p","aa-20|Dreamina Seedance 2.0 720p"],"is_preliminary":false,"rank":2,"modelId":"dreamina-seedance-2-0","modelName":"Dreamina Seedance 2.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.509","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:dreamina-seedance-2-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","aliases":["Dreamina Seedance 2.0","dreamina-seedance-2.0-720p","Dreamina Seedance 2.0 720p"]},{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.4434264,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1481,"raw_unit":"Elo","ci_low":1465,"ci_high":1497,"rank_spread_min":1,"rank_spread_max":6,"sample_count":1401,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1176,"raw_unit":"Elo","ci_low":1168,"ci_high":1184,"rank_spread_min":4,"rank_spread_max":5,"sample_count":7791,"is_preliminary":false,"provider":"Alibaba","source_order":5}],"aggregation_source_results":["arena-15|wan3.0","aa-20|Wan 3.0"],"is_preliminary":false,"rank":3,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.443","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 4.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable.","aliases":["Wan 3.0","wan3.0","Wan 3.0"]}]}],"deepLink":"https://lll.bz/llm?task=image-to-video"},{"id":"video-editing","title":"Video editing","name":"Video editing","description":"For instruction-driven edits and transformations of existing video.","category":"video","sourceName":"Arena, Artificial Analysis","sourceUrl":"https://arena.ai/leaderboard/video-edit","sourceDate":"2026-08-26","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-16","aa-21"],"consensus":{"method":"weighted_reciprocal_rank","winner":"wan-3-0","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":2,"source_coverage":1,"family_weights":{"Arena":1,"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1414,"raw_unit":"Elo","ci_low":1388,"ci_high":1440,"rank_spread_min":1,"rank_spread_max":3,"sample_count":463,"is_preliminary":false,"provider":"Alibaba","source_order":1},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1190,"raw_unit":"Elo","ci_low":1183,"ci_high":1197,"rank_spread_min":1,"rank_spread_max":1,"sample_count":5315,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-16|wan3.0","aa-21|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena."},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.56546488,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1392,"raw_unit":"Elo","ci_low":1373,"ci_high":1411,"rank_spread_min":1,"rank_spread_max":5,"sample_count":962,"is_preliminary":false,"provider":"MiniMax","source_order":3},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1129,"raw_unit":"Elo","ci_low":1124,"ci_high":1134,"rank_spread_min":2,"rank_spread_max":3,"sample_count":13014,"is_preliminary":false,"provider":"MiniMax","source_order":2}],"aggregation_source_results":["arena-16|minimax-h3","aa-21|MiniMax H3"],"is_preliminary":false,"rank":2,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.565","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena."},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1367,"raw_unit":"Elo","ci_low":1352,"ci_high":1382,"rank_spread_min":3,"rank_spread_max":5,"sample_count":2109,"is_preliminary":false,"provider":"Google","source_order":4},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1125,"raw_unit":"Elo","ci_low":1120,"ci_high":1130,"rank_spread_min":2,"rank_spread_max":3,"sample_count":15995,"is_preliminary":false,"provider":"Google","source_order":3}],"aggregation_source_results":["arena-16|gemini-omni-flash","aa-21|Gemini Omni Flash"],"is_preliminary":false,"rank":3,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:gemini-omni-flash","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena."}],"pending_evaluation":[],"candidates":[{"model_id":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","display_name":"dreamina seedance 2.5","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.5-720p","normalized_model_family":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1410,"raw_unit":"Elo","ci_low":1384,"ci_high":1436,"rank_spread_min":1,"rank_spread_max":3,"sample_count":429,"is_preliminary":false,"provider":"Bytedance","source_order":2}],"aggregation_source_results":["arena-16|dreamina-seedance-2.5-720p"],"is_preliminary":false},{"model_id":"happyhorse-1-0","base_model":"happyhorse 1.0","display_name":"happyhorse 1.0","official_model_id":null,"provider":"Alibaba-ATH","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.39344187,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"happyhorse-1.0","normalized_model_family":"happyhorse-1-0","base_model":"happyhorse 1.0","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1307,"raw_unit":"Elo","ci_low":1293,"ci_high":1321,"rank_spread_min":6,"rank_spread_max":6,"sample_count":3116,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":6},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"HappyHorse-1.0","normalized_model_family":"happyhorse-1-0","base_model":"HappyHorse-1.0","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1088,"raw_unit":"Elo","ci_low":1083,"ci_high":1093,"rank_spread_min":4,"rank_spread_max":4,"sample_count":23561,"is_preliminary":false,"provider":"Alibaba-ATH","source_order":4}],"aggregation_source_results":["arena-16|happyhorse-1.0","aa-21|HappyHorse-1.0"],"is_preliminary":false},{"model_id":"wan-2-7","base_model":"Wan 2.7","display_name":"Wan 2.7","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 2.7","normalized_model_family":"wan-2-7","base_model":"Wan 2.7","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1077,"raw_unit":"Elo","ci_low":1072,"ci_high":1082,"rank_spread_min":5,"rank_spread_max":5,"sample_count":19302,"is_preliminary":false,"provider":"Alibaba","source_order":5}],"aggregation_source_results":["aa-21|Wan 2.7"],"is_preliminary":false},{"model_id":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","display_name":"Dreamina Seedance 2.0","official_model_id":null,"provider":"Bytedance","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.37153,"mean_rank":5.5,"median_rank":5.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"dreamina-seedance-2.0-720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"dreamina seedance 2.0","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1365,"raw_unit":"Elo","ci_low":1351,"ci_high":1379,"rank_spread_min":3,"rank_spread_max":5,"sample_count":3852,"is_preliminary":false,"provider":"Bytedance","source_order":5},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Dreamina Seedance 2.0 720p","normalized_model_family":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1040,"raw_unit":"Elo","ci_low":1035,"ci_high":1045,"rank_spread_min":6,"rank_spread_max":6,"sample_count":23388,"is_preliminary":false,"provider":"ByteDance Seed","source_order":6}],"aggregation_source_results":["arena-16|dreamina-seedance-2.0-720p","aa-21|Dreamina Seedance 2.0 720p"],"is_preliminary":false},{"model_id":"grok-imagine-video","base_model":"grok imagine video","display_name":"grok imagine video","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-imagine-video","normalized_model_family":"grok-imagine-video","base_model":"grok imagine video","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1258,"raw_unit":"Elo","ci_low":1248,"ci_high":1268,"rank_spread_min":7,"rank_spread_max":8,"sample_count":13724,"is_preliminary":false,"provider":"SpaceXAI","source_order":7}],"aggregation_source_results":["arena-16|grok-imagine-video"],"is_preliminary":false},{"model_id":"aleph-2-0","base_model":"Aleph 2.0","display_name":"Aleph 2.0","official_model_id":null,"provider":"Runway","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Aleph 2.0","normalized_model_family":"aleph-2-0","base_model":"Aleph 2.0","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1013,"raw_unit":"Elo","ci_low":1008,"ci_high":1018,"rank_spread_min":7,"rank_spread_max":7,"sample_count":20847,"is_preliminary":false,"provider":"Runway","source_order":7}],"aggregation_source_results":["aa-21|Aleph 2.0"],"is_preliminary":false},{"model_id":"kling-o3-pro","base_model":"kling o3 pro","display_name":"kling o3 pro","official_model_id":null,"provider":"KlingAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kling-o3-pro","normalized_model_family":"kling-o3-pro","base_model":"kling o3 pro","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1255,"raw_unit":"Elo","ci_low":1244,"ci_high":1266,"rank_spread_min":7,"rank_spread_max":8,"sample_count":7540,"is_preliminary":false,"provider":"KlingAI","source_order":8}],"aggregation_source_results":["arena-16|kling-o3-pro"],"is_preliminary":false},{"model_id":"kling-3-0-omni","base_model":"Kling 3.0 Omni","display_name":"Kling 3.0 Omni","official_model_id":null,"provider":"KlingAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kling 3.0 Omni 1080p (Pro)","normalized_model_family":"kling-3-0-omni","base_model":"Kling 3.0 Omni","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1000,"raw_unit":"Elo","ci_low":1000,"ci_high":1000,"rank_spread_min":8,"rank_spread_max":8,"sample_count":18993,"is_preliminary":false,"provider":"KlingAI","source_order":8}],"aggregation_source_results":["aa-21|Kling 3.0 Omni 1080p (Pro)"],"is_preliminary":false},{"model_id":"kling-o1-pro","base_model":"kling o1 pro","display_name":"kling o1 pro","official_model_id":null,"provider":"KlingAI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kling-o1-pro","normalized_model_family":"kling-o1-pro","base_model":"kling o1 pro","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1197,"raw_unit":"Elo","ci_low":1187,"ci_high":1207,"rank_spread_min":9,"rank_spread_max":10,"sample_count":10542,"is_preliminary":false,"provider":"KlingAI","source_order":9}],"aggregation_source_results":["arena-16|kling-o1-pro"],"is_preliminary":false},{"model_id":"skyreels-v4","base_model":"SkyReels V4","display_name":"SkyReels V4","official_model_id":null,"provider":"Skywork AI","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"SkyReels V4","normalized_model_family":"skyreels-v4","base_model":"SkyReels V4","variant":null,"reasoning_effort":null,"rank":9,"raw_score":950,"raw_unit":"Elo","ci_low":944,"ci_high":956,"rank_spread_min":9,"rank_spread_max":9,"sample_count":15849,"is_preliminary":false,"provider":"Skywork AI","source_order":9}],"aggregation_source_results":["aa-21|SkyReels V4"],"is_preliminary":false},{"model_id":"runway-gen4-aleph","base_model":"runway gen4 aleph","display_name":"runway gen4 aleph","official_model_id":null,"provider":"Runway","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":0.5,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"runway-gen4-aleph","normalized_model_family":"runway-gen4-aleph","base_model":"runway gen4 aleph","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1182,"raw_unit":"Elo","ci_low":1173,"ci_high":1191,"rank_spread_min":9,"rank_spread_max":10,"sample_count":9818,"is_preliminary":false,"provider":"Runway","source_order":10}],"aggregation_source_results":["arena-16|runway-gen4-aleph"],"is_preliminary":false}],"candidate_count":11,"ranking":[{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1414,"raw_unit":"Elo","ci_low":1388,"ci_high":1440,"rank_spread_min":1,"rank_spread_max":3,"sample_count":463,"is_preliminary":false,"provider":"Alibaba","source_order":1},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1190,"raw_unit":"Elo","ci_low":1183,"ci_high":1197,"rank_spread_min":1,"rank_spread_max":1,"sample_count":5315,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-16|wan3.0","aa-21|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","aliases":["Wan 3.0","wan3.0","Wan 3.0"]},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.56546488,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1392,"raw_unit":"Elo","ci_low":1373,"ci_high":1411,"rank_spread_min":1,"rank_spread_max":5,"sample_count":962,"is_preliminary":false,"provider":"MiniMax","source_order":3},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1129,"raw_unit":"Elo","ci_low":1124,"ci_high":1134,"rank_spread_min":2,"rank_spread_max":3,"sample_count":13014,"is_preliminary":false,"provider":"MiniMax","source_order":2}],"aggregation_source_results":["arena-16|minimax-h3","aa-21|MiniMax H3"],"is_preliminary":false,"rank":2,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.565","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","aliases":["MiniMax H3","minimax-h3","MiniMax H3"]},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1367,"raw_unit":"Elo","ci_low":1352,"ci_high":1382,"rank_spread_min":3,"rank_spread_max":5,"sample_count":2109,"is_preliminary":false,"provider":"Google","source_order":4},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1125,"raw_unit":"Elo","ci_low":1120,"ci_high":1130,"rank_spread_min":2,"rank_spread_max":3,"sample_count":15995,"is_preliminary":false,"provider":"Google","source_order":3}],"aggregation_source_results":["arena-16|gemini-omni-flash","aa-21|Gemini Omni Flash"],"is_preliminary":false,"rank":3,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:gemini-omni-flash","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","aliases":["Gemini Omni Flash","gemini-omni-flash","Gemini Omni Flash"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1414,"raw_unit":"Elo","ci_low":1388,"ci_high":1440,"rank_spread_min":1,"rank_spread_max":3,"sample_count":463,"is_preliminary":false,"provider":"Alibaba","source_order":1},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1190,"raw_unit":"Elo","ci_low":1183,"ci_high":1197,"rank_spread_min":1,"rank_spread_max":1,"sample_count":5315,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-16|wan3.0","aa-21|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","aliases":["Wan 3.0","wan3.0","Wan 3.0"]},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.56546488,"mean_rank":2.5,"median_rank":2.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1392,"raw_unit":"Elo","ci_low":1373,"ci_high":1411,"rank_spread_min":1,"rank_spread_max":5,"sample_count":962,"is_preliminary":false,"provider":"MiniMax","source_order":3},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1129,"raw_unit":"Elo","ci_low":1124,"ci_high":1134,"rank_spread_min":2,"rank_spread_max":3,"sample_count":13014,"is_preliminary":false,"provider":"MiniMax","source_order":2}],"aggregation_source_results":["arena-16|minimax-h3","aa-21|MiniMax H3"],"is_preliminary":false,"rank":2,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.565","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","aliases":["MiniMax H3","minimax-h3","MiniMax H3"]},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gemini-omni-flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1367,"raw_unit":"Elo","ci_low":1352,"ci_high":1382,"rank_spread_min":3,"rank_spread_max":5,"sample_count":2109,"is_preliminary":false,"provider":"Google","source_order":4},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini Omni Flash","normalized_model_family":"gemini-omni-flash","base_model":"Gemini Omni Flash","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1125,"raw_unit":"Elo","ci_low":1120,"ci_high":1130,"rank_spread_min":2,"rank_spread_max":3,"sample_count":15995,"is_preliminary":false,"provider":"Google","source_order":3}],"aggregation_source_results":["arena-16|gemini-omni-flash","aa-21|Gemini Omni Flash"],"is_preliminary":false,"rank":3,"modelId":"gemini-omni-flash","modelName":"Gemini Omni Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:gemini-omni-flash","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena.","aliases":["Gemini Omni Flash","gemini-omni-flash","Gemini Omni Flash"]}]}],"deepLink":"https://lll.bz/llm?task=video-editing"},{"id":"speech-to-text","title":"Speech to text","name":"Speech to text","description":"For transcribing spoken audio into text.","category":"audio","sourceName":"Artificial Analysis","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"lower_is_better","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["stt"],"consensus":{"method":"weighted_reciprocal_rank","winner":"fun-realtime-asr-preview","confidence":"medium","disagreement_status":"clear_winner","independent_source_count":1,"source_coverage":1,"family_weights":{"Artificial Analysis":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","display_name":"Fun-Realtime-ASR-preview","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"Fun-Realtime-ASR-preview","normalized_model_family":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1.7,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["stt|Fun-Realtime-ASR-preview"],"is_preliminary":false,"rank":1,"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:fun-realtime-asr-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"mai-transcribe-2","base_model":"MAI-Transcribe-2","display_name":"MAI-Transcribe-2","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"MAI-Transcribe-2","normalized_model_family":"mai-transcribe-2","base_model":"MAI-Transcribe-2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":2,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Microsoft AI","source_order":2}],"aggregation_source_results":["stt|MAI-Transcribe-2"],"is_preliminary":false,"rank":2,"modelId":"mai-transcribe-2","modelName":"MAI-Transcribe-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:mai-transcribe-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","display_name":"ElevenLabs Scribe v2","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"ElevenLabs Scribe v2","normalized_model_family":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","variant":null,"reasoning_effort":null,"rank":3,"raw_score":2.2,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"ElevenLabs","source_order":3}],"aggregation_source_results":["stt|ElevenLabs Scribe v2"],"is_preliminary":false,"rank":3,"modelId":"elevenlabs-scribe-v2","modelName":"ElevenLabs Scribe v2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:elevenlabs-scribe-v2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[],"candidate_count":0,"ranking":[{"model_id":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","display_name":"Fun-Realtime-ASR-preview","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"Fun-Realtime-ASR-preview","normalized_model_family":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1.7,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["stt|Fun-Realtime-ASR-preview"],"is_preliminary":false,"rank":1,"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:fun-realtime-asr-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Fun-Realtime-ASR-preview","Fun-Realtime-ASR-preview"]},{"model_id":"mai-transcribe-2","base_model":"MAI-Transcribe-2","display_name":"MAI-Transcribe-2","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"MAI-Transcribe-2","normalized_model_family":"mai-transcribe-2","base_model":"MAI-Transcribe-2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":2,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Microsoft AI","source_order":2}],"aggregation_source_results":["stt|MAI-Transcribe-2"],"is_preliminary":false,"rank":2,"modelId":"mai-transcribe-2","modelName":"MAI-Transcribe-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:mai-transcribe-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["MAI-Transcribe-2","MAI-Transcribe-2"]},{"model_id":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","display_name":"ElevenLabs Scribe v2","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"ElevenLabs Scribe v2","normalized_model_family":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","variant":null,"reasoning_effort":null,"rank":3,"raw_score":2.2,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"ElevenLabs","source_order":3}],"aggregation_source_results":["stt|ElevenLabs Scribe v2"],"is_preliminary":false,"rank":3,"modelId":"elevenlabs-scribe-v2","modelName":"ElevenLabs Scribe v2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:elevenlabs-scribe-v2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["ElevenLabs Scribe v2","ElevenLabs Scribe v2"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","display_name":"Fun-Realtime-ASR-preview","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"Fun-Realtime-ASR-preview","normalized_model_family":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1.7,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["stt|Fun-Realtime-ASR-preview"],"is_preliminary":false,"rank":1,"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:fun-realtime-asr-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Fun-Realtime-ASR-preview","Fun-Realtime-ASR-preview"]},{"model_id":"mai-transcribe-2","base_model":"MAI-Transcribe-2","display_name":"MAI-Transcribe-2","official_model_id":null,"provider":"Microsoft AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"MAI-Transcribe-2","normalized_model_family":"mai-transcribe-2","base_model":"MAI-Transcribe-2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":2,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Microsoft AI","source_order":2}],"aggregation_source_results":["stt|MAI-Transcribe-2"],"is_preliminary":false,"rank":2,"modelId":"mai-transcribe-2","modelName":"MAI-Transcribe-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:mai-transcribe-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["MAI-Transcribe-2","MAI-Transcribe-2"]},{"model_id":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","display_name":"ElevenLabs Scribe v2","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"ElevenLabs Scribe v2","normalized_model_family":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","variant":null,"reasoning_effort":null,"rank":3,"raw_score":2.2,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"ElevenLabs","source_order":3}],"aggregation_source_results":["stt|ElevenLabs Scribe v2"],"is_preliminary":false,"rank":3,"modelId":"elevenlabs-scribe-v2","modelName":"ElevenLabs Scribe v2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:elevenlabs-scribe-v2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["ElevenLabs Scribe v2","ElevenLabs Scribe v2"]}]}],"deepLink":"https://lll.bz/llm?task=speech-to-text"},{"id":"text-to-speech","title":"Text to speech","name":"Text to speech","description":"For generating natural spoken audio from text.","category":"audio","sourceName":"Artificial Analysis","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["aa-22"],"consensus":{"method":"weighted_reciprocal_rank","winner":"sonic-3-6","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1282,"raw_unit":"Elo","ci_low":1265,"ci_high":1299,"rank_spread_min":1,"rank_spread_max":1,"sample_count":1790,"is_preliminary":false,"provider":"Cartesia","source_order":1}],"aggregation_source_results":["aa-22|Sonic 3.6"],"is_preliminary":false,"rank":1,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1252,"raw_unit":"Elo","ci_low":1234,"ci_high":1270,"rank_spread_min":2,"rank_spread_max":4,"sample_count":1094,"is_preliminary":false,"provider":"Inworld","source_order":2}],"aggregation_source_results":["aa-22|Realtime TTS-2"],"is_preliminary":false,"rank":2,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","display_name":"Qwen-Audio-3.0-TTS-Plus","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen-Audio-3.0-TTS-Plus","normalized_model_family":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1241,"raw_unit":"Elo","ci_low":1227,"ci_high":1255,"rank_spread_min":2,"rank_spread_max":5,"sample_count":2398,"is_preliminary":false,"provider":"Alibaba","source_order":3}],"aggregation_source_results":["aa-22|Qwen-Audio-3.0-TTS-Plus"],"is_preliminary":false,"rank":3,"modelId":"qwen-audio-3-0-tts-plus","modelName":"Qwen-Audio-3.0-TTS-Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:qwen-audio-3-0-tts-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"simba-3-2","base_model":"Simba 3.2","display_name":"Simba 3.2","official_model_id":null,"provider":"SpeechifyAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Simba 3.2","normalized_model_family":"simba-3-2","base_model":"Simba 3.2","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1240,"raw_unit":"Elo","ci_low":1226,"ci_high":1254,"rank_spread_min":2,"rank_spread_max":5,"sample_count":2383,"is_preliminary":false,"provider":"SpeechifyAI","source_order":4}],"aggregation_source_results":["aa-22|Simba 3.2"],"is_preliminary":false},{"model_id":"luna-tts","base_model":"Luna TTS","display_name":"Luna TTS","official_model_id":null,"provider":"VUI Labs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Luna TTS","normalized_model_family":"luna-tts","base_model":"Luna TTS","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1228,"raw_unit":"Elo","ci_low":1214,"ci_high":1242,"rank_spread_min":3,"rank_spread_max":7,"sample_count":2476,"is_preliminary":false,"provider":"VUI Labs","source_order":5}],"aggregation_source_results":["aa-22|Luna TTS"],"is_preliminary":false},{"model_id":"realtime-tts-2-flash-research-preview","base_model":"Realtime TTS-2 Flash - Research Preview","display_name":"Realtime TTS-2 Flash - Research Preview","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2 Flash - Research Preview","normalized_model_family":"realtime-tts-2-flash-research-preview","base_model":"Realtime TTS-2 Flash - Research Preview","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1222,"raw_unit":"Elo","ci_low":1207,"ci_high":1237,"rank_spread_min":5,"rank_spread_max":9,"sample_count":1661,"is_preliminary":false,"provider":"Inworld","source_order":6}],"aggregation_source_results":["aa-22|Realtime TTS-2 Flash - Research Preview"],"is_preliminary":false},{"model_id":"breeze-tts-2","base_model":"Breeze TTS 2","display_name":"Breeze TTS 2","official_model_id":null,"provider":"BreezeBlue","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Breeze TTS 2","normalized_model_family":"breeze-tts-2","base_model":"Breeze TTS 2","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1215,"raw_unit":"Elo","ci_low":1198,"ci_high":1232,"rank_spread_min":5,"rank_spread_max":10,"sample_count":1218,"is_preliminary":false,"provider":"BreezeBlue","source_order":7}],"aggregation_source_results":["aa-22|Breeze TTS 2"],"is_preliminary":false},{"model_id":"v3-conversational","base_model":"v3 Conversational","display_name":"v3 Conversational","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"v3 Conversational","normalized_model_family":"v3-conversational","base_model":"v3 Conversational","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1210,"raw_unit":"Elo","ci_low":1195,"ci_high":1225,"rank_spread_min":6,"rank_spread_max":10,"sample_count":1768,"is_preliminary":false,"provider":"ElevenLabs","source_order":8}],"aggregation_source_results":["aa-22|v3 Conversational"],"is_preliminary":false},{"model_id":"gemini-3-1-flash-tts","base_model":"Gemini 3.1 Flash TTS","display_name":"Gemini 3.1 Flash TTS","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash TTS","normalized_model_family":"gemini-3-1-flash-tts","base_model":"Gemini 3.1 Flash TTS","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1208,"raw_unit":"Elo","ci_low":1196,"ci_high":1220,"rank_spread_min":7,"rank_spread_max":10,"sample_count":3586,"is_preliminary":false,"provider":"Google","source_order":9}],"aggregation_source_results":["aa-22|Gemini 3.1 Flash TTS"],"is_preliminary":false},{"model_id":"stepaudio-2-5-tts","base_model":"StepAudio 2.5 TTS","display_name":"StepAudio 2.5 TTS","official_model_id":null,"provider":"StepFun","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"StepAudio 2.5 TTS (Aug 2026)","normalized_model_family":"stepaudio-2-5-tts","base_model":"StepAudio 2.5 TTS","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1205,"raw_unit":"Elo","ci_low":1188,"ci_high":1222,"rank_spread_min":6,"rank_spread_max":12,"sample_count":1092,"is_preliminary":false,"provider":"StepFun","source_order":10}],"aggregation_source_results":["aa-22|StepAudio 2.5 TTS (Aug 2026)"],"is_preliminary":false},{"model_id":"sonic-3-5","base_model":"Sonic 3.5","display_name":"Sonic 3.5","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.5","normalized_model_family":"sonic-3-5","base_model":"Sonic 3.5","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1193,"raw_unit":"Elo","ci_low":1181,"ci_high":1205,"rank_spread_min":11,"rank_spread_max":12,"sample_count":3134,"is_preliminary":false,"provider":"Cartesia","source_order":11}],"aggregation_source_results":["aa-22|Sonic 3.5"],"is_preliminary":false},{"model_id":"lightning-v3-1-pro","base_model":"Lightning V3.1 Pro","display_name":"Lightning V3.1 Pro","official_model_id":null,"provider":"Smallest.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Lightning V3.1 Pro (Jul 2026)","normalized_model_family":"lightning-v3-1-pro","base_model":"Lightning V3.1 Pro","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1190,"raw_unit":"Elo","ci_low":1176,"ci_high":1204,"rank_spread_min":11,"rank_spread_max":13,"sample_count":1918,"is_preliminary":false,"provider":"Smallest.ai","source_order":12}],"aggregation_source_results":["aa-22|Lightning V3.1 Pro (Jul 2026)"],"is_preliminary":false},{"model_id":"soniox-tts-real-time-v2","base_model":"Soniox TTS Real-Time v2","display_name":"Soniox TTS Real-Time v2","official_model_id":null,"provider":"Soniox","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Soniox TTS Real-Time v2","normalized_model_family":"soniox-tts-real-time-v2","base_model":"Soniox TTS Real-Time v2","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1179,"raw_unit":"Elo","ci_low":1168,"ci_high":1190,"rank_spread_min":12,"rank_spread_max":15,"sample_count":5313,"is_preliminary":false,"provider":"Soniox","source_order":13}],"aggregation_source_results":["aa-22|Soniox TTS Real-Time v2"],"is_preliminary":false},{"model_id":"eleven-v3","base_model":"Eleven v3","display_name":"Eleven v3","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Eleven v3","normalized_model_family":"eleven-v3","base_model":"Eleven v3","variant":null,"reasoning_effort":null,"rank":14,"raw_score":1175,"raw_unit":"Elo","ci_low":1164,"ci_high":1186,"rank_spread_min":13,"rank_spread_max":15,"sample_count":4526,"is_preliminary":false,"provider":"ElevenLabs","source_order":14}],"aggregation_source_results":["aa-22|Eleven v3"],"is_preliminary":false},{"model_id":"speech-2-8-hd","base_model":"Speech 2.8 HD","display_name":"Speech 2.8 HD","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Speech 2.8 HD","normalized_model_family":"speech-2-8-hd","base_model":"Speech 2.8 HD","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1171,"raw_unit":"Elo","ci_low":1160,"ci_high":1182,"rank_spread_min":13,"rank_spread_max":15,"sample_count":4623,"is_preliminary":false,"provider":"MiniMax","source_order":15}],"aggregation_source_results":["aa-22|Speech 2.8 HD"],"is_preliminary":false}],"candidate_count":93,"ranking":[{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1282,"raw_unit":"Elo","ci_low":1265,"ci_high":1299,"rank_spread_min":1,"rank_spread_max":1,"sample_count":1790,"is_preliminary":false,"provider":"Cartesia","source_order":1}],"aggregation_source_results":["aa-22|Sonic 3.6"],"is_preliminary":false,"rank":1,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Sonic 3.6","Sonic 3.6"]},{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1252,"raw_unit":"Elo","ci_low":1234,"ci_high":1270,"rank_spread_min":2,"rank_spread_max":4,"sample_count":1094,"is_preliminary":false,"provider":"Inworld","source_order":2}],"aggregation_source_results":["aa-22|Realtime TTS-2"],"is_preliminary":false,"rank":2,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Realtime TTS-2","Realtime TTS-2"]},{"model_id":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","display_name":"Qwen-Audio-3.0-TTS-Plus","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen-Audio-3.0-TTS-Plus","normalized_model_family":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1241,"raw_unit":"Elo","ci_low":1227,"ci_high":1255,"rank_spread_min":2,"rank_spread_max":5,"sample_count":2398,"is_preliminary":false,"provider":"Alibaba","source_order":3}],"aggregation_source_results":["aa-22|Qwen-Audio-3.0-TTS-Plus"],"is_preliminary":false,"rank":3,"modelId":"qwen-audio-3-0-tts-plus","modelName":"Qwen-Audio-3.0-TTS-Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:qwen-audio-3-0-tts-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen-Audio-3.0-TTS-Plus","Qwen-Audio-3.0-TTS-Plus"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1282,"raw_unit":"Elo","ci_low":1265,"ci_high":1299,"rank_spread_min":1,"rank_spread_max":1,"sample_count":1790,"is_preliminary":false,"provider":"Cartesia","source_order":1}],"aggregation_source_results":["aa-22|Sonic 3.6"],"is_preliminary":false,"rank":1,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Sonic 3.6","Sonic 3.6"]},{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1252,"raw_unit":"Elo","ci_low":1234,"ci_high":1270,"rank_spread_min":2,"rank_spread_max":4,"sample_count":1094,"is_preliminary":false,"provider":"Inworld","source_order":2}],"aggregation_source_results":["aa-22|Realtime TTS-2"],"is_preliminary":false,"rank":2,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Realtime TTS-2","Realtime TTS-2"]},{"model_id":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","display_name":"Qwen-Audio-3.0-TTS-Plus","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen-Audio-3.0-TTS-Plus","normalized_model_family":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1241,"raw_unit":"Elo","ci_low":1227,"ci_high":1255,"rank_spread_min":2,"rank_spread_max":5,"sample_count":2398,"is_preliminary":false,"provider":"Alibaba","source_order":3}],"aggregation_source_results":["aa-22|Qwen-Audio-3.0-TTS-Plus"],"is_preliminary":false,"rank":3,"modelId":"qwen-audio-3-0-tts-plus","modelName":"Qwen-Audio-3.0-TTS-Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:qwen-audio-3-0-tts-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen-Audio-3.0-TTS-Plus","Qwen-Audio-3.0-TTS-Plus"]}]}],"deepLink":"https://lll.bz/llm?task=text-to-speech"},{"id":"realtime-voice","title":"Voice agents","name":"Voice agents","description":"For voice agents completing customer-service tasks through spoken interaction.","category":"audio","sourceName":"Artificial Analysis","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["voice-5"],"consensus":{"method":"weighted_reciprocal_rank","winner":"grok-voice-think-fast-2-0","confidence":"medium","disagreement_status":"clear_winner","independent_source_count":1,"source_coverage":1,"family_weights":{"Artificial Analysis":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","display_name":"Grok Voice Think Fast 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 2.0 High","normalized_model_family":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","variant":"High","reasoning_effort":"high","rank":1,"raw_score":56.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"79.0%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.1%","Agentic Performance %":"56.5%","Arena Preference Elo":"908","Task Success Rate %":"94.7%","Time to First Audio Seconds":"0.70"},"source_order":19}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 2.0 High"],"is_preliminary":false,"rank":1,"modelId":"grok-voice-think-fast-2-0","modelName":"Grok Voice Think Fast 2.0","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-2-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":2,"raw_score":54.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-5|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":2,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","display_name":"Grok Voice Think Fast 1.0","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 1.0","normalized_model_family":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":52.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"72.3%","Speech Reasoning %":"97%","Conversational Dynamics %":"77.8%","Agentic Performance %":"52.1%","Arena Preference Elo":"839","Task Success Rate %":"80.7%","Time to First Audio Seconds":"1.25"},"source_order":20}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 1.0"],"is_preliminary":false,"rank":3,"modelId":"grok-voice-think-fast-1-0","modelName":"Grok Voice Think Fast 1.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-1-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","display_name":"GPT-Realtime-2.1","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 High","normalized_model_family":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","variant":"High","reasoning_effort":"high","rank":4,"raw_score":45.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.9%","Speech Reasoning %":"96%","Conversational Dynamics %":"95.7%","Agentic Performance %":"45.7%","Arena Preference Elo":"892","Task Success Rate %":"91.5%","Time to First Audio Seconds":"1.21"},"source_order":9},{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 Minimal","normalized_model_family":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","variant":"Minimal","reasoning_effort":"minimal","rank":7,"raw_score":38,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"70.3%","Speech Reasoning %":"87%","Conversational Dynamics %":"92.7%","Agentic Performance %":"38.0%","Arena Preference Elo":"896","Task Success Rate %":"89.4%","Time to First Audio Seconds":"0.97"},"source_order":11}],"aggregation_source_results":["voice-5|GPT-Realtime-2.1 High"],"is_preliminary":false},{"model_id":"gpt-realtime-2","base_model":"GPT-Realtime-2","display_name":"GPT-Realtime-2","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":5,"raw_score":39.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":8},{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":9,"raw_score":37.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":10},{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":11,"raw_score":30.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":15}],"aggregation_source_results":["voice-5|GPT-Realtime-2 (High)"],"is_preliminary":false},{"model_id":"gpt-realtime-1-5","base_model":"GPT-Realtime-1.5","display_name":"GPT-Realtime-1.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-1.5","normalized_model_family":"gpt-realtime-1-5","base_model":"GPT-Realtime-1.5","variant":null,"reasoning_effort":null,"rank":6,"raw_score":38.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"70.3%","Speech Reasoning %":"81%","Conversational Dynamics %":"95.7%","Agentic Performance %":"38.8%","Arena Preference Elo":"1000","Task Success Rate %":"85.1%","Time to First Audio Seconds":"0.81"},"source_order":13}],"aggregation_source_results":["voice-5|GPT-Realtime-1.5"],"is_preliminary":false},{"model_id":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","display_name":"Gemini 3.1 Flash Live","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash Live High","normalized_model_family":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","variant":"High","reasoning_effort":"high","rank":8,"raw_score":37.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"71.5%","Speech Reasoning %":"97%","Conversational Dynamics %":"74.3%","Agentic Performance %":"37.7%","Arena Preference Elo":"1014","Task Success Rate %":"71.8%","Time to First Audio Seconds":"2.99"},"source_order":5},{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash Live Minimal","normalized_model_family":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","variant":"Minimal","reasoning_effort":"minimal","rank":16,"raw_score":26.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"63.9%","Speech Reasoning %":"71%","Conversational Dynamics %":"72.3%","Agentic Performance %":"26.2%","Arena Preference Elo":"1046","Task Success Rate %":"74.6%","Time to First Audio Seconds":"0.96"},"source_order":6}],"aggregation_source_results":["voice-5|Gemini 3.1 Flash Live High"],"is_preliminary":false},{"model_id":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","display_name":"Qwen Audio 3.0 Realtime Flash","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":10,"raw_score":35.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":2}],"aggregation_source_results":["voice-5|Qwen Audio 3.0 Realtime Flash"],"is_preliminary":false},{"model_id":"gpt-realtime","base_model":"GPT Realtime","display_name":"GPT Realtime","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Realtime (Aug '25)","normalized_model_family":"gpt-realtime","base_model":"GPT Realtime","variant":null,"reasoning_effort":null,"rank":12,"raw_score":30.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"68.5%","Speech Reasoning %":"83%","Conversational Dynamics %":"93.9%","Agentic Performance %":"30.4%","Arena Preference Elo":"944","Task Success Rate %":"89.4%","Time to First Audio Seconds":"0.98"},"source_order":12}],"aggregation_source_results":["voice-5|GPT Realtime (Aug '25)"],"is_preliminary":false},{"model_id":"gpt-realtime-2-1-mini","base_model":"GPT-Realtime-2.1 Mini","display_name":"GPT-Realtime-2.1 Mini","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 Mini High","normalized_model_family":"gpt-realtime-2-1-mini","base_model":"GPT-Realtime-2.1 Mini","variant":"High","reasoning_effort":"high","rank":13,"raw_score":29.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"75%","Conversational Dynamics %":"91.7%","Agentic Performance %":"29.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"4.28"},"source_order":14},{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 Mini Minimal","normalized_model_family":"gpt-realtime-2-1-mini","base_model":"GPT-Realtime-2.1 Mini","variant":"Minimal","reasoning_effort":"minimal","rank":18,"raw_score":22.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"52.8%","Speech Reasoning %":"63%","Conversational Dynamics %":"91.8%","Agentic Performance %":"22.5%","Arena Preference Elo":"792","Task Success Rate %":"76.7%","Time to First Audio Seconds":"0.85"},"source_order":17}],"aggregation_source_results":["voice-5|GPT-Realtime-2.1 Mini High"],"is_preliminary":false},{"model_id":"gpt-4o-realtime","base_model":"GPT-4o Realtime","display_name":"GPT-4o Realtime","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-4o Realtime (Dec 2024)","normalized_model_family":"gpt-4o-realtime","base_model":"GPT-4o Realtime","variant":null,"reasoning_effort":null,"rank":14,"raw_score":27.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"-","Conversational Dynamics %":"89.8%","Agentic Performance %":"27.9%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.49"},"source_order":18}],"aggregation_source_results":["voice-5|GPT-4o Realtime (Dec 2024)"],"is_preliminary":false},{"model_id":"grok-voice-fast-1-0","base_model":"Grok Voice Fast 1.0","display_name":"Grok Voice Fast 1.0","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Fast 1.0","normalized_model_family":"grok-voice-fast-1-0","base_model":"Grok Voice Fast 1.0","variant":null,"reasoning_effort":null,"rank":15,"raw_score":27.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"71.6%","Agentic Performance %":"27.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"0.78"},"source_order":21}],"aggregation_source_results":["voice-5|Grok Voice Fast 1.0"],"is_preliminary":false},{"model_id":"gemini-2-5-flash-native-audio-preview","base_model":"Gemini 2.5 Flash Native Audio Preview","display_name":"Gemini 2.5 Flash Native Audio Preview","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.23981247,"mean_rank":17,"median_rank":17,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 2.5 Flash Native Audio Preview (Dec 2025)","normalized_model_family":"gemini-2-5-flash-native-audio-preview","base_model":"Gemini 2.5 Flash Native Audio Preview","variant":null,"reasoning_effort":null,"rank":17,"raw_score":22.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"-","Conversational Dynamics %":"44.0%","Agentic Performance %":"22.8%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"-"},"source_order":7}],"aggregation_source_results":["voice-5|Gemini 2.5 Flash Native Audio Preview (Dec 2025)"],"is_preliminary":false},{"model_id":"higgs-realtime","base_model":"Higgs Realtime","display_name":"Higgs Realtime","official_model_id":null,"provider":"Boson AI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.23137821,"mean_rank":19,"median_rank":19,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Higgs Realtime","normalized_model_family":"higgs-realtime","base_model":"Higgs Realtime","variant":null,"reasoning_effort":null,"rank":19,"raw_score":18.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Boson AI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"69%","Conversational Dynamics %":"92.8%","Agentic Performance %":"18.6%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.47"},"source_order":3}],"aggregation_source_results":["voice-5|Higgs Realtime"],"is_preliminary":false},{"model_id":"deepslate-opal","base_model":"Deepslate Opal","display_name":"Deepslate Opal","official_model_id":null,"provider":"Deepslate","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.22767025,"mean_rank":20,"median_rank":20,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Deepslate Opal","normalized_model_family":"deepslate-opal","base_model":"Deepslate Opal","variant":null,"reasoning_effort":null,"rank":20,"raw_score":17.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Deepslate","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"85%","Conversational Dynamics %":"85.7%","Agentic Performance %":"17.5%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"0.44"},"source_order":4}],"aggregation_source_results":["voice-5|Deepslate Opal"],"is_preliminary":false}],"candidate_count":13,"ranking":[{"model_id":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","display_name":"Grok Voice Think Fast 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 2.0 High","normalized_model_family":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","variant":"High","reasoning_effort":"high","rank":1,"raw_score":56.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"79.0%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.1%","Agentic Performance %":"56.5%","Arena Preference Elo":"908","Task Success Rate %":"94.7%","Time to First Audio Seconds":"0.70"},"source_order":19}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 2.0 High"],"is_preliminary":false,"rank":1,"modelId":"grok-voice-think-fast-2-0","modelName":"Grok Voice Think Fast 2.0","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-2-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Grok Voice Think Fast 2.0","Grok Voice Think Fast 2.0 High"]},{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":2,"raw_score":54.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-5|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":2,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen Audio 3.0 Realtime Plus","Qwen Audio 3.0 Realtime Plus"]},{"model_id":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","display_name":"Grok Voice Think Fast 1.0","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 1.0","normalized_model_family":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":52.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"72.3%","Speech Reasoning %":"97%","Conversational Dynamics %":"77.8%","Agentic Performance %":"52.1%","Arena Preference Elo":"839","Task Success Rate %":"80.7%","Time to First Audio Seconds":"1.25"},"source_order":20}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 1.0"],"is_preliminary":false,"rank":3,"modelId":"grok-voice-think-fast-1-0","modelName":"Grok Voice Think Fast 1.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-1-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Grok Voice Think Fast 1.0","Grok Voice Think Fast 1.0"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","display_name":"Grok Voice Think Fast 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 2.0 High","normalized_model_family":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","variant":"High","reasoning_effort":"high","rank":1,"raw_score":56.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"79.0%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.1%","Agentic Performance %":"56.5%","Arena Preference Elo":"908","Task Success Rate %":"94.7%","Time to First Audio Seconds":"0.70"},"source_order":19}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 2.0 High"],"is_preliminary":false,"rank":1,"modelId":"grok-voice-think-fast-2-0","modelName":"Grok Voice Think Fast 2.0","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-2-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Grok Voice Think Fast 2.0","Grok Voice Think Fast 2.0 High"]},{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":2,"raw_score":54.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-5|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":2,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen Audio 3.0 Realtime Plus","Qwen Audio 3.0 Realtime Plus"]},{"model_id":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","display_name":"Grok Voice Think Fast 1.0","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 1.0","normalized_model_family":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":52.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"72.3%","Speech Reasoning %":"97%","Conversational Dynamics %":"77.8%","Agentic Performance %":"52.1%","Arena Preference Elo":"839","Task Success Rate %":"80.7%","Time to First Audio Seconds":"1.25"},"source_order":20}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 1.0"],"is_preliminary":false,"rank":3,"modelId":"grok-voice-think-fast-1-0","modelName":"Grok Voice Think Fast 1.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-1-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Grok Voice Think Fast 1.0","Grok Voice Think Fast 1.0"]}]}],"deepLink":"https://lll.bz/llm?task=realtime-voice"},{"id":"music","title":"Music generation","name":"Music generation","description":"For generating complete instrumental or vocal music.","category":"audio","sourceName":"Artificial Analysis","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["music"],"consensus":{"method":"weighted_reciprocal_rank","winner":"suno-v5-5","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1186,"raw_unit":"Elo","ci_low":1177,"ci_high":1195,"rank_spread_min":1,"rank_spread_max":1,"sample_count":6469,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["music|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V9","normalized_model_family":"mureka-v9","base_model":"Mureka V9","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1177,"raw_unit":"Elo","ci_low":1163,"ci_high":1191,"rank_spread_min":1,"rank_spread_max":3,"sample_count":3046,"is_preliminary":false,"provider":"Mureka","source_order":2}],"aggregation_source_results":["music|Mureka V9"],"is_preliminary":false,"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v9","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V8","normalized_model_family":"mureka-v8","base_model":"Mureka V8","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1166,"raw_unit":"Elo","ci_low":1158,"ci_high":1174,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7497,"is_preliminary":false,"provider":"Mureka","source_order":3}],"aggregation_source_results":["music|Mureka V8"],"is_preliminary":false,"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v8","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"suno-v5","base_model":"Suno V5","display_name":"Suno V5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5","normalized_model_family":"suno-v5","base_model":"Suno V5","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1160,"raw_unit":"Elo","ci_low":1152,"ci_high":1168,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7123,"is_preliminary":false,"provider":"Suno","source_order":4}],"aggregation_source_results":["music|Suno V5"],"is_preliminary":false},{"model_id":"lyria-3-pro","base_model":"Lyria 3 Pro","display_name":"Lyria 3 Pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Lyria 3 Pro","normalized_model_family":"lyria-3-pro","base_model":"Lyria 3 Pro","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1117,"raw_unit":"Elo","ci_low":1109,"ci_high":1125,"rank_spread_min":5,"rank_spread_max":5,"sample_count":7244,"is_preliminary":false,"provider":"Google","source_order":5}],"aggregation_source_results":["music|Lyria 3 Pro"],"is_preliminary":false},{"model_id":"suno-v4-5","base_model":"Suno V4.5","display_name":"Suno V4.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V4.5","normalized_model_family":"suno-v4-5","base_model":"Suno V4.5","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1083,"raw_unit":"Elo","ci_low":1074,"ci_high":1092,"rank_spread_min":6,"rank_spread_max":6,"sample_count":5341,"is_preliminary":false,"provider":"Suno","source_order":6}],"aggregation_source_results":["music|Suno V4.5"],"is_preliminary":false},{"model_id":"minimax-music-2-6","base_model":"MiniMax Music 2.6","display_name":"MiniMax Music 2.6","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax Music 2.6","normalized_model_family":"minimax-music-2-6","base_model":"MiniMax Music 2.6","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1067,"raw_unit":"Elo","ci_low":1059,"ci_high":1075,"rank_spread_min":7,"rank_spread_max":7,"sample_count":7202,"is_preliminary":false,"provider":"MiniMax","source_order":7}],"aggregation_source_results":["music|MiniMax Music 2.6"],"is_preliminary":false},{"model_id":"eleven-music-v2","base_model":"Eleven Music v2","display_name":"Eleven Music v2","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Eleven Music v2","normalized_model_family":"eleven-music-v2","base_model":"Eleven Music v2","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1058,"raw_unit":"Elo","ci_low":1048,"ci_high":1068,"rank_spread_min":7,"rank_spread_max":9,"sample_count":4325,"is_preliminary":false,"provider":"ElevenLabs","source_order":8}],"aggregation_source_results":["music|Eleven Music v2"],"is_preliminary":false},{"model_id":"minimax-music-2-5","base_model":"MiniMax Music 2.5+","display_name":"MiniMax Music 2.5+","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax Music 2.5+","normalized_model_family":"minimax-music-2-5","base_model":"MiniMax Music 2.5+","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1052,"raw_unit":"Elo","ci_low":1044,"ci_high":1060,"rank_spread_min":8,"rank_spread_max":9,"sample_count":7086,"is_preliminary":false,"provider":"MiniMax","source_order":9}],"aggregation_source_results":["music|MiniMax Music 2.5+"],"is_preliminary":false},{"model_id":"fuzz-1-1-pro","base_model":"FUZZ-1.1 Pro","display_name":"FUZZ-1.1 Pro","official_model_id":null,"provider":"Producer.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"FUZZ-1.1 Pro","normalized_model_family":"fuzz-1-1-pro","base_model":"FUZZ-1.1 Pro","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1036,"raw_unit":"Elo","ci_low":1027,"ci_high":1045,"rank_spread_min":10,"rank_spread_max":12,"sample_count":5117,"is_preliminary":false,"provider":"Producer.ai","source_order":10}],"aggregation_source_results":["music|FUZZ-1.1 Pro"],"is_preliminary":false},{"model_id":"eleven-music","base_model":"Eleven Music","display_name":"Eleven Music","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Eleven Music","normalized_model_family":"eleven-music","base_model":"Eleven Music","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1029,"raw_unit":"Elo","ci_low":1020,"ci_high":1038,"rank_spread_min":10,"rank_spread_max":12,"sample_count":5499,"is_preliminary":false,"provider":"ElevenLabs","source_order":11}],"aggregation_source_results":["music|Eleven Music"],"is_preliminary":false},{"model_id":"fuzz-2-0-raw","base_model":"FUZZ-2.0 Raw","display_name":"FUZZ-2.0 Raw","official_model_id":null,"provider":"Producer.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"FUZZ-2.0 Raw","normalized_model_family":"fuzz-2-0-raw","base_model":"FUZZ-2.0 Raw","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1028,"raw_unit":"Elo","ci_low":1019,"ci_high":1037,"rank_spread_min":10,"rank_spread_max":12,"sample_count":5433,"is_preliminary":false,"provider":"Producer.ai","source_order":12}],"aggregation_source_results":["music|FUZZ-2.0 Raw"],"is_preliminary":false},{"model_id":"fuzz-2-0","base_model":"FUZZ-2.0","display_name":"FUZZ-2.0","official_model_id":null,"provider":"Producer.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"FUZZ-2.0","normalized_model_family":"fuzz-2-0","base_model":"FUZZ-2.0","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1019,"raw_unit":"Elo","ci_low":1010,"ci_high":1028,"rank_spread_min":13,"rank_spread_max":13,"sample_count":5520,"is_preliminary":false,"provider":"Producer.ai","source_order":13}],"aggregation_source_results":["music|FUZZ-2.0"],"is_preliminary":false},{"model_id":"lyria-2","base_model":"Lyria 2","display_name":"Lyria 2","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Lyria 2","normalized_model_family":"lyria-2","base_model":"Lyria 2","variant":null,"reasoning_effort":null,"rank":14,"raw_score":1000,"raw_unit":"Elo","ci_low":1000,"ci_high":1000,"rank_spread_min":14,"rank_spread_max":14,"sample_count":4984,"is_preliminary":false,"provider":"Google","source_order":14}],"aggregation_source_results":["music|Lyria 2"],"is_preliminary":false},{"model_id":"stable-audio-2-0","base_model":"Stable Audio 2.0","display_name":"Stable Audio 2.0","official_model_id":null,"provider":"Stability.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Stable Audio 2.0","normalized_model_family":"stable-audio-2-0","base_model":"Stable Audio 2.0","variant":null,"reasoning_effort":null,"rank":15,"raw_score":959,"raw_unit":"Elo","ci_low":950,"ci_high":968,"rank_spread_min":15,"rank_spread_max":16,"sample_count":4705,"is_preliminary":false,"provider":"Stability.ai","source_order":15}],"aggregation_source_results":["music|Stable Audio 2.0"],"is_preliminary":false}],"candidate_count":15,"variants":[{"id":"instrumental","label":"Instrumental","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","models":[{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1186,"raw_unit":"Elo","ci_low":1177,"ci_high":1195,"rank_spread_min":1,"rank_spread_max":1,"sample_count":6469,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["music|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V9","normalized_model_family":"mureka-v9","base_model":"Mureka V9","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1177,"raw_unit":"Elo","ci_low":1163,"ci_high":1191,"rank_spread_min":1,"rank_spread_max":3,"sample_count":3046,"is_preliminary":false,"provider":"Mureka","source_order":2}],"aggregation_source_results":["music|Mureka V9"],"is_preliminary":false,"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v9","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V8","normalized_model_family":"mureka-v8","base_model":"Mureka V8","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1166,"raw_unit":"Elo","ci_low":1158,"ci_high":1174,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7497,"is_preliminary":false,"provider":"Mureka","source_order":3}],"aggregation_source_results":["music|Mureka V8"],"is_preliminary":false,"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v8","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."}]},{"id":"vocals","label":"Vocals","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","models":[{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1170,"raw_unit":"Elo","ci_low":1163,"ci_high":1177,"rank_spread_min":1,"rank_spread_max":1,"sample_count":10373,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["vocals|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Vocal music preference; single source family."},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V9","normalized_model_family":"mureka-v9","base_model":"Mureka V9","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1159,"raw_unit":"Elo","ci_low":1145,"ci_high":1173,"rank_spread_min":1,"rank_spread_max":2,"sample_count":3010,"is_preliminary":false,"provider":"Mureka","source_order":2}],"aggregation_source_results":["vocals|Mureka V9"],"is_preliminary":false,"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","likeKey":"music:mureka-v9","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Vocal music preference; single source family."},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V8","normalized_model_family":"mureka-v8","base_model":"Mureka V8","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1140,"raw_unit":"Elo","ci_low":1134,"ci_high":1146,"rank_spread_min":3,"rank_spread_max":3,"sample_count":11414,"is_preliminary":false,"provider":"Mureka","source_order":3}],"aggregation_source_results":["vocals|Mureka V8"],"is_preliminary":false,"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","likeKey":"music:mureka-v8","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Vocal music preference; single source family."}]}],"ranking":[{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1186,"raw_unit":"Elo","ci_low":1177,"ci_high":1195,"rank_spread_min":1,"rank_spread_max":1,"sample_count":6469,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["music|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Suno V5.5","Suno V5.5"]},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V9","normalized_model_family":"mureka-v9","base_model":"Mureka V9","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1177,"raw_unit":"Elo","ci_low":1163,"ci_high":1191,"rank_spread_min":1,"rank_spread_max":3,"sample_count":3046,"is_preliminary":false,"provider":"Mureka","source_order":2}],"aggregation_source_results":["music|Mureka V9"],"is_preliminary":false,"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v9","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Mureka V9","Mureka V9"]},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V8","normalized_model_family":"mureka-v8","base_model":"Mureka V8","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1166,"raw_unit":"Elo","ci_low":1158,"ci_high":1174,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7497,"is_preliminary":false,"provider":"Mureka","source_order":3}],"aggregation_source_results":["music|Mureka V8"],"is_preliminary":false,"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v8","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Mureka V8","Mureka V8"]}],"rankingLists":[{"id":"instrumental","label":"Instrumental","models":[{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1186,"raw_unit":"Elo","ci_low":1177,"ci_high":1195,"rank_spread_min":1,"rank_spread_max":1,"sample_count":6469,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["music|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Suno V5.5","Suno V5.5"]},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V9","normalized_model_family":"mureka-v9","base_model":"Mureka V9","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1177,"raw_unit":"Elo","ci_low":1163,"ci_high":1191,"rank_spread_min":1,"rank_spread_max":3,"sample_count":3046,"is_preliminary":false,"provider":"Mureka","source_order":2}],"aggregation_source_results":["music|Mureka V9"],"is_preliminary":false,"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v9","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Mureka V9","Mureka V9"]},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V8","normalized_model_family":"mureka-v8","base_model":"Mureka V8","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1166,"raw_unit":"Elo","ci_low":1158,"ci_high":1174,"rank_spread_min":3,"rank_spread_max":4,"sample_count":7497,"is_preliminary":false,"provider":"Mureka","source_order":3}],"aggregation_source_results":["music|Mureka V8"],"is_preliminary":false,"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:mureka-v8","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Mureka V8","Mureka V8"]}]},{"id":"vocals","label":"Vocals","models":[{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1170,"raw_unit":"Elo","ci_low":1163,"ci_high":1177,"rank_spread_min":1,"rank_spread_max":1,"sample_count":10373,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["vocals|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Vocal music preference; single source family.","aliases":["Suno V5.5","Suno V5.5"]},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V9","normalized_model_family":"mureka-v9","base_model":"Mureka V9","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1159,"raw_unit":"Elo","ci_low":1145,"ci_high":1173,"rank_spread_min":1,"rank_spread_max":2,"sample_count":3010,"is_preliminary":false,"provider":"Mureka","source_order":2}],"aggregation_source_results":["vocals|Mureka V9"],"is_preliminary":false,"rank":2,"modelId":"mureka-v9","modelName":"Mureka V9","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","likeKey":"music:mureka-v9","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Vocal music preference; single source family.","aliases":["Mureka V9","Mureka V9"]},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Mureka V8","normalized_model_family":"mureka-v8","base_model":"Mureka V8","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1140,"raw_unit":"Elo","ci_low":1134,"ci_high":1146,"rank_spread_min":3,"rank_spread_max":3,"sample_count":11414,"is_preliminary":false,"provider":"Mureka","source_order":3}],"aggregation_source_results":["vocals|Mureka V8"],"is_preliminary":false,"rank":3,"modelId":"mureka-v8","modelName":"Mureka V8","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/vocals","likeKey":"music:mureka-v8","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Vocal music preference; single source family.","aliases":["Mureka V8","Mureka V8"]}]}],"deepLink":"https://lll.bz/llm?task=music"},{"id":"data-analysis","title":"Data analysis","name":"Data analysis","description":"For objective data-analysis problems; dashboard design and standalone SQL quality are separate tasks.","category":"code","sourceName":"LiveBench","sourceUrl":"https://livebench.ai/","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["lb-Data Analysis"],"consensus":{"method":"weighted_reciprocal_rank","winner":"gpt-6-astra","confidence":"medium","disagreement_status":"clear_winner","independent_source_count":1,"source_coverage":1,"family_weights":{"LiveBench":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["lb-Data Analysis|GPT-6 Astra Max Effort"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5 Thinking xHigh Effort","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":2,"raw_score":81.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["lb-Data Analysis|GPT-5.5 Thinking xHigh Effort"],"is_preliminary":false,"rank":2,"modelId":"gpt-5-5","modelName":"GPT-5.5","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":80.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":3}],"aggregation_source_results":["lb-Data Analysis|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":80.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":4}],"aggregation_source_results":["lb-Data Analysis|Claude Fable 5.1 Max Effort"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":5,"raw_score":79.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":5}],"aggregation_source_results":["lb-Data Analysis|GPT-5.6 Sol Max Effort"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 xHigh Effort","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":6,"raw_score":79.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["lb-Data Analysis|Muse Spark 1.3 xHigh Effort"],"is_preliminary":false},{"model_id":"deepseek-v4-flash-vision-exp-open","base_model":"DeepSeek V4 Flash Vision Exp\nopen","display_name":"DeepSeek V4 Flash Vision Exp\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"DeepSeek V4 Flash Vision Exp\nopen","normalized_model_family":"deepseek-v4-flash-vision-exp-open","base_model":"DeepSeek V4 Flash Vision Exp\nopen","variant":null,"reasoning_effort":null,"rank":7,"raw_score":79.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":7}],"aggregation_source_results":["lb-Data Analysis|DeepSeek V4 Flash Vision Exp\nopen"],"is_preliminary":false},{"model_id":"gpt-5-4","base_model":"GPT-5.4","display_name":"GPT-5.4","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.4 Thinking xHigh Effort","normalized_model_family":"gpt-5-4","base_model":"GPT-5.4","variant":"Xhigh","reasoning_effort":"xhigh","rank":8,"raw_score":79.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":8}],"aggregation_source_results":["lb-Data Analysis|GPT-5.4 Thinking xHigh Effort"],"is_preliminary":false},{"model_id":"gpt-5-6-terra","base_model":"GPT-5.6 Terra","display_name":"GPT-5.6 Terra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Terra Max Effort","normalized_model_family":"gpt-5-6-terra","base_model":"GPT-5.6 Terra","variant":"Max","reasoning_effort":"max","rank":8,"raw_score":79.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":9}],"aggregation_source_results":["lb-Data Analysis|GPT-5.6 Terra Max Effort"],"is_preliminary":false},{"model_id":"deepseek-v4-flash-0731-open","base_model":"DeepSeek V4 Flash 0731\nopen","display_name":"DeepSeek V4 Flash 0731\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"DeepSeek V4 Flash 0731\nopen","normalized_model_family":"deepseek-v4-flash-0731-open","base_model":"DeepSeek V4 Flash 0731\nopen","variant":null,"reasoning_effort":null,"rank":8,"raw_score":79.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["lb-Data Analysis|DeepSeek V4 Flash 0731\nopen"],"is_preliminary":false},{"model_id":"deepseek-v4-pro-0813-open","base_model":"DeepSeek V4 Pro 0813\nopen","display_name":"DeepSeek V4 Pro 0813\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"DeepSeek V4 Pro 0813\nopen","normalized_model_family":"deepseek-v4-pro-0813-open","base_model":"DeepSeek V4 Pro 0813\nopen","variant":null,"reasoning_effort":null,"rank":11,"raw_score":79.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":11}],"aggregation_source_results":["lb-Data Analysis|DeepSeek V4 Pro 0813\nopen"],"is_preliminary":false},{"model_id":"kimi-k3-open","base_model":"Kimi K3\nopen","display_name":"Kimi K3\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi K3\nopen","normalized_model_family":"kimi-k3-open","base_model":"Kimi K3\nopen","variant":null,"reasoning_effort":null,"rank":12,"raw_score":78.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":12}],"aggregation_source_results":["lb-Data Analysis|Kimi K3\nopen"],"is_preliminary":false},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Pro Preview High","normalized_model_family":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","variant":"High","reasoning_effort":"high","rank":13,"raw_score":78.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":13}],"aggregation_source_results":["lb-Data Analysis|Gemini 3.1 Pro Preview High"],"is_preliminary":false},{"model_id":"qwen-3-8-max-open","base_model":"Qwen 3.8 Max\nopen","display_name":"Qwen 3.8 Max\nopen","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen 3.8 Max\nopen","normalized_model_family":"qwen-3-8-max-open","base_model":"Qwen 3.8 Max\nopen","variant":null,"reasoning_effort":null,"rank":14,"raw_score":78.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":14}],"aggregation_source_results":["lb-Data Analysis|Qwen 3.8 Max\nopen"],"is_preliminary":false},{"model_id":"claude-4-7-opus","base_model":"Claude 4.7 Opus","display_name":"Claude 4.7 Opus","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 4.7 Opus Thinking xHigh Effort","normalized_model_family":"claude-4-7-opus","base_model":"Claude 4.7 Opus","variant":"Xhigh","reasoning_effort":"xhigh","rank":15,"raw_score":78.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":15}],"aggregation_source_results":["lb-Data Analysis|Claude 4.7 Opus Thinking xHigh Effort"],"is_preliminary":false}],"candidate_count":48,"ranking":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["lb-Data Analysis|GPT-6 Astra Max Effort"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","GPT-6 Astra Max Effort"]},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5 Thinking xHigh Effort","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":2,"raw_score":81.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["lb-Data Analysis|GPT-5.5 Thinking xHigh Effort"],"is_preliminary":false,"rank":2,"modelId":"gpt-5-5","modelName":"GPT-5.5","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.5","GPT-5.5 Thinking xHigh Effort"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":80.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":3}],"aggregation_source_results":["lb-Data Analysis|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","Claude Fable 5 Max Effort"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["lb-Data Analysis|GPT-6 Astra Max Effort"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","GPT-6 Astra Max Effort"]},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5 Thinking xHigh Effort","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":2,"raw_score":81.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["lb-Data Analysis|GPT-5.5 Thinking xHigh Effort"],"is_preliminary":false,"rank":2,"modelId":"gpt-5-5","modelName":"GPT-5.5","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.5","GPT-5.5 Thinking xHigh Effort"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":80.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":3}],"aggregation_source_results":["lb-Data Analysis|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":3,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","Claude Fable 5 Max Effort"]}]}],"deepLink":"https://lll.bz/llm?task=data-analysis"},{"id":"tool-calling","title":"Structured output and tool calling","name":"Structured output and tool calling","description":"For reliable function calls, JSON arguments and structured tool use.","category":"code","sourceName":"Berkeley BFCL","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","sourceDate":"2026-04-12","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["bfcl"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-opus-4-5-20251101","confidence":"low","disagreement_status":"clear_winner","independent_source_count":1,"source_coverage":1,"family_weights":{"Berkeley BFCL":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","display_name":"Claude-Opus-4.5-20251101","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (FC)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":1,"raw_score":77.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (Prompt)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":57,"raw_score":33.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":57}],"aggregation_source_results":["bfcl|Claude-Opus-4-5-20251101 (FC)"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-4-5-20251101","modelName":"Claude-Opus-4.5-20251101","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-opus-4-5-20251101","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old."},{"model_id":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","display_name":"Claude-Sonnet-4.5-20250929","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Sonnet-4-5-20250929 (FC)","normalized_model_family":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","variant":"function calling","reasoning_effort":null,"rank":2,"raw_score":73.24,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Sonnet-4-5-20250929 (Prompt)","normalized_model_family":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","variant":"function calling","reasoning_effort":null,"rank":89,"raw_score":24.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":89}],"aggregation_source_results":["bfcl|Claude-Sonnet-4-5-20250929 (FC)"],"is_preliminary":false,"rank":2,"modelId":"claude-sonnet-4-5-20250929","modelName":"Claude-Sonnet-4.5-20250929","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-sonnet-4-5-20250929","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old."},{"model_id":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","display_name":"Gemini-3-Pro-Preview","official_model_id":null,"provider":"Google","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Pro-Preview (Prompt)","normalized_model_family":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","variant":"function calling","reasoning_effort":null,"rank":3,"raw_score":72.51,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":3},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Pro-Preview (FC)","normalized_model_family":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","variant":"function calling","reasoning_effort":null,"rank":7,"raw_score":68.14,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":7}],"aggregation_source_results":["bfcl|Gemini-3-Pro-Preview (Prompt)"],"is_preliminary":false,"rank":3,"modelId":"gemini-3-pro-preview","modelName":"Gemini-3-Pro-Preview","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:gemini-3-pro-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old."}],"pending_evaluation":[],"candidates":[{"model_id":"glm-4-6","base_model":"GLM-4.6","display_name":"GLM-4.6","official_model_id":null,"provider":"Zhipu AI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"GLM-4.6 (FC thinking)","normalized_model_family":"glm-4-6","base_model":"GLM-4.6","variant":"function calling","reasoning_effort":null,"rank":4,"raw_score":72.38,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Zhipu AI","source_order":4}],"aggregation_source_results":["bfcl|GLM-4.6 (FC thinking)"],"is_preliminary":false},{"model_id":"grok-4-1-fast-reasoning","base_model":"Grok-4-1-fast-reasoning","display_name":"Grok-4-1-fast-reasoning","official_model_id":null,"provider":"xAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Grok-4-1-fast-reasoning (FC)","normalized_model_family":"grok-4-1-fast-reasoning","base_model":"Grok-4-1-fast-reasoning","variant":"function calling","reasoning_effort":null,"rank":5,"raw_score":69.57,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"xAI","source_order":5}],"aggregation_source_results":["bfcl|Grok-4-1-fast-reasoning (FC)"],"is_preliminary":false},{"model_id":"claude-haiku-4-5-20251001","base_model":"Claude-Haiku-4-5-20251001","display_name":"Claude-Haiku-4-5-20251001","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Haiku-4-5-20251001 (FC)","normalized_model_family":"claude-haiku-4-5-20251001","base_model":"Claude-Haiku-4-5-20251001","variant":"function calling","reasoning_effort":null,"rank":6,"raw_score":68.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":6},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Haiku-4-5-20251001 (Prompt)","normalized_model_family":"claude-haiku-4-5-20251001","base_model":"Claude-Haiku-4-5-20251001","variant":"function calling","reasoning_effort":null,"rank":87,"raw_score":25.26,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":87}],"aggregation_source_results":["bfcl|Claude-Haiku-4-5-20251001 (FC)"],"is_preliminary":false},{"model_id":"o3-2025-04-16","base_model":"o3 2025 04 16","display_name":"o3 2025 04 16","official_model_id":null,"provider":"OpenAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"o3-2025-04-16 (Prompt)","normalized_model_family":"o3-2025-04-16","base_model":"o3 2025 04 16","variant":"function calling","reasoning_effort":null,"rank":8,"raw_score":63.05,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":8},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"o3-2025-04-16 (FC)","normalized_model_family":"o3-2025-04-16","base_model":"o3 2025 04 16","variant":"function calling","reasoning_effort":null,"rank":30,"raw_score":48.56,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":30}],"aggregation_source_results":["bfcl|o3-2025-04-16 (Prompt)"],"is_preliminary":false},{"model_id":"grok-4-0709","base_model":"Grok-4-0709","display_name":"Grok-4-0709","official_model_id":null,"provider":"xAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Grok-4-0709 (Prompt)","normalized_model_family":"grok-4-0709","base_model":"Grok-4-0709","variant":"function calling","reasoning_effort":null,"rank":9,"raw_score":62.97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"xAI","source_order":9},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Grok-4-0709 (FC)","normalized_model_family":"grok-4-0709","base_model":"Grok-4-0709","variant":"function calling","reasoning_effort":null,"rank":10,"raw_score":61.38,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"xAI","source_order":10}],"aggregation_source_results":["bfcl|Grok-4-0709 (Prompt)"],"is_preliminary":false},{"model_id":"moonshotai-kimi-k2-instruct","base_model":"Moonshotai-Kimi-K2-Instruct","display_name":"Moonshotai-Kimi-K2-Instruct","official_model_id":null,"provider":"MoonshotAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Moonshotai-Kimi-K2-Instruct (FC)","normalized_model_family":"moonshotai-kimi-k2-instruct","base_model":"Moonshotai-Kimi-K2-Instruct","variant":"function calling","reasoning_effort":null,"rank":11,"raw_score":59.06,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"MoonshotAI","source_order":11}],"aggregation_source_results":["bfcl|Moonshotai-Kimi-K2-Instruct (FC)"],"is_preliminary":false},{"model_id":"grok-4-1-fast-non-reasoning","base_model":"Grok-4-1-fast-non-reasoning","display_name":"Grok-4-1-fast-non-reasoning","official_model_id":null,"provider":"xAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Grok-4-1-fast-non-reasoning (FC)","normalized_model_family":"grok-4-1-fast-non-reasoning","base_model":"Grok-4-1-fast-non-reasoning","variant":"function calling","reasoning_effort":null,"rank":12,"raw_score":58.29,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"xAI","source_order":12}],"aggregation_source_results":["bfcl|Grok-4-1-fast-non-reasoning (FC)"],"is_preliminary":false},{"model_id":"command-a-reasoning","base_model":"Command A Reasoning","display_name":"Command A Reasoning","official_model_id":null,"provider":"Cohere","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Command A Reasoning (FC)","normalized_model_family":"command-a-reasoning","base_model":"Command A Reasoning","variant":"function calling","reasoning_effort":null,"rank":13,"raw_score":57.06,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Cohere","source_order":13}],"aggregation_source_results":["bfcl|Command A Reasoning (FC)"],"is_preliminary":false},{"model_id":"deepseek-v3-2-exp","base_model":"DeepSeek-V3.2-Exp","display_name":"DeepSeek-V3.2-Exp","official_model_id":null,"provider":"DeepSeek","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"DeepSeek-V3.2-Exp (Prompt + Thinking)","normalized_model_family":"deepseek-v3-2-exp","base_model":"DeepSeek-V3.2-Exp","variant":"function calling","reasoning_effort":null,"rank":14,"raw_score":56.73,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"DeepSeek","source_order":14},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"DeepSeek-V3.2-Exp (FC)","normalized_model_family":"deepseek-v3-2-exp","base_model":"DeepSeek-V3.2-Exp","variant":"function calling","reasoning_effort":null,"rank":19,"raw_score":54.12,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"DeepSeek","source_order":19}],"aggregation_source_results":["bfcl|DeepSeek-V3.2-Exp (Prompt + Thinking)"],"is_preliminary":false},{"model_id":"gemini-2-5-flash","base_model":"Gemini-2.5-Flash","display_name":"Gemini-2.5-Flash","official_model_id":null,"provider":"Google","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-2.5-Flash (FC)","normalized_model_family":"gemini-2-5-flash","base_model":"Gemini-2.5-Flash","variant":"function calling","reasoning_effort":null,"rank":15,"raw_score":56.24,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":15},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-2.5-Flash (Prompt)","normalized_model_family":"gemini-2-5-flash","base_model":"Gemini-2.5-Flash","variant":"function calling","reasoning_effort":null,"rank":26,"raw_score":50.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":26}],"aggregation_source_results":["bfcl|Gemini-2.5-Flash (FC)"],"is_preliminary":false},{"model_id":"gpt-5-2-2025-12-11","base_model":"GPT-5.2-2025-12-11","display_name":"GPT-5.2-2025-12-11","official_model_id":null,"provider":"OpenAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.24465054,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"GPT-5.2-2025-12-11 (FC)","normalized_model_family":"gpt-5-2-2025-12-11","base_model":"GPT-5.2-2025-12-11","variant":"function calling","reasoning_effort":null,"rank":16,"raw_score":55.87,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":16},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"GPT-5.2-2025-12-11 (Prompt)","normalized_model_family":"gpt-5-2-2025-12-11","base_model":"GPT-5.2-2025-12-11","variant":"function calling","reasoning_effort":null,"rank":38,"raw_score":45.27,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":38}],"aggregation_source_results":["bfcl|GPT-5.2-2025-12-11 (FC)"],"is_preliminary":false},{"model_id":"gpt-5-mini-2025-08-07","base_model":"GPT-5-mini-2025-08-07","display_name":"GPT-5-mini-2025-08-07","official_model_id":null,"provider":"OpenAI","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.23981247,"mean_rank":17,"median_rank":17,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"GPT-5-mini-2025-08-07 (FC)","normalized_model_family":"gpt-5-mini-2025-08-07","base_model":"GPT-5-mini-2025-08-07","variant":"function calling","reasoning_effort":null,"rank":17,"raw_score":55.46,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":17},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"GPT-5-mini-2025-08-07 (Prompt)","normalized_model_family":"gpt-5-mini-2025-08-07","base_model":"GPT-5-mini-2025-08-07","variant":"function calling","reasoning_effort":null,"rank":77,"raw_score":27.83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":77}],"aggregation_source_results":["bfcl|GPT-5-mini-2025-08-07 (FC)"],"is_preliminary":false}],"candidate_count":79,"ranking":[{"model_id":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","display_name":"Claude-Opus-4.5-20251101","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (FC)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":1,"raw_score":77.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (Prompt)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":57,"raw_score":33.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":57}],"aggregation_source_results":["bfcl|Claude-Opus-4-5-20251101 (FC)"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-4-5-20251101","modelName":"Claude-Opus-4.5-20251101","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-opus-4-5-20251101","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","aliases":["Claude-Opus-4.5-20251101","Claude-Opus-4-5-20251101 (FC)","Claude-Opus-4-5-20251101 (Prompt)"]},{"model_id":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","display_name":"Claude-Sonnet-4.5-20250929","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Sonnet-4-5-20250929 (FC)","normalized_model_family":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","variant":"function calling","reasoning_effort":null,"rank":2,"raw_score":73.24,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Sonnet-4-5-20250929 (Prompt)","normalized_model_family":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","variant":"function calling","reasoning_effort":null,"rank":89,"raw_score":24.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":89}],"aggregation_source_results":["bfcl|Claude-Sonnet-4-5-20250929 (FC)"],"is_preliminary":false,"rank":2,"modelId":"claude-sonnet-4-5-20250929","modelName":"Claude-Sonnet-4.5-20250929","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-sonnet-4-5-20250929","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","aliases":["Claude-Sonnet-4.5-20250929","Claude-Sonnet-4-5-20250929 (FC)","Claude-Sonnet-4-5-20250929 (Prompt)"]},{"model_id":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","display_name":"Gemini-3-Pro-Preview","official_model_id":null,"provider":"Google","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Pro-Preview (Prompt)","normalized_model_family":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","variant":"function calling","reasoning_effort":null,"rank":3,"raw_score":72.51,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":3},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Pro-Preview (FC)","normalized_model_family":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","variant":"function calling","reasoning_effort":null,"rank":7,"raw_score":68.14,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":7}],"aggregation_source_results":["bfcl|Gemini-3-Pro-Preview (Prompt)"],"is_preliminary":false,"rank":3,"modelId":"gemini-3-pro-preview","modelName":"Gemini-3-Pro-Preview","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:gemini-3-pro-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","aliases":["Gemini-3-Pro-Preview","Gemini-3-Pro-Preview (Prompt)","Gemini-3-Pro-Preview (FC)"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","display_name":"Claude-Opus-4.5-20251101","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (FC)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":1,"raw_score":77.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (Prompt)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":57,"raw_score":33.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":57}],"aggregation_source_results":["bfcl|Claude-Opus-4-5-20251101 (FC)"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-4-5-20251101","modelName":"Claude-Opus-4.5-20251101","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-opus-4-5-20251101","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","aliases":["Claude-Opus-4.5-20251101","Claude-Opus-4-5-20251101 (FC)","Claude-Opus-4-5-20251101 (Prompt)"]},{"model_id":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","display_name":"Claude-Sonnet-4.5-20250929","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Sonnet-4-5-20250929 (FC)","normalized_model_family":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","variant":"function calling","reasoning_effort":null,"rank":2,"raw_score":73.24,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Sonnet-4-5-20250929 (Prompt)","normalized_model_family":"claude-sonnet-4-5-20250929","base_model":"Claude-Sonnet-4.5-20250929","variant":"function calling","reasoning_effort":null,"rank":89,"raw_score":24.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":89}],"aggregation_source_results":["bfcl|Claude-Sonnet-4-5-20250929 (FC)"],"is_preliminary":false,"rank":2,"modelId":"claude-sonnet-4-5-20250929","modelName":"Claude-Sonnet-4.5-20250929","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-sonnet-4-5-20250929","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","aliases":["Claude-Sonnet-4.5-20250929","Claude-Sonnet-4-5-20250929 (FC)","Claude-Sonnet-4-5-20250929 (Prompt)"]},{"model_id":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","display_name":"Gemini-3-Pro-Preview","official_model_id":null,"provider":"Google","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Pro-Preview (Prompt)","normalized_model_family":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","variant":"function calling","reasoning_effort":null,"rank":3,"raw_score":72.51,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":3},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Pro-Preview (FC)","normalized_model_family":"gemini-3-pro-preview","base_model":"Gemini-3-Pro-Preview","variant":"function calling","reasoning_effort":null,"rank":7,"raw_score":68.14,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","source_order":7}],"aggregation_source_results":["bfcl|Gemini-3-Pro-Preview (Prompt)"],"is_preliminary":false,"rank":3,"modelId":"gemini-3-pro-preview","modelName":"Gemini-3-Pro-Preview","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:gemini-3-pro-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old.","aliases":["Gemini-3-Pro-Preview","Gemini-3-Pro-Preview (Prompt)","Gemini-3-Pro-Preview (FC)"]}]}],"deepLink":"https://lll.bz/llm?task=tool-calling"},{"id":"voice-cloning","title":"Controlled-voice synthesis","name":"Controlled-voice synthesis","description":"For comparing speech synthesis with a controlled common voice; speaker similarity is not evaluated.","category":"audio","sourceName":"Artificial Analysis","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["cloning"],"consensus":{"method":"weighted_reciprocal_rank","winner":"realtime-tts-2","confidence":"low","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Artificial Analysis":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1123,"raw_unit":"Elo","ci_low":1107,"ci_high":1139,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1292,"is_preliminary":false,"provider":"Inworld","source_order":1}],"aggregation_source_results":["cloning|Realtime TTS-2"],"is_preliminary":false,"rank":1,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1119,"raw_unit":"Elo","ci_low":1104,"ci_high":1134,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1993,"is_preliminary":false,"provider":"Cartesia","source_order":2}],"aggregation_source_results":["cloning|Sonic 3.6"],"is_preliminary":false,"rank":2,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"sonic-3-5","base_model":"Sonic 3.5","display_name":"Sonic 3.5","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.5","normalized_model_family":"sonic-3-5","base_model":"Sonic 3.5","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1096,"raw_unit":"Elo","ci_low":1084,"ci_high":1108,"rank_spread_min":3,"rank_spread_max":3,"sample_count":3791,"is_preliminary":false,"provider":"Cartesia","source_order":3}],"aggregation_source_results":["cloning|Sonic 3.5"],"is_preliminary":false,"rank":3,"modelId":"sonic-3-5","modelName":"Sonic 3.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:sonic-3-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"realtime-tts-2-flash-research-preview","base_model":"Realtime TTS-2 Flash - Research Preview","display_name":"Realtime TTS-2 Flash - Research Preview","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2 Flash - Research Preview","normalized_model_family":"realtime-tts-2-flash-research-preview","base_model":"Realtime TTS-2 Flash - Research Preview","variant":null,"reasoning_effort":null,"rank":4,"raw_score":1075,"raw_unit":"Elo","ci_low":1060,"ci_high":1090,"rank_spread_min":4,"rank_spread_max":5,"sample_count":1621,"is_preliminary":false,"provider":"Inworld","source_order":4}],"aggregation_source_results":["cloning|Realtime TTS-2 Flash - Research Preview"],"is_preliminary":false},{"model_id":"eleven-v3","base_model":"Eleven v3","display_name":"Eleven v3","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Eleven v3","normalized_model_family":"eleven-v3","base_model":"Eleven v3","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1062,"raw_unit":"Elo","ci_low":1050,"ci_high":1074,"rank_spread_min":5,"rank_spread_max":6,"sample_count":3244,"is_preliminary":false,"provider":"ElevenLabs","source_order":5}],"aggregation_source_results":["cloning|Eleven v3"],"is_preliminary":false},{"model_id":"stepaudio-2-5-tts","base_model":"StepAudio 2.5 TTS","display_name":"StepAudio 2.5 TTS","official_model_id":null,"provider":"StepFun","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"StepAudio 2.5 TTS","normalized_model_family":"stepaudio-2-5-tts","base_model":"StepAudio 2.5 TTS","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1052,"raw_unit":"Elo","ci_low":1039,"ci_high":1065,"rank_spread_min":5,"rank_spread_max":6,"sample_count":2558,"is_preliminary":false,"provider":"StepFun","source_order":6}],"aggregation_source_results":["cloning|StepAudio 2.5 TTS"],"is_preliminary":false},{"model_id":"spacexai-tts","base_model":"SpaceXAI TTS","display_name":"SpaceXAI TTS","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33333333,"mean_rank":7,"median_rank":7,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"SpaceXAI TTS","normalized_model_family":"spacexai-tts","base_model":"SpaceXAI TTS","variant":null,"reasoning_effort":null,"rank":7,"raw_score":1039,"raw_unit":"Elo","ci_low":1026,"ci_high":1052,"rank_spread_min":7,"rank_spread_max":8,"sample_count":2524,"is_preliminary":false,"provider":"SpaceXAI","source_order":7}],"aggregation_source_results":["cloning|SpaceXAI TTS"],"is_preliminary":false},{"model_id":"speech-2-8-hd","base_model":"Speech 2.8 HD","display_name":"Speech 2.8 HD","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Speech 2.8 HD","normalized_model_family":"speech-2-8-hd","base_model":"Speech 2.8 HD","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1028,"raw_unit":"Elo","ci_low":1016,"ci_high":1040,"rank_spread_min":7,"rank_spread_max":9,"sample_count":3188,"is_preliminary":false,"provider":"MiniMax","source_order":8}],"aggregation_source_results":["cloning|Speech 2.8 HD"],"is_preliminary":false},{"model_id":"v3-conversational","base_model":"v3 Conversational","display_name":"v3 Conversational","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"v3 Conversational","normalized_model_family":"v3-conversational","base_model":"v3 Conversational","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1026,"raw_unit":"Elo","ci_low":1012,"ci_high":1040,"rank_spread_min":7,"rank_spread_max":11,"sample_count":1626,"is_preliminary":false,"provider":"ElevenLabs","source_order":9}],"aggregation_source_results":["cloning|v3 Conversational"],"is_preliminary":false},{"model_id":"speech-2-8-turbo","base_model":"Speech 2.8 Turbo","display_name":"Speech 2.8 Turbo","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Speech 2.8 Turbo","normalized_model_family":"speech-2-8-turbo","base_model":"Speech 2.8 Turbo","variant":null,"reasoning_effort":null,"rank":10,"raw_score":1015,"raw_unit":"Elo","ci_low":1003,"ci_high":1027,"rank_spread_min":9,"rank_spread_max":14,"sample_count":3207,"is_preliminary":false,"provider":"MiniMax","source_order":10}],"aggregation_source_results":["cloning|Speech 2.8 Turbo"],"is_preliminary":false},{"model_id":"simba-3-0","base_model":"Simba 3.0","display_name":"Simba 3.0","official_model_id":null,"provider":"SpeechifyAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Simba 3.0","normalized_model_family":"simba-3-0","base_model":"Simba 3.0","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1015,"raw_unit":"Elo","ci_low":1002,"ci_high":1028,"rank_spread_min":9,"rank_spread_max":15,"sample_count":2553,"is_preliminary":false,"provider":"SpeechifyAI","source_order":11}],"aggregation_source_results":["cloning|Simba 3.0"],"is_preliminary":false},{"model_id":"breeze-tts-2","base_model":"Breeze TTS 2","display_name":"Breeze TTS 2","official_model_id":null,"provider":"BreezeBlue","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Breeze TTS 2\nOpen Weights","normalized_model_family":"breeze-tts-2","base_model":"Breeze TTS 2","variant":null,"reasoning_effort":null,"rank":12,"raw_score":1007,"raw_unit":"Elo","ci_low":992,"ci_high":1022,"rank_spread_min":10,"rank_spread_max":20,"sample_count":1546,"is_preliminary":false,"provider":"BreezeBlue","source_order":12}],"aggregation_source_results":["cloning|Breeze TTS 2\nOpen Weights"],"is_preliminary":false},{"model_id":"voxtral-tts","base_model":"Voxtral TTS","display_name":"Voxtral TTS","official_model_id":null,"provider":"Mistral","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Voxtral TTS\nOpen Weights","normalized_model_family":"voxtral-tts","base_model":"Voxtral TTS","variant":null,"reasoning_effort":null,"rank":13,"raw_score":1005,"raw_unit":"Elo","ci_low":992,"ci_high":1018,"rank_spread_min":10,"rank_spread_max":20,"sample_count":2554,"is_preliminary":false,"provider":"Mistral","source_order":13}],"aggregation_source_results":["cloning|Voxtral TTS\nOpen Weights"],"is_preliminary":false},{"model_id":"multilingual-v2","base_model":"Multilingual v2","display_name":"Multilingual v2","official_model_id":null,"provider":"ElevenLabs","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Multilingual v2","normalized_model_family":"multilingual-v2","base_model":"Multilingual v2","variant":null,"reasoning_effort":null,"rank":14,"raw_score":1005,"raw_unit":"Elo","ci_low":993,"ci_high":1017,"rank_spread_min":10,"rank_spread_max":20,"sample_count":3140,"is_preliminary":false,"provider":"ElevenLabs","source_order":14}],"aggregation_source_results":["cloning|Multilingual v2"],"is_preliminary":false},{"model_id":"fish-audio-s2-pro","base_model":"Fish Audio S2 Pro","display_name":"Fish Audio S2 Pro","official_model_id":null,"provider":"Fish Audio","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fish Audio S2 Pro\nOpen Weights","normalized_model_family":"fish-audio-s2-pro","base_model":"Fish Audio S2 Pro","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1003,"raw_unit":"Elo","ci_low":991,"ci_high":1015,"rank_spread_min":11,"rank_spread_max":20,"sample_count":3765,"is_preliminary":false,"provider":"Fish Audio","source_order":15}],"aggregation_source_results":["cloning|Fish Audio S2 Pro\nOpen Weights"],"is_preliminary":false}],"candidate_count":33,"ranking":[{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1123,"raw_unit":"Elo","ci_low":1107,"ci_high":1139,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1292,"is_preliminary":false,"provider":"Inworld","source_order":1}],"aggregation_source_results":["cloning|Realtime TTS-2"],"is_preliminary":false,"rank":1,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Realtime TTS-2","Realtime TTS-2"]},{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1119,"raw_unit":"Elo","ci_low":1104,"ci_high":1134,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1993,"is_preliminary":false,"provider":"Cartesia","source_order":2}],"aggregation_source_results":["cloning|Sonic 3.6"],"is_preliminary":false,"rank":2,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Sonic 3.6","Sonic 3.6"]},{"model_id":"sonic-3-5","base_model":"Sonic 3.5","display_name":"Sonic 3.5","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.5","normalized_model_family":"sonic-3-5","base_model":"Sonic 3.5","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1096,"raw_unit":"Elo","ci_low":1084,"ci_high":1108,"rank_spread_min":3,"rank_spread_max":3,"sample_count":3791,"is_preliminary":false,"provider":"Cartesia","source_order":3}],"aggregation_source_results":["cloning|Sonic 3.5"],"is_preliminary":false,"rank":3,"modelId":"sonic-3-5","modelName":"Sonic 3.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:sonic-3-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Sonic 3.5","Sonic 3.5"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1123,"raw_unit":"Elo","ci_low":1107,"ci_high":1139,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1292,"is_preliminary":false,"provider":"Inworld","source_order":1}],"aggregation_source_results":["cloning|Realtime TTS-2"],"is_preliminary":false,"rank":1,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Realtime TTS-2","Realtime TTS-2"]},{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1119,"raw_unit":"Elo","ci_low":1104,"ci_high":1134,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1993,"is_preliminary":false,"provider":"Cartesia","source_order":2}],"aggregation_source_results":["cloning|Sonic 3.6"],"is_preliminary":false,"rank":2,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Sonic 3.6","Sonic 3.6"]},{"model_id":"sonic-3-5","base_model":"Sonic 3.5","display_name":"Sonic 3.5","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.5","normalized_model_family":"sonic-3-5","base_model":"Sonic 3.5","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1096,"raw_unit":"Elo","ci_low":1084,"ci_high":1108,"rank_spread_min":3,"rank_spread_max":3,"sample_count":3791,"is_preliminary":false,"provider":"Cartesia","source_order":3}],"aggregation_source_results":["cloning|Sonic 3.5"],"is_preliminary":false,"rank":3,"modelId":"sonic-3-5","modelName":"Sonic 3.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:sonic-3-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Sonic 3.5","Sonic 3.5"]}]}],"deepLink":"https://lll.bz/llm?task=voice-cloning"},{"id":"code-reasoning","title":"Code reasoning","name":"Code reasoning","description":"Objective coding problems without a terminal agent harness.","category":"code","sourceName":"LiveBench","sourceUrl":"https://livebench.ai/","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["lb-Coding"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5-1","confidence":"medium","disagreement_status":"clear_winner","independent_source_count":1,"source_coverage":1,"family_weights":{"LiveBench":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":86.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["lb-Coding|Claude Fable 5.1 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":86,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["lb-Coding|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":83.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["lb-Coding|GPT-5.6 Sol Max Effort"],"is_preliminary":false,"rank":3,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"gpt-5-2-codex","base_model":"GPT-5.2 Codex","display_name":"GPT-5.2 Codex","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.2 Codex","normalized_model_family":"gpt-5-2-codex","base_model":"GPT-5.2 Codex","variant":null,"reasoning_effort":null,"rank":4,"raw_score":83.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":4}],"aggregation_source_results":["lb-Coding|GPT-5.2 Codex"],"is_preliminary":false},{"model_id":"gpt-5-6-luna","base_model":"GPT-5.6 Luna","display_name":"GPT-5.6 Luna","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Luna Max Effort","normalized_model_family":"gpt-5-6-luna","base_model":"GPT-5.6 Luna","variant":"Max","reasoning_effort":"max","rank":5,"raw_score":82.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":5}],"aggregation_source_results":["lb-Coding|GPT-5.6 Luna Max Effort"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5 Thinking xHigh Effort","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":6,"raw_score":82.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":6}],"aggregation_source_results":["lb-Coding|GPT-5.5 Thinking xHigh Effort"],"is_preliminary":false},{"model_id":"claude-4-7-opus","base_model":"Claude 4.7 Opus","display_name":"Claude 4.7 Opus","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 4.7 Opus Thinking xHigh Effort","normalized_model_family":"claude-4-7-opus","base_model":"Claude 4.7 Opus","variant":"Xhigh","reasoning_effort":"xhigh","rank":6,"raw_score":82.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["lb-Coding|Claude 4.7 Opus Thinking xHigh Effort"],"is_preliminary":false},{"model_id":"claude-4-8-opus","base_model":"Claude 4.8 Opus","display_name":"Claude 4.8 Opus","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 4.8 Opus Thinking Max Effort","normalized_model_family":"claude-4-8-opus","base_model":"Claude 4.8 Opus","variant":"Max","reasoning_effort":"max","rank":8,"raw_score":81.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":8}],"aggregation_source_results":["lb-Coding|Claude 4.8 Opus Thinking Max Effort"],"is_preliminary":false},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 5 Opus Thinking Max Effort","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":9,"raw_score":81.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["lb-Coding|Claude 5 Opus Thinking Max Effort"],"is_preliminary":false},{"model_id":"kimi-k3-open","base_model":"Kimi K3\nopen","display_name":"Kimi K3\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi K3\nopen","normalized_model_family":"kimi-k3-open","base_model":"Kimi K3\nopen","variant":null,"reasoning_effort":null,"rank":9,"raw_score":81.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["lb-Coding|Kimi K3\nopen"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Muse Spark 1.3 xHigh Effort","normalized_model_family":"muse-spark-1-3","base_model":"Muse Spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":11,"raw_score":81.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":11}],"aggregation_source_results":["lb-Coding|Muse Spark 1.3 xHigh Effort"],"is_preliminary":false},{"model_id":"claude-sonnet-5","base_model":"Claude Sonnet 5","display_name":"Claude Sonnet 5","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Sonnet 5 xHigh Effort","normalized_model_family":"claude-sonnet-5","base_model":"Claude Sonnet 5","variant":"Xhigh","reasoning_effort":"xhigh","rank":12,"raw_score":80.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":12}],"aggregation_source_results":["lb-Coding|Claude Sonnet 5 xHigh Effort"],"is_preliminary":false},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":13,"raw_score":80.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":13}],"aggregation_source_results":["lb-Coding|GPT-6 Astra Max Effort"],"is_preliminary":false},{"model_id":"glm-5-2-open","base_model":"GLM-5.2\nopen","display_name":"GLM-5.2\nopen","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GLM-5.2\nopen","normalized_model_family":"glm-5-2-open","base_model":"GLM-5.2\nopen","variant":null,"reasoning_effort":null,"rank":14,"raw_score":79.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":14}],"aggregation_source_results":["lb-Coding|GLM-5.2\nopen"],"is_preliminary":false},{"model_id":"claude-4-5-opus","base_model":"Claude 4.5 Opus","display_name":"Claude 4.5 Opus","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude 4.5 Opus Thinking High Effort","normalized_model_family":"claude-4-5-opus","base_model":"Claude 4.5 Opus","variant":"High","reasoning_effort":"high","rank":14,"raw_score":79.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":15}],"aggregation_source_results":["lb-Coding|Claude 4.5 Opus Thinking High Effort"],"is_preliminary":false}],"candidate_count":48,"ranking":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":86.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["lb-Coding|Claude Fable 5.1 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","Claude Fable 5.1 Max Effort"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":86,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["lb-Coding|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","Claude Fable 5 Max Effort"]},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":83.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["lb-Coding|GPT-5.6 Sol Max Effort"],"is_preliminary":false,"rank":3,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.6 Sol","GPT-5.6 Sol Max Effort"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":86.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["lb-Coding|Claude Fable 5.1 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","Claude Fable 5.1 Max Effort"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":86,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["lb-Coding|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","Claude Fable 5 Max Effort"]},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.6 Sol Max Effort","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":83.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":3}],"aggregation_source_results":["lb-Coding|GPT-5.6 Sol Max Effort"],"is_preliminary":false,"rank":3,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-5.6 Sol","GPT-5.6 Sol Max Effort"]}]}],"deepLink":"https://lll.bz/llm?task=code-reasoning"},{"id":"reference-design","title":"Reference-based frontend design","name":"Reference-based frontend design","description":"Recreate a frontend from a design reference; separate from general WebDev.","category":"code","sourceName":"Arena","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","sourceDate":"2026-09-05","checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["arena-reference"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5-1","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Arena":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1815,"raw_unit":"Elo","ci_low":1773,"ci_high":1857,"rank_spread_min":1,"rank_spread_max":2,"sample_count":366,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-reference|claude-fable-5.1-max"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1785,"raw_unit":"Elo","ci_low":1731,"ci_high":1839,"rank_spread_min":1,"rank_spread_max":3,"sample_count":220,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-reference|gpt-6-astra-max"],"is_preliminary":false,"rank":2,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1723,"raw_unit":"Elo","ci_low":1695,"ci_high":1751,"rank_spread_min":2,"rank_spread_max":8,"sample_count":777,"is_preliminary":false,"provider":"Moonshot","source_order":3}],"aggregation_source_results":["arena-reference|kimi-k3-max"],"is_preliminary":false,"rank":3,"modelId":"kimi-k3","modelName":"Kimi K3 Max","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:kimi-k3","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-max","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"Max","reasoning_effort":"max","rank":4,"raw_score":1709,"raw_unit":"Elo","ci_low":1693,"ci_high":1725,"rank_spread_min":3,"rank_spread_max":8,"sample_count":2157,"is_preliminary":false,"provider":"Anthropic","source_order":4},{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":7,"raw_score":1680,"raw_unit":"Elo","ci_low":1665,"ci_high":1695,"rank_spread_min":3,"rank_spread_max":12,"sample_count":2134,"is_preliminary":false,"provider":"Anthropic","source_order":7}],"aggregation_source_results":["arena-reference|claude-opus-5-max"],"is_preliminary":false},{"model_id":"qwen3-8-max-0902","base_model":"qwen3.8 max 0902","display_name":"qwen3.8 max 0902","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max-0902","normalized_model_family":"qwen3-8-max-0902","base_model":"qwen3.8 max 0902","variant":null,"reasoning_effort":null,"rank":5,"raw_score":1687,"raw_unit":"Elo","ci_low":1648,"ci_high":1726,"rank_spread_min":3,"rank_spread_max":14,"sample_count":335,"is_preliminary":true,"provider":"Alibaba","source_order":5}],"aggregation_source_results":["arena-reference|qwen3.8-max-0902"],"is_preliminary":true},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.35620719,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-max","normalized_model_family":"qwen3-8-max","base_model":"qwen3.8 max","variant":null,"reasoning_effort":null,"rank":6,"raw_score":1684,"raw_unit":"Elo","ci_low":1655,"ci_high":1713,"rank_spread_min":3,"rank_spread_max":13,"sample_count":600,"is_preliminary":true,"provider":"Alibaba","source_order":6}],"aggregation_source_results":["arena-reference|qwen3.8-max"],"is_preliminary":true},{"model_id":"hy4-preview","base_model":"hy4 preview","display_name":"hy4 preview","official_model_id":null,"provider":"Tencent","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"hy4-preview","normalized_model_family":"hy4-preview","base_model":"hy4 preview","variant":null,"reasoning_effort":null,"rank":8,"raw_score":1665,"raw_unit":"Elo","ci_low":1626,"ci_high":1704,"rank_spread_min":3,"rank_spread_max":17,"sample_count":271,"is_preliminary":true,"provider":"Tencent","source_order":8}],"aggregation_source_results":["arena-reference|hy4-preview"],"is_preliminary":true},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.30103,"mean_rank":9,"median_rank":9,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":9,"raw_score":1653,"raw_unit":"Elo","ci_low":1638,"ci_high":1668,"rank_spread_min":5,"rank_spread_max":15,"sample_count":2162,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-reference|claude-fable-5"],"is_preliminary":false},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh (codex-harness)","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":10,"raw_score":1649,"raw_unit":"Elo","ci_low":1634,"ci_high":1664,"rank_spread_min":6,"rank_spread_max":16,"sample_count":2109,"is_preliminary":false,"provider":"OpenAI","source_order":10}],"aggregation_source_results":["arena-reference|gpt-5.6-sol-xhigh (codex-harness)"],"is_preliminary":false},{"model_id":"qwen3-8-flash-next","base_model":"qwen3.8 flash next","display_name":"qwen3.8 flash next","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-flash-next","normalized_model_family":"qwen3-8-flash-next","base_model":"qwen3.8 flash next","variant":null,"reasoning_effort":null,"rank":11,"raw_score":1645,"raw_unit":"Elo","ci_low":1610,"ci_high":1680,"rank_spread_min":5,"rank_spread_max":19,"sample_count":374,"is_preliminary":true,"provider":"Alibaba","source_order":11}],"aggregation_source_results":["arena-reference|qwen3.8-flash-next"],"is_preliminary":true},{"model_id":"grok-4-6","base_model":"Grok 4.6","display_name":"Grok 4.6","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.6-high","normalized_model_family":"grok-4-6","base_model":"grok 4.6","variant":"High","reasoning_effort":"high","rank":12,"raw_score":1639,"raw_unit":"Elo","ci_low":1612,"ci_high":1666,"rank_spread_min":5,"rank_spread_max":19,"sample_count":616,"is_preliminary":false,"provider":"SpaceXAI","source_order":12}],"aggregation_source_results":["arena-reference|grok-4.6-high"],"is_preliminary":false},{"model_id":"muse-spark-1-3","base_model":"muse spark 1.3","display_name":"muse spark 1.3","official_model_id":null,"provider":"Meta","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"muse-spark-1.3 (xHigh)","normalized_model_family":"muse-spark-1-3","base_model":"muse spark 1.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":13,"raw_score":1636,"raw_unit":"Elo","ci_low":1590,"ci_high":1682,"rank_spread_min":5,"rank_spread_max":24,"sample_count":226,"is_preliminary":false,"provider":"Meta","source_order":13}],"aggregation_source_results":["arena-reference|muse-spark-1.3 (xHigh)"],"is_preliminary":false},{"model_id":"glm-5-3","base_model":"glm 5.3","display_name":"glm 5.3","official_model_id":null,"provider":"Z.ai","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.25595802,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-max","normalized_model_family":"glm-5-3","base_model":"glm 5.3","variant":"Max","reasoning_effort":"max","rank":14,"raw_score":1626,"raw_unit":"Elo","ci_low":1597,"ci_high":1655,"rank_spread_min":7,"rank_spread_max":21,"sample_count":549,"is_preliminary":false,"provider":"Z.ai","source_order":14}],"aggregation_source_results":["arena-reference|glm-5.3-max"],"is_preliminary":false},{"model_id":"glm-5-3-flash","base_model":"glm 5.3 flash","display_name":"glm 5.3 flash","official_model_id":null,"provider":"Z.ai","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25,"mean_rank":15,"median_rank":15,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"glm-5.3-flash","normalized_model_family":"glm-5-3-flash","base_model":"glm 5.3 flash","variant":null,"reasoning_effort":null,"rank":15,"raw_score":1612,"raw_unit":"Elo","ci_low":1577,"ci_high":1647,"rank_spread_min":8,"rank_spread_max":26,"sample_count":363,"is_preliminary":false,"provider":"Z.ai","source_order":15}],"aggregation_source_results":["arena-reference|glm-5.3-flash"],"is_preliminary":false},{"model_id":"qwen3-8-27b","base_model":"qwen3.8 27b","display_name":"qwen3.8 27b","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.24465054,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"qwen3.8-27b","normalized_model_family":"qwen3-8-27b","base_model":"qwen3.8 27b","variant":null,"reasoning_effort":null,"rank":16,"raw_score":1611,"raw_unit":"Elo","ci_low":1585,"ci_high":1637,"rank_spread_min":9,"rank_spread_max":24,"sample_count":635,"is_preliminary":false,"provider":"Alibaba","source_order":16}],"aggregation_source_results":["arena-reference|qwen3.8-27b"],"is_preliminary":false}],"candidate_count":96,"ranking":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1815,"raw_unit":"Elo","ci_low":1773,"ci_high":1857,"rank_spread_min":1,"rank_spread_max":2,"sample_count":366,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-reference|claude-fable-5.1-max"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max"]},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1785,"raw_unit":"Elo","ci_low":1731,"ci_high":1839,"rank_spread_min":1,"rank_spread_max":3,"sample_count":220,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-reference|gpt-6-astra-max"],"is_preliminary":false,"rank":2,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","gpt-6-astra-max"]},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1723,"raw_unit":"Elo","ci_low":1695,"ci_high":1751,"rank_spread_min":2,"rank_spread_max":8,"sample_count":777,"is_preliminary":false,"provider":"Moonshot","source_order":3}],"aggregation_source_results":["arena-reference|kimi-k3-max"],"is_preliminary":false,"rank":3,"modelId":"kimi-k3","modelName":"Kimi K3 Max","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:kimi-k3","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Kimi K3 Max","kimi-k3-max"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1815,"raw_unit":"Elo","ci_low":1773,"ci_high":1857,"rank_spread_min":1,"rank_spread_max":2,"sample_count":366,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-reference|claude-fable-5.1-max"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","claude-fable-5.1-max"]},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.63092975,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":1785,"raw_unit":"Elo","ci_low":1731,"ci_high":1839,"rank_spread_min":1,"rank_spread_max":3,"sample_count":220,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-reference|gpt-6-astra-max"],"is_preliminary":false,"rank":2,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.631","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-6 Astra","gpt-6-astra-max"]},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"kimi-k3-max","normalized_model_family":"kimi-k3","base_model":"kimi k3","variant":"Max","reasoning_effort":"max","rank":3,"raw_score":1723,"raw_unit":"Elo","ci_low":1695,"ci_high":1751,"rank_spread_min":2,"rank_spread_max":8,"sample_count":777,"is_preliminary":false,"provider":"Moonshot","source_order":3}],"aggregation_source_results":["arena-reference|kimi-k3-max"],"is_preliminary":false,"rank":3,"modelId":"kimi-k3","modelName":"Kimi K3 Max","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.500","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:kimi-k3","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Kimi K3 Max","kimi-k3-max"]}]}],"deepLink":"https://lll.bz/llm?task=reference-design"},{"id":"repo-refactoring","title":"Repository refactoring","name":"Repository refactoring","description":"Restructure repositories while preserving behavior, using the stated agent harness.","category":"code","sourceName":"Scale Labs","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["scale-refactor"],"consensus":{"method":"weighted_reciprocal_rank","winner":"claude-fable-5-1","confidence":"medium","disagreement_status":"statistical_tie","independent_source_count":1,"source_coverage":1,"family_weights":{"Scale Labs":1},"ci_overlap":true,"winner_disagreement":false},"models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5.1 (Claude Code) xHigh","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":56.67,"raw_unit":"percent","ci_low":50.150000000000006,"ci_high":63.19,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["scale-refactor|Fable-5.1 (Claude Code) xHigh"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5 (Claude Code) xHigh","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":54.76,"raw_unit":"percent","ci_low":48,"ci_high":61.519999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["scale-refactor|Fable-5 (Claude Code) xHigh"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus-4.7 (Claude Code)","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":1,"raw_score":48.57,"raw_unit":"percent","ci_low":41.84,"ci_high":55.3,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["scale-refactor|Opus-4.7 (Claude Code)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus 4.8 (Claude Code)","normalized_model_family":"claude-opus-4-8","base_model":"Claude Opus 4.8","variant":null,"reasoning_effort":null,"rank":1,"raw_score":46.67,"raw_unit":"percent","ci_low":39.92,"ci_high":53.42,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":4}],"aggregation_source_results":["scale-refactor|Opus 4.8 (Claude Code)"],"is_preliminary":false},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-5.5 (Codex) xHigh","normalized_model_family":"gpt-5-5","base_model":"GPT-5.5","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":44.79,"raw_unit":"percent","ci_low":38.03,"ci_high":51.55,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["scale-refactor|GPT-5.5 (Codex) xHigh"],"is_preliminary":false},{"model_id":"gpt-5-4","base_model":"GPT-5.4","display_name":"GPT-5.4","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT 5.4 (Codex) xHigh","normalized_model_family":"gpt-5-4","base_model":"GPT-5.4","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":44.29,"raw_unit":"percent","ci_low":37.53,"ci_high":51.05,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":6}],"aggregation_source_results":["scale-refactor|GPT 5.4 (Codex) xHigh"],"is_preliminary":false},{"model_id":"glm-5-2","base_model":"GLM 5.2","display_name":"GLM 5.2","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GLM 5.2 (Mini-SWE-Agent)","normalized_model_family":"glm-5-2","base_model":"GLM 5.2","variant":null,"reasoning_effort":null,"rank":1,"raw_score":42.38,"raw_unit":"percent","ci_low":35.620000000000005,"ci_high":49.14,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":7}],"aggregation_source_results":["scale-refactor|GLM 5.2 (Mini-SWE-Agent)"],"is_preliminary":false},{"model_id":"gpt-5-3","base_model":"GPT-5.3","display_name":"GPT-5.3","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT 5.3 (Codex) xHigh","normalized_model_family":"gpt-5-3","base_model":"GPT-5.3","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":42.38,"raw_unit":"percent","ci_low":35.620000000000005,"ci_high":49.14,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":8}],"aggregation_source_results":["scale-refactor|GPT 5.3 (Codex) xHigh"],"is_preliminary":false},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus-4.6 (Claude Code)","normalized_model_family":"claude-opus-4-6","base_model":"Claude Opus 4.6","variant":null,"reasoning_effort":null,"rank":3,"raw_score":35.58,"raw_unit":"percent","ci_low":28.759999999999998,"ci_high":42.4,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":9}],"aggregation_source_results":["scale-refactor|Opus-4.6 (Claude Code)"],"is_preliminary":false},{"model_id":"gemini-3-1-pro","base_model":"Gemini-3.1-Pro","display_name":"Gemini-3.1-Pro","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.43067656,"mean_rank":4,"median_rank":4,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini-3.1-Pro (Gemini CLI)","normalized_model_family":"gemini-3-1-pro","base_model":"Gemini-3.1-Pro","variant":null,"reasoning_effort":null,"rank":4,"raw_score":33.81,"raw_unit":"percent","ci_low":27.17,"ci_high":40.45,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":10}],"aggregation_source_results":["scale-refactor|Gemini-3.1-Pro (Gemini CLI)"],"is_preliminary":false},{"model_id":"claude-sonnet-4-6","base_model":"Claude Sonnet-4.6","display_name":"Claude Sonnet-4.6","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.38685281,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonnet-4.6 (Claude Code)","normalized_model_family":"claude-sonnet-4-6","base_model":"Claude Sonnet-4.6","variant":null,"reasoning_effort":null,"rank":5,"raw_score":32.21,"raw_unit":"percent","ci_low":25.44,"ci_high":38.980000000000004,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":11}],"aggregation_source_results":["scale-refactor|Sonnet-4.6 (Claude Code)"],"is_preliminary":false},{"model_id":"glm-5","base_model":"Glm-5","display_name":"Glm-5","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.31546488,"mean_rank":8,"median_rank":8,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Glm-5 (Mini-SWE-Agent)","normalized_model_family":"glm-5","base_model":"Glm-5","variant":null,"reasoning_effort":null,"rank":8,"raw_score":24.24,"raw_unit":"percent","ci_low":17.97,"ci_high":30.509999999999998,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":12}],"aggregation_source_results":["scale-refactor|Glm-5 (Mini-SWE-Agent)"],"is_preliminary":false},{"model_id":"kimi-k2-5","base_model":"Kimi-K2.5","display_name":"Kimi-K2.5","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.28906483,"mean_rank":10,"median_rank":10,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Kimi-K2.5 (Mini-SWE-Agent)","normalized_model_family":"kimi-k2-5","base_model":"Kimi-K2.5","variant":null,"reasoning_effort":null,"rank":10,"raw_score":20.95,"raw_unit":"percent","ci_low":14.95,"ci_high":26.95,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":13}],"aggregation_source_results":["scale-refactor|Kimi-K2.5 (Mini-SWE-Agent)"],"is_preliminary":false},{"model_id":"minimax-m2-5","base_model":"Minimax-M2.5","display_name":"Minimax-M2.5","official_model_id":null,"provider":null,"variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27894295,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax-M2.5 (Mini-SWE-Agent)","normalized_model_family":"minimax-m2-5","base_model":"Minimax-M2.5","variant":null,"reasoning_effort":null,"rank":11,"raw_score":19.52,"raw_unit":"percent","ci_low":13.629999999999999,"ci_high":25.41,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":14}],"aggregation_source_results":["scale-refactor|Minimax-M2.5 (Mini-SWE-Agent)"],"is_preliminary":false},{"model_id":"gemini-3-flash","base_model":"Gemini-3-Flash","display_name":"Gemini-3-Flash","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini-3-Flash (Mini-SWE-Agent)","normalized_model_family":"gemini-3-flash","base_model":"Gemini-3-Flash","variant":null,"reasoning_effort":null,"rank":13,"raw_score":10,"raw_unit":"percent","ci_low":5.2,"ci_high":14.8,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":15}],"aggregation_source_results":["scale-refactor|Gemini-3-Flash (Mini-SWE-Agent)"],"is_preliminary":false}],"candidate_count":12,"ranking":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5.1 (Claude Code) xHigh","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":56.67,"raw_unit":"percent","ci_low":50.150000000000006,"ci_high":63.19,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["scale-refactor|Fable-5.1 (Claude Code) xHigh"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","Fable-5.1 (Claude Code) xHigh"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5 (Claude Code) xHigh","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":54.76,"raw_unit":"percent","ci_low":48,"ci_high":61.519999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["scale-refactor|Fable-5 (Claude Code) xHigh"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","Fable-5 (Claude Code) xHigh"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus-4.7 (Claude Code)","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":1,"raw_score":48.57,"raw_unit":"percent","ci_low":41.84,"ci_high":55.3,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["scale-refactor|Opus-4.7 (Claude Code)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.7","Opus-4.7 (Claude Code)"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5.1 (Claude Code) xHigh","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":56.67,"raw_unit":"percent","ci_low":50.150000000000006,"ci_high":63.19,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["scale-refactor|Fable-5.1 (Claude Code) xHigh"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5.1","Fable-5.1 (Claude Code) xHigh"]},{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5 (Claude Code) xHigh","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":54.76,"raw_unit":"percent","ci_low":48,"ci_high":61.519999999999996,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":2}],"aggregation_source_results":["scale-refactor|Fable-5 (Claude Code) xHigh"],"is_preliminary":false,"rank":2,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Fable 5","Fable-5 (Claude Code) xHigh"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Opus-4.7 (Claude Code)","normalized_model_family":"claude-opus-4-7","base_model":"Claude Opus 4.7","variant":null,"reasoning_effort":null,"rank":1,"raw_score":48.57,"raw_unit":"percent","ci_low":41.84,"ci_high":55.3,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":3}],"aggregation_source_results":["scale-refactor|Opus-4.7 (Claude Code)"],"is_preliminary":false,"rank":3,"modelId":"claude-opus-4-7","modelName":"Claude Opus 4.7","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-opus-4-7","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Claude Opus 4.7","Opus-4.7 (Claude Code)"]}]}],"deepLink":"https://lll.bz/llm?task=repo-refactoring"},{"id":"voice-conversation","title":"Realtime voice conversation","name":"Realtime voice conversation","description":"Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context.","category":"audio","sourceName":"Artificial Analysis","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","sourceDate":null,"checkedAt":"2026-09-07","freshness":"live","metricName":"Rank consensus","metricHint":"Weighted mean of 1 / log2(source rank + 1); higher is better.","metric_direction":"higher_is_better","source_metric_direction":"higher_is_better","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","last_verified_at":"2026-09-07T10:16:44.291125+00:00","source_ids":["voice-3","voice-4"],"consensus":{"method":"weighted_reciprocal_rank","winner":"qwen-audio-3-0-realtime-plus","confidence":"medium","disagreement_status":"source_split","independent_source_count":1,"source_coverage":1,"family_weights":{"Artificial Analysis":1},"ci_overlap":false,"winner_disagreement":false},"models":[{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":99,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":98.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Plus","voice-4|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":1,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","display_name":"Qwen Audio 3.0 Realtime Flash","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.47319732,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":8,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":3},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":96.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":2}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Flash","voice-4|Qwen Audio 3.0 Realtime Flash"],"is_preliminary":false,"rank":2,"modelId":"qwen-audio-3-0-realtime-flash","modelName":"Qwen Audio 3.0 Realtime Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.473","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-flash","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 5.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition."},{"model_id":"gpt-realtime-2","base_model":"GPT-Realtime-2","display_name":"GPT-Realtime-2","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":4,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":18},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":10,"raw_score":93,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":20},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":19,"raw_score":72,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":25},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":7,"raw_score":95.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":14},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":8,"raw_score":95.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":16},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":3,"raw_score":96.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":21}],"aggregation_source_results":["voice-3|GPT-Realtime-2 (High)","voice-4|GPT-Realtime-2 (Minimal)"],"is_preliminary":false,"rank":3,"modelId":"gpt-realtime-2","modelName":"GPT-Realtime-2","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:gpt-realtime-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition."}],"pending_evaluation":[],"candidates":[{"model_id":"qwen3-5-omni-plus-realtime","base_model":"Qwen3.5 Omni Plus Realtime","display_name":"Qwen3.5 Omni Plus Realtime","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen3.5 Omni Plus Realtime","normalized_model_family":"qwen3-5-omni-plus-realtime","base_model":"Qwen3.5 Omni Plus Realtime","variant":null,"reasoning_effort":null,"rank":1,"raw_score":99,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"99%","Conversational Dynamics %":"-","Agentic Performance %":"-","Arena Preference Elo":"799","Task Success Rate %":"62.0%","Time to First Audio Seconds":"2.64"},"source_order":2}],"aggregation_source_results":["voice-3|Qwen3.5 Omni Plus Realtime"],"is_preliminary":false},{"model_id":"step-audio-r1-1","base_model":"Step-Audio R1.1","display_name":"Step-Audio R1.1","official_model_id":null,"provider":"StepFun","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.5,"mean_rank":3,"median_rank":3,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Step-Audio R1.1 (Realtime)","normalized_model_family":"step-audio-r1-1","base_model":"Step-Audio R1.1","variant":null,"reasoning_effort":null,"rank":3,"raw_score":98,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"StepFun","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"98%","Conversational Dynamics %":"-","Agentic Performance %":"-","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.53"},"source_order":33}],"aggregation_source_results":["voice-3|Step-Audio R1.1 (Realtime)"],"is_preliminary":false},{"model_id":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","display_name":"GPT-Realtime-2.1","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.37307072,"mean_rank":6,"median_rank":6,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 High","normalized_model_family":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","variant":"High","reasoning_effort":"high","rank":8,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.9%","Speech Reasoning %":"96%","Conversational Dynamics %":"95.7%","Agentic Performance %":"45.7%","Arena Preference Elo":"892","Task Success Rate %":"91.5%","Time to First Audio Seconds":"1.21"},"source_order":19},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 Minimal","normalized_model_family":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","variant":"Minimal","reasoning_effort":"minimal","rank":14,"raw_score":87,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"70.3%","Speech Reasoning %":"87%","Conversational Dynamics %":"92.7%","Agentic Performance %":"38.0%","Arena Preference Elo":"896","Task Success Rate %":"89.4%","Time to First Audio Seconds":"0.97"},"source_order":21},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 High","normalized_model_family":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","variant":"High","reasoning_effort":"high","rank":4,"raw_score":95.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.9%","Speech Reasoning %":"96%","Conversational Dynamics %":"95.7%","Agentic Performance %":"45.7%","Arena Preference Elo":"892","Task Success Rate %":"91.5%","Time to First Audio Seconds":"1.21"},"source_order":15},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2.1 Minimal","normalized_model_family":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","variant":"Minimal","reasoning_effort":"minimal","rank":12,"raw_score":92.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"70.3%","Speech Reasoning %":"87%","Conversational Dynamics %":"92.7%","Agentic Performance %":"38.0%","Arena Preference Elo":"896","Task Success Rate %":"89.4%","Time to First Audio Seconds":"0.97"},"source_order":17}],"aggregation_source_results":["voice-3|GPT-Realtime-2.1 High","voice-4|GPT-Realtime-2.1 High"],"is_preliminary":false},{"model_id":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","display_name":"Grok Voice Think Fast 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.36585328,"mean_rank":6.5,"median_rank":6.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 2.0 High","normalized_model_family":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","variant":"High","reasoning_effort":"high","rank":4,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"79.0%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.1%","Agentic Performance %":"56.5%","Arena Preference Elo":"908","Task Success Rate %":"94.7%","Time to First Audio Seconds":"0.70"},"source_order":30},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 2.0 High","normalized_model_family":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","variant":"High","reasoning_effort":"high","rank":9,"raw_score":95.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"79.0%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.1%","Agentic Performance %":"56.5%","Arena Preference Elo":"908","Task Success Rate %":"94.7%","Time to First Audio Seconds":"0.70"},"source_order":25}],"aggregation_source_results":["voice-3|Grok Voice Think Fast 2.0 High","voice-4|Grok Voice Think Fast 2.0 High"],"is_preliminary":false},{"model_id":"gpt-realtime-1-5","base_model":"GPT-Realtime-1.5","display_name":"GPT-Realtime-1.5","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33524451,"mean_rank":10.5,"median_rank":10.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-1.5","normalized_model_family":"gpt-realtime-1-5","base_model":"GPT-Realtime-1.5","variant":null,"reasoning_effort":null,"rank":17,"raw_score":81,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"70.3%","Speech Reasoning %":"81%","Conversational Dynamics %":"95.7%","Agentic Performance %":"38.8%","Arena Preference Elo":"1000","Task Success Rate %":"85.1%","Time to First Audio Seconds":"0.81"},"source_order":23},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-1.5","normalized_model_family":"gpt-realtime-1-5","base_model":"GPT-Realtime-1.5","variant":null,"reasoning_effort":null,"rank":4,"raw_score":95.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"70.3%","Speech Reasoning %":"81%","Conversational Dynamics %":"95.7%","Agentic Performance %":"38.8%","Arena Preference Elo":"1000","Task Success Rate %":"85.1%","Time to First Audio Seconds":"0.81"},"source_order":19}],"aggregation_source_results":["voice-3|GPT-Realtime-1.5","voice-4|GPT-Realtime-1.5"],"is_preliminary":false},{"model_id":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","display_name":"Grok Voice Think Fast 1.0","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.33304274,"mean_rank":11,"median_rank":11,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 1.0","normalized_model_family":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","variant":null,"reasoning_effort":null,"rank":4,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"72.3%","Speech Reasoning %":"97%","Conversational Dynamics %":"77.8%","Agentic Performance %":"52.1%","Arena Preference Elo":"839","Task Success Rate %":"80.7%","Time to First Audio Seconds":"1.25"},"source_order":31},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 1.0","normalized_model_family":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","variant":null,"reasoning_effort":null,"rank":18,"raw_score":77.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"72.3%","Speech Reasoning %":"97%","Conversational Dynamics %":"77.8%","Agentic Performance %":"52.1%","Arena Preference Elo":"839","Task Success Rate %":"80.7%","Time to First Audio Seconds":"1.25"},"source_order":26}],"aggregation_source_results":["voice-3|Grok Voice Think Fast 1.0","voice-4|Grok Voice Think Fast 1.0"],"is_preliminary":false},{"model_id":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","display_name":"Gemini 3.1 Flash Live","official_model_id":null,"provider":"Google","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.33102739,"mean_rank":11.5,"median_rank":11.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash Live High","normalized_model_family":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","variant":"High","reasoning_effort":"high","rank":4,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"71.5%","Speech Reasoning %":"97%","Conversational Dynamics %":"74.3%","Agentic Performance %":"37.7%","Arena Preference Elo":"1014","Task Success Rate %":"71.8%","Time to First Audio Seconds":"2.99"},"source_order":11},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash Live Minimal","normalized_model_family":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","variant":"Minimal","reasoning_effort":"minimal","rank":20,"raw_score":71,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"63.9%","Speech Reasoning %":"71%","Conversational Dynamics %":"72.3%","Agentic Performance %":"26.2%","Arena Preference Elo":"1046","Task Success Rate %":"74.6%","Time to First Audio Seconds":"0.96"},"source_order":13},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash Live High","normalized_model_family":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","variant":"High","reasoning_effort":"high","rank":19,"raw_score":74.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"71.5%","Speech Reasoning %":"97%","Conversational Dynamics %":"74.3%","Agentic Performance %":"37.7%","Arena Preference Elo":"1014","Task Success Rate %":"71.8%","Time to First Audio Seconds":"2.99"},"source_order":7},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 3.1 Flash Live Minimal","normalized_model_family":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","variant":"Minimal","reasoning_effort":"minimal","rank":21,"raw_score":72.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"63.9%","Speech Reasoning %":"71%","Conversational Dynamics %":"72.3%","Agentic Performance %":"26.2%","Arena Preference Elo":"1046","Task Success Rate %":"74.6%","Time to First Audio Seconds":"0.96"},"source_order":8}],"aggregation_source_results":["voice-3|Gemini 3.1 Flash Live High","voice-4|Gemini 3.1 Flash Live High"],"is_preliminary":false},{"model_id":"gpt-realtime-mini","base_model":"GPT Realtime Mini","display_name":"GPT Realtime Mini","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.32300742,"mean_rank":14,"median_rank":14,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Realtime Mini (Oct '25)","normalized_model_family":"gpt-realtime-mini","base_model":"GPT Realtime Mini","variant":null,"reasoning_effort":null,"rank":24,"raw_score":64,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"56.8%","Speech Reasoning %":"64%","Conversational Dynamics %":"95.7%","Agentic Performance %":"15.1%","Arena Preference Elo":"912","Task Success Rate %":"79.6%","Time to First Audio Seconds":"0.81"},"source_order":27},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Realtime Mini (Oct '25)","normalized_model_family":"gpt-realtime-mini","base_model":"GPT Realtime Mini","variant":null,"reasoning_effort":null,"rank":4,"raw_score":95.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"56.8%","Speech Reasoning %":"64%","Conversational Dynamics %":"95.7%","Agentic Performance %":"15.1%","Arena Preference Elo":"912","Task Success Rate %":"79.6%","Time to First Audio Seconds":"0.81"},"source_order":22}],"aggregation_source_results":["voice-3|GPT Realtime Mini (Oct '25)","voice-4|GPT Realtime Mini (Oct '25)"],"is_preliminary":false},{"model_id":"gemini-2-5-flash-native-audio-dialog","base_model":"Gemini 2.5 Flash Native Audio Dialog","display_name":"Gemini 2.5 Flash Native Audio Dialog","official_model_id":null,"provider":"Google","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.27023815,"mean_rank":12,"median_rank":12,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 2.5 Flash Native Audio Dialog Thinking","normalized_model_family":"gemini-2-5-flash-native-audio-dialog","base_model":"Gemini 2.5 Flash Native Audio Dialog","variant":null,"reasoning_effort":null,"rank":12,"raw_score":91,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"91%","Conversational Dynamics %":"-","Agentic Performance %":"-","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"3.87"},"source_order":12},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Gemini 2.5 Flash Native Audio Dialog","normalized_model_family":"gemini-2-5-flash-native-audio-dialog","base_model":"Gemini 2.5 Flash Native Audio Dialog","variant":null,"reasoning_effort":null,"rank":21,"raw_score":69,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Google","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"69%","Conversational Dynamics %":"-","Agentic Performance %":"-","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"0.63"},"source_order":14}],"aggregation_source_results":["voice-3|Gemini 2.5 Flash Native Audio Dialog Thinking"],"is_preliminary":false},{"model_id":"gpt-realtime","base_model":"GPT Realtime","display_name":"GPT Realtime","official_model_id":null,"provider":"OpenAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26685768,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Realtime (Aug '25)","normalized_model_family":"gpt-realtime","base_model":"GPT Realtime","variant":null,"reasoning_effort":null,"rank":16,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"68.5%","Speech Reasoning %":"83%","Conversational Dynamics %":"93.9%","Agentic Performance %":"30.4%","Arena Preference Elo":"944","Task Success Rate %":"89.4%","Time to First Audio Seconds":"0.98"},"source_order":22},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Realtime (Aug '25)","normalized_model_family":"gpt-realtime","base_model":"GPT Realtime","variant":null,"reasoning_effort":null,"rank":10,"raw_score":93.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"68.5%","Speech Reasoning %":"83%","Conversational Dynamics %":"93.9%","Agentic Performance %":"30.4%","Arena Preference Elo":"944","Task Success Rate %":"89.4%","Time to First Audio Seconds":"0.98"},"source_order":18}],"aggregation_source_results":["voice-3|GPT Realtime (Aug '25)","voice-4|GPT Realtime (Aug '25)"],"is_preliminary":false},{"model_id":"nova-2-0-sonic","base_model":"Nova 2.0 Sonic","display_name":"Nova 2.0 Sonic","official_model_id":null,"provider":"Amazon Bedrock","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.26264954,"mean_rank":13,"median_rank":13,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Nova 2.0 Sonic (Mar 2026)","normalized_model_family":"nova-2-0-sonic","base_model":"Nova 2.0 Sonic","variant":null,"reasoning_effort":null,"rank":13,"raw_score":88,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Amazon Bedrock","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"88%","Conversational Dynamics %":"-","Agentic Performance %":"-","Arena Preference Elo":"917","Task Success Rate %":"57.1%","Time to First Audio Seconds":"1.14"},"source_order":7}],"aggregation_source_results":["voice-3|Nova 2.0 Sonic (Mar 2026)"],"is_preliminary":false},{"model_id":"grok-voice-fast-1-0","base_model":"Grok Voice Fast 1.0","display_name":"Grok Voice Fast 1.0","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.25506478,"mean_rank":16,"median_rank":16,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Fast 1.0","normalized_model_family":"grok-voice-fast-1-0","base_model":"Grok Voice Fast 1.0","variant":null,"reasoning_effort":null,"rank":10,"raw_score":93,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"71.6%","Agentic Performance %":"27.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"0.78"},"source_order":32},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Fast 1.0","normalized_model_family":"grok-voice-fast-1-0","base_model":"Grok Voice Fast 1.0","variant":null,"reasoning_effort":null,"rank":22,"raw_score":71.6,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"71.6%","Agentic Performance %":"27.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"0.78"},"source_order":27}],"aggregation_source_results":["voice-3|Grok Voice Fast 1.0","voice-4|Grok Voice Fast 1.0"],"is_preliminary":false}],"candidate_count":27,"ranking":[{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":99,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":98.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Plus","voice-4|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":1,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen Audio 3.0 Realtime Plus","Qwen Audio 3.0 Realtime Plus","Qwen Audio 3.0 Realtime Plus"]},{"model_id":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","display_name":"Qwen Audio 3.0 Realtime Flash","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.47319732,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":8,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":3},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":96.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":2}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Flash","voice-4|Qwen Audio 3.0 Realtime Flash"],"is_preliminary":false,"rank":2,"modelId":"qwen-audio-3-0-realtime-flash","modelName":"Qwen Audio 3.0 Realtime Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.473","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-flash","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 5.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen Audio 3.0 Realtime Flash","Qwen Audio 3.0 Realtime Flash","Qwen Audio 3.0 Realtime Flash"]},{"model_id":"gpt-realtime-2","base_model":"GPT-Realtime-2","display_name":"GPT-Realtime-2","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":4,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":18},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":10,"raw_score":93,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":20},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":19,"raw_score":72,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":25},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":7,"raw_score":95.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":14},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":8,"raw_score":95.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":16},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":3,"raw_score":96.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":21}],"aggregation_source_results":["voice-3|GPT-Realtime-2 (High)","voice-4|GPT-Realtime-2 (Minimal)"],"is_preliminary":false,"rank":3,"modelId":"gpt-realtime-2","modelName":"GPT-Realtime-2","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:gpt-realtime-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-Realtime-2","GPT-Realtime-2 (High)","GPT-Realtime-2 (Medium)","GPT-Realtime-2 (Minimal)","GPT-Realtime-2 (High)","GPT-Realtime-2 (Medium)","GPT-Realtime-2 (Minimal)"]}],"rankingLists":[{"id":"default","label":"Top 3","models":[{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":99,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":98.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Plus","voice-4|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":1,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen Audio 3.0 Realtime Plus","Qwen Audio 3.0 Realtime Plus","Qwen Audio 3.0 Realtime Plus"]},{"model_id":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","display_name":"Qwen Audio 3.0 Realtime Flash","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.47319732,"mean_rank":5,"median_rank":5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":8,"raw_score":96,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":3},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Flash","normalized_model_family":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","variant":null,"reasoning_effort":null,"rank":2,"raw_score":96.9,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"64.2%","Speech Reasoning %":"96%","Conversational Dynamics %":"96.9%","Agentic Performance %":"35.9%","Arena Preference Elo":"752","Task Success Rate %":"81.7%","Time to First Audio Seconds":"1.55"},"source_order":2}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Flash","voice-4|Qwen Audio 3.0 Realtime Flash"],"is_preliminary":false,"rank":2,"modelId":"qwen-audio-3-0-realtime-flash","modelName":"Qwen Audio 3.0 Realtime Flash","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.473","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-flash","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 5.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["Qwen Audio 3.0 Realtime Flash","Qwen Audio 3.0 Realtime Flash","Qwen Audio 3.0 Realtime Flash"]},{"model_id":"gpt-realtime-2","base_model":"GPT-Realtime-2","display_name":"GPT-Realtime-2","official_model_id":null,"provider":"OpenAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":0.46533828,"mean_rank":3.5,"median_rank":3.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":4,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":18},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":10,"raw_score":93,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":20},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":19,"raw_score":72,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":25},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (High)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"High","reasoning_effort":"high","rank":7,"raw_score":95.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"73.6%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.3%","Agentic Performance %":"39.8%","Arena Preference Elo":"914","Task Success Rate %":"89.8%","Time to First Audio Seconds":"1.14"},"source_order":14},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Medium)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Medium","reasoning_effort":"medium","rank":8,"raw_score":95.2,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"-","Speech Reasoning %":"93%","Conversational Dynamics %":"95.2%","Agentic Performance %":"37.4%","Arena Preference Elo":"-","Task Success Rate %":"-","Time to First Audio Seconds":"1.22"},"source_order":16},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-Realtime-2 (Minimal)","normalized_model_family":"gpt-realtime-2","base_model":"GPT-Realtime-2","variant":"Minimal","reasoning_effort":"minimal","rank":3,"raw_score":96.1,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","component_scores":{"Speech to Speech Index %":"62.7%","Speech Reasoning %":"72%","Conversational Dynamics %":"96.1%","Agentic Performance %":"30.8%","Arena Preference Elo":"881","Task Success Rate %":"84.7%","Time to First Audio Seconds":"1.12"},"source_order":21}],"aggregation_source_results":["voice-3|GPT-Realtime-2 (High)","voice-4|GPT-Realtime-2 (Minimal)"],"is_preliminary":false,"rank":3,"modelId":"gpt-realtime-2","modelName":"GPT-Realtime-2","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.465","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:gpt-realtime-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 3.50; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition.","aliases":["GPT-Realtime-2","GPT-Realtime-2 (High)","GPT-Realtime-2 (Medium)","GPT-Realtime-2 (Minimal)","GPT-Realtime-2 (High)","GPT-Realtime-2 (Medium)","GPT-Realtime-2 (Minimal)"]}]}],"deepLink":"https://lll.bz/llm?task=voice-conversation"}],"models":[{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","aliases":["Claude Fable 5 (with fallback)","Claude Fable 5 Max Effort","claude-fable-5"]},{"model_id":"claude-opus-4-6","base_model":"Claude Opus 4.6","display_name":"Claude Opus 4.6","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-6","claude-opus-4-6-high"]},{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","aliases":["Claude Fable 5.1 (high with fallback)","Claude Fable 5.1 (low with fallback)","Claude Fable 5.1 (max with fallback)","Claude Fable 5.1 (medium with fallback)","Claude Fable 5.1 (xhigh with fallback)","Claude Fable 5.1 Max Effort","claude-fable-5.1-max"]},{"model_id":"claude-opus-4-7","base_model":"Claude Opus 4.7","display_name":"Claude Opus 4.7","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-7","claude-opus-4-7-high"]},{"model_id":"muse-spark-1-2","base_model":"Muse Spark 1.2","display_name":"Muse Spark 1.2","official_model_id":null,"provider":"Meta","aliases":["Muse Spark 1.2 (xhigh)","Muse Spark 1.2 xHigh Effort","muse-spark-1.2 (xHigh)"]},{"model_id":"gemini-3-8-flash","base_model":"gemini 3.8 flash","display_name":"gemini 3.8 flash","official_model_id":null,"provider":"Google","aliases":["Gemini 3.8 Flash (high)","Gemini 3.8 Flash (low)","Gemini 3.8 Flash High","gemini-3.8-flash-high"]},{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","aliases":["Claude 5 Opus Thinking Max Effort","Claude Opus 5 (high)","Claude Opus 5 (low)","Claude Opus 5 (max)","Claude Opus 5 (medium)","Claude Opus 5 (xhigh)","claude-opus-5-high","claude-opus-5-max"]},{"model_id":"muse-spark-1-1","base_model":"muse spark 1.1","display_name":"muse spark 1.1","official_model_id":null,"provider":"Meta","aliases":["Muse Spark 1.1 xHigh Effort","muse-spark-1.1"]},{"model_id":"gemini-3-7-flash","base_model":"Gemini 3.7 Flash","display_name":"Gemini 3.7 Flash","official_model_id":null,"provider":"Google","aliases":["Gemini 3.7 Flash (high)","Gemini 3.7 Flash High","gemini-3.7-flash-high"]},{"model_id":"kimi-k3","base_model":"Kimi K3 Max","display_name":"Kimi K3 Max","official_model_id":null,"provider":"Moonshot","aliases":["Kimi K3 (low)","Kimi K3 (max)","kimi-k3-max"]},{"model_id":"muse-spark","base_model":"muse spark","display_name":"muse spark","official_model_id":null,"provider":"Meta","aliases":["muse-spark"]},{"model_id":"gemini-3-1-pro-preview","base_model":"Gemini 3.1 Pro Preview","display_name":"Gemini 3.1 Pro Preview","official_model_id":null,"provider":"Google","aliases":["Gemini 3.1 Pro Preview","Gemini 3.1 Pro Preview High","gemini-3.1-pro-preview"]},{"model_id":"gemini-3-pro","base_model":"gemini 3 pro","display_name":"gemini 3 pro","official_model_id":null,"provider":"Google","aliases":["gemini-3-pro"]},{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.6 Sol (high)","GPT-5.6 Sol (low)","GPT-5.6 Sol (max)","GPT-5.6 Sol (medium)","GPT-5.6 Sol (xhigh)","GPT-5.6 Sol Max Effort","gpt-5.6-sol-xhigh"]},{"model_id":"claude-opus-4-8","base_model":"Claude Opus 4.8","display_name":"Claude Opus 4.8","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-8","claude-opus-4-8-high"]},{"model_id":"gpt-5-5","base_model":"GPT-5.5","display_name":"GPT-5.5","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.5 Thinking xHigh Effort","gpt-5.5","gpt-5.5-high"]},{"model_id":"glm-5-3","base_model":"glm 5.3","display_name":"glm 5.3","official_model_id":null,"provider":"Z.ai","aliases":["GLM-5.3 (max)","glm-5.3-max"]},{"model_id":"gemini-3-6-flash","base_model":"gemini 3.6 flash","display_name":"gemini 3.6 flash","official_model_id":null,"provider":"Google","aliases":["Gemini 3.6 Flash","Gemini 3.6 Flash High","gemini-3.6-flash-high"]},{"model_id":"qwen3-8-max","base_model":"Qwen3.8 Max","display_name":"Qwen3.8 Max","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3.8 Max","qwen3.8-max"]},{"model_id":"gemini-3-5-flash","base_model":"gemini 3.5 flash","display_name":"gemini 3.5 flash","official_model_id":null,"provider":"Google","aliases":["Gemini 3.5 Flash High","gemini-3.5-flash-high","gemini-3.5-flash-medium"]},{"model_id":"gpt-5-4","base_model":"gpt 5.4","display_name":"gpt 5.4","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.4 Thinking xHigh Effort","gpt-5.4","gpt-5.4-high"]},{"model_id":"gpt-5-2-chat-latest-20260210","base_model":"gpt 5.2 chat latest 20260210","display_name":"gpt 5.2 chat latest 20260210","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.2-chat-latest-20260210"]},{"model_id":"grok-4-20-beta1","base_model":"grok 4.20 beta1","display_name":"grok 4.20 beta1","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4.20-beta1"]},{"model_id":"glm-5-3-flash","base_model":"glm 5.3 flash","display_name":"glm 5.3 flash","official_model_id":null,"provider":"Z.ai","aliases":["GLM-5.3-Flash","glm-5.3-flash"]},{"model_id":"gemini-3-flash","base_model":"gemini 3 flash","display_name":"gemini 3 flash","official_model_id":null,"provider":"Google","aliases":["gemini-3-flash","gemini-3-flash (thinking-minimal)"]},{"model_id":"gpt-5-5-instant","base_model":"gpt 5.5 instant","display_name":"gpt 5.5 instant","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.5-instant"]},{"model_id":"qwen3-7-max-preview","base_model":"qwen3.7 max preview","display_name":"qwen3.7 max preview","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.7-max-preview"]},{"model_id":"claude-opus-4-5-20251101-high-32k","base_model":"claude opus 4.5 20251101 high 32k","display_name":"claude opus 4.5 20251101 high 32k","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-5-20251101-high-32k"]},{"model_id":"claude-sonnet-4-6","base_model":"claude sonnet 4.6","display_name":"claude sonnet 4.6","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-6"]},{"model_id":"grok-4-20-beta-0309-reasoning","base_model":"grok 4.20 beta 0309 reasoning","display_name":"grok 4.20 beta 0309 reasoning","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4.20-beta-0309-reasoning"]},{"model_id":"glm-5-2","base_model":"glm 5.2","display_name":"glm 5.2","official_model_id":null,"provider":"Z.ai","aliases":["GLM-5.2 (max)","glm-5.2-max"]},{"model_id":"grok-4-5","base_model":"grok 4.5","display_name":"grok 4.5","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok 4.5","Grok 4.5 (high)","grok-4.5"]},{"model_id":"grok-4-20-multi-agent-beta-0309","base_model":"grok 4.20 multi agent beta 0309","display_name":"grok 4.20 multi agent beta 0309","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4.20-multi-agent-beta-0309"]},{"model_id":"claude-opus-4-5-20251101","base_model":"claude opus 4.5 20251101","display_name":"claude opus 4.5 20251101","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-5-20251101"]},{"model_id":"mimo-v2-5-pro","base_model":"mimo v2.5 pro","display_name":"mimo v2.5 pro","official_model_id":null,"provider":"Xiaomi","aliases":["MiMo-V2.5-Pro","mimo-v2.5-pro"]},{"model_id":"ernie-5-1","base_model":"ernie 5.1","display_name":"ernie 5.1","official_model_id":null,"provider":"Baidu","aliases":["ernie-5.1"]},{"model_id":"gpt-5-6-terra","base_model":"gpt 5.6 terra","display_name":"gpt 5.6 terra","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.6 Terra (high)","GPT-5.6 Terra (max)","GPT-5.6 Terra (xhigh)","GPT-5.6 Terra Max Effort","gpt-5.6-terra-xhigh"]},{"model_id":"glm-5-1","base_model":"glm 5.1","display_name":"glm 5.1","official_model_id":null,"provider":"Z.ai","aliases":["glm-5.1"]},{"model_id":"qwen3-5-max-preview","base_model":"qwen3.5 max preview","display_name":"qwen3.5 max preview","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.5-max-preview"]},{"model_id":"grok-4-1-thinking","base_model":"grok 4.1 thinking","display_name":"grok 4.1 thinking","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4.1-thinking"]},{"model_id":"claude-sonnet-5","base_model":"claude sonnet 5","display_name":"claude sonnet 5","official_model_id":null,"provider":"Anthropic","aliases":["Claude Sonnet 5 (max)","Claude Sonnet 5 xHigh Effort","claude-sonnet-5-high"]},{"model_id":"grok-4-6","base_model":"Grok 4.6","display_name":"Grok 4.6","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok 4.6","Grok 4.6 (high)","Grok 4.6 (low)","Grok 4.6 (medium)","Grok 4.6 (xhigh)","grok-4.6-high"]},{"model_id":"kimi-k2-6","base_model":"kimi k2.6","display_name":"kimi k2.6","official_model_id":null,"provider":"Moonshot","aliases":["kimi-k2.6"]},{"model_id":"qwen3-6-max-preview","base_model":"qwen3.6 max preview","display_name":"qwen3.6 max preview","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.6-max-preview"]},{"model_id":"deepseek-v4-pro-high-20260813","base_model":"deepseek v4 pro high 20260813","display_name":"deepseek v4 pro high 20260813","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v4-pro-high-20260813"]},{"model_id":"grok-4-1","base_model":"grok 4.1","display_name":"grok 4.1","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4.1"]},{"model_id":"deepseek-v4-pro","base_model":"deepseek v4 pro","display_name":"deepseek v4 pro","official_model_id":null,"provider":"DeepSeek","aliases":["DeepSeek V4 Pro (max)","deepseek-v4-pro"]},{"model_id":"glm-5","base_model":"glm 5","display_name":"glm 5","official_model_id":null,"provider":"Z.ai","aliases":["glm-5"]},{"model_id":"gemini-3-5-flash-lite","base_model":"gemini 3.5 flash lite","display_name":"gemini 3.5 flash lite","official_model_id":null,"provider":"Google","aliases":["Gemini 3.5 Flash-Lite","Gemini 3.5 Flash-Lite High","gemini-3.5-flash-lite"]},{"model_id":"claude-sonnet-4-5-20250929-high-32k","base_model":"claude sonnet 4.5 20250929 high 32k","display_name":"claude sonnet 4.5 20250929 high 32k","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-5-20250929-high-32k"]},{"model_id":"dola-seed-2-0-pro","base_model":"dola seed 2.0 pro","display_name":"dola seed 2.0 pro","official_model_id":null,"provider":"Bytedance","aliases":["dola-seed-2.0-pro"]},{"model_id":"hy3","base_model":"hy3","display_name":"hy3","official_model_id":null,"provider":"Tencent","aliases":["Hy3","hy3"]},{"model_id":"qwen3-7-plus","base_model":"qwen3.7 plus","display_name":"qwen3.7 plus","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3.7 Plus","qwen3.7-plus"]},{"model_id":"claude-sonnet-4-5-20250929","base_model":"claude sonnet 4.5 20250929","display_name":"claude sonnet 4.5 20250929","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-5-20250929"]},{"model_id":"deepseek-v4-pro-high-preview","base_model":"deepseek v4 pro high preview","display_name":"deepseek v4 pro high preview","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v4-pro-high-preview"]},{"model_id":"gpt-5-1","base_model":"gpt 5.1","display_name":"gpt 5.1","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.1","gpt-5.1-high"]},{"model_id":"gpt-5-6-luna","base_model":"gpt 5.6 luna","display_name":"gpt 5.6 luna","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.6 Luna (max)","GPT-5.6 Luna (xhigh)","GPT-5.6 Luna Max Effort","gpt-5.6-luna-xhigh"]},{"model_id":"gemma-4-31b","base_model":"gemma 4 31b","display_name":"gemma 4 31b","official_model_id":null,"provider":"Google","aliases":["gemma-4-31b"]},{"model_id":"kimi-k2-5-thinking","base_model":"kimi k2.5 thinking","display_name":"kimi k2.5 thinking","official_model_id":null,"provider":"Moonshot","aliases":["kimi-k2.5-thinking"]},{"model_id":"claude-opus-4-1-20250805-thinking-16k","base_model":"claude opus 4.1 20250805 thinking 16k","display_name":"claude opus 4.1 20250805 thinking 16k","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-1-20250805-thinking-16k"]},{"model_id":"gpt-5-3-chat-latest","base_model":"gpt 5.3 chat latest","display_name":"gpt 5.3 chat latest","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.3-chat-latest"]},{"model_id":"ernie-5-0-preview-1203","base_model":"ernie 5.0 preview 1203","display_name":"ernie 5.0 preview 1203","official_model_id":null,"provider":"Baidu","aliases":["ernie-5.0-preview-1203"]},{"model_id":"mimo-v2-pro","base_model":"mimo v2 pro","display_name":"mimo v2 pro","official_model_id":null,"provider":"Xiaomi","aliases":["mimo-v2-pro"]},{"model_id":"gpt-5-4-mini","base_model":"gpt 5.4 mini","display_name":"gpt 5.4 mini","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.4 Mini xHigh","gpt-5.4-mini-high"]},{"model_id":"claude-opus-4-1-20250805","base_model":"claude opus 4.1 20250805","display_name":"claude opus 4.1 20250805","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-1-20250805"]},{"model_id":"ernie-5-0-0110","base_model":"ernie 5.0 0110","display_name":"ernie 5.0 0110","official_model_id":null,"provider":"Baidu","aliases":["ernie-5.0-0110"]},{"model_id":"gemini-2-5-pro","base_model":"gemini 2.5 pro","display_name":"gemini 2.5 pro","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-pro"]},{"model_id":"gpt-4-5-preview-2025-02-27","base_model":"gpt 4.5 preview 2025 02 27","display_name":"gpt 4.5 preview 2025 02 27","official_model_id":null,"provider":"OpenAI","aliases":["gpt-4.5-preview-2025-02-27"]},{"model_id":"qwen3-6-plus","base_model":"qwen3.6 plus","display_name":"qwen3.6 plus","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.6-plus"]},{"model_id":"chatgpt-4o-latest-20250326","base_model":"chatgpt 4o latest 20250326","display_name":"chatgpt 4o latest 20250326","official_model_id":null,"provider":"OpenAI","aliases":["chatgpt-4o-latest-20250326"]},{"model_id":"grok-4-3","base_model":"Grok 4.3","display_name":"Grok 4.3","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok 4.3","grok-4.3"]},{"model_id":"minimax-m3","base_model":"minimax m3","display_name":"minimax m3","official_model_id":null,"provider":"MiniMax","aliases":["MiniMax-M3","Minimax M3","minimax-m3"]},{"model_id":"glm-4-7","base_model":"glm 4.7","display_name":"glm 4.7","official_model_id":null,"provider":"Z.ai","aliases":["glm-4.7"]},{"model_id":"qwen3-5-397b-a17b","base_model":"qwen3.5 397b a17b","display_name":"qwen3.5 397b a17b","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.5-397b-a17b"]},{"model_id":"inkling","base_model":"inkling","display_name":"inkling","official_model_id":null,"provider":"Thinky","aliases":["Inkling","inkling"]},{"model_id":"deepseek-v4-flash-high-preview","base_model":"deepseek v4 flash high preview","display_name":"deepseek v4 flash high preview","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v4-flash-high-preview"]},{"model_id":"gemma-4-26b-a4b","base_model":"gemma 4 26b a4b","display_name":"gemma 4 26b a4b","official_model_id":null,"provider":"Google","aliases":["gemma-4-26b-a4b"]},{"model_id":"gpt-5-2","base_model":"gpt 5.2","display_name":"gpt 5.2","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.2 High","gpt-5.2","gpt-5.2-high"]},{"model_id":"qwen3-8-27b","base_model":"qwen3.8 27b","display_name":"qwen3.8 27b","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3.8 27B (xhigh)","qwen3.8-27b"]},{"model_id":"longcat-flash-chat-2602-exp","base_model":"longcat flash chat 2602 exp","display_name":"longcat flash chat 2602 exp","official_model_id":null,"provider":"Meituan","aliases":["longcat-flash-chat-2602-exp"]},{"model_id":"deepseek-v4-flash","base_model":"deepseek v4 flash","display_name":"deepseek v4 flash","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v4-flash"]},{"model_id":"qwen3-max-preview","base_model":"qwen3 max preview","display_name":"qwen3 max preview","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-max-preview"]},{"model_id":"gpt-5","base_model":"gpt 5","display_name":"gpt 5","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-high"]},{"model_id":"mimo-v2-5","base_model":"mimo v2.5","display_name":"mimo v2.5","official_model_id":null,"provider":"Xiaomi","aliases":["MiMo-V2.5","mimo-v2.5"]},{"model_id":"glm-5v-turbo","base_model":"glm 5v turbo","display_name":"glm 5v turbo","official_model_id":null,"provider":"Z.ai","aliases":["glm-5v-turbo"]},{"model_id":"gemini-3-1-flash-lite-preview","base_model":"gemini 3.1 flash lite preview","display_name":"gemini 3.1 flash lite preview","official_model_id":null,"provider":"Google","aliases":["gemini-3.1-flash-lite-preview"]},{"model_id":"o3-2025-04-16","base_model":"o3 2025 04 16","display_name":"o3 2025 04 16","official_model_id":null,"provider":"OpenAI","aliases":["o3-2025-04-16"]},{"model_id":"kimi-k2-5-instant","base_model":"kimi k2.5 instant","display_name":"kimi k2.5 instant","official_model_id":null,"provider":"Moonshot","aliases":["kimi-k2.5-instant"]},{"model_id":"grok-4-1-fast-reasoning","base_model":"grok 4 1 fast reasoning","display_name":"grok 4 1 fast reasoning","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4-1-fast-reasoning"]},{"model_id":"kimi-k2-thinking-turbo","base_model":"kimi k2 thinking turbo","display_name":"kimi k2 thinking turbo","official_model_id":null,"provider":"Moonshot","aliases":["kimi-k2-thinking-turbo"]},{"model_id":"mimo-v2-omni","base_model":"mimo v2 omni","display_name":"mimo v2 omni","official_model_id":null,"provider":"Xiaomi","aliases":["mimo-v2-omni"]},{"model_id":"muse-glimmer","base_model":"muse glimmer","display_name":"muse glimmer","official_model_id":null,"provider":"Meta","aliases":["Muse Glimmer (high)","muse-glimmer"]},{"model_id":"mistral-medium-3-5","base_model":"mistral medium 3.5","display_name":"mistral medium 3.5","official_model_id":null,"provider":"Mistral","aliases":["mistral-medium-3.5"]},{"model_id":"gpt-5-chat","base_model":"gpt 5 chat","display_name":"gpt 5 chat","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-chat"]},{"model_id":"nvidia-nemotron-3-ultra-550b-a55b-nvfp4","base_model":"nvidia nemotron 3 ultra 550b a55b nvfp4","display_name":"nvidia nemotron 3 ultra 550b a55b nvfp4","official_model_id":null,"provider":"Nvidia","aliases":["nvidia-nemotron-3-ultra-550b-a55b-nvfp4"]},{"model_id":"amazon-nova-experimental-chat-26-02-10","base_model":"amazon nova experimental chat 26 02 10","display_name":"amazon nova experimental chat 26 02 10","official_model_id":null,"provider":"Amazon","aliases":["amazon-nova-experimental-chat-26-02-10"]},{"model_id":"claude-opus-4-20250514-thinking-16k","base_model":"claude opus 4.20250514 thinking 16k","display_name":"claude opus 4.20250514 thinking 16k","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-20250514-thinking-16k"]},{"model_id":"deepseek-v3-2","base_model":"deepseek v3.2","display_name":"deepseek v3.2","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.2"]},{"model_id":"deepseek-v3-2-exp-thinking","base_model":"deepseek v3.2 exp thinking","display_name":"deepseek v3.2 exp thinking","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.2-exp-thinking"]},{"model_id":"glm-4-6","base_model":"glm 4.6","display_name":"glm 4.6","official_model_id":null,"provider":"Z.ai","aliases":["glm-4.6"]},{"model_id":"qwen3-max-2025-09-23","base_model":"qwen3 max 2025 09 23","display_name":"qwen3 max 2025 09 23","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-max-2025-09-23"]},{"model_id":"qwen3-235b-a22b-instruct-2507","base_model":"qwen3 235b a22b instruct 2507","display_name":"qwen3 235b a22b instruct 2507","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-235b-a22b-instruct-2507"]},{"model_id":"deepseek-v3-2-thinking","base_model":"deepseek v3.2 thinking","display_name":"deepseek v3.2 thinking","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.2-thinking"]},{"model_id":"deepseek-v3-2-exp","base_model":"deepseek v3.2 exp","display_name":"deepseek v3.2 exp","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.2-exp"]},{"model_id":"deepseek-r1-0528","base_model":"deepseek r1 0528","display_name":"deepseek r1 0528","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-r1-0528"]},{"model_id":"ernie-5-0-preview-1022","base_model":"ernie 5.0 preview 1022","display_name":"ernie 5.0 preview 1022","official_model_id":null,"provider":"Baidu","aliases":["ernie-5.0-preview-1022"]},{"model_id":"grok-4-fast-chat","base_model":"grok 4 fast chat","display_name":"grok 4 fast chat","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4-fast-chat"]},{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","aliases":["GPT-6 Astra (Non-reasoning)","GPT-6 Astra (high)","GPT-6 Astra (low)","GPT-6 Astra (max)","GPT-6 Astra (medium)","GPT-6 Astra (xhigh)","GPT-6 Astra Max Effort"]},{"model_id":"muse-spark-1-3","base_model":"Muse Spark 1.3","display_name":"Muse Spark 1.3","official_model_id":null,"provider":"Meta","aliases":["Muse Spark 1.3 (max)","Muse Spark 1.3 (xhigh)","Muse Spark 1.3 xHigh Effort"]},{"model_id":"kimi-k3-open","base_model":"Kimi K3\nopen","display_name":"Kimi K3\nopen","official_model_id":null,"provider":null,"aliases":["Kimi K3\nopen"]},{"model_id":"qwen-3-8-max-open","base_model":"Qwen 3.8 Max\nopen","display_name":"Qwen 3.8 Max\nopen","official_model_id":null,"provider":"Alibaba","aliases":["Qwen 3.8 Max\nopen"]},{"model_id":"deepseek-v4-pro-0813-open","base_model":"DeepSeek V4 Pro 0813\nopen","display_name":"DeepSeek V4 Pro 0813\nopen","official_model_id":null,"provider":null,"aliases":["DeepSeek V4 Pro 0813\nopen"]},{"model_id":"deepseek-v4-flash-vision-exp-open","base_model":"DeepSeek V4 Flash Vision Exp\nopen","display_name":"DeepSeek V4 Flash Vision Exp\nopen","official_model_id":null,"provider":null,"aliases":["DeepSeek V4 Flash Vision Exp\nopen"]},{"model_id":"claude-4-7-opus","base_model":"Claude 4.7 Opus","display_name":"Claude 4.7 Opus","official_model_id":null,"provider":"Anthropic","aliases":["Claude 4.7 Opus Thinking xHigh Effort"]},{"model_id":"claude-4-8-opus","base_model":"Claude 4.8 Opus","display_name":"Claude 4.8 Opus","official_model_id":null,"provider":"Anthropic","aliases":["Claude 4.8 Opus Thinking Max Effort"]},{"model_id":"qwen-3-8-flash-next-open","base_model":"Qwen 3.8 Flash Next\nopen","display_name":"Qwen 3.8 Flash Next\nopen","official_model_id":null,"provider":"Alibaba","aliases":["Qwen 3.8 Flash Next\nopen"]},{"model_id":"glm-5-3-open","base_model":"GLM-5.3\nopen","display_name":"GLM-5.3\nopen","official_model_id":null,"provider":null,"aliases":["GLM-5.3\nopen"]},{"model_id":"qwen3-8-27b-open","base_model":"Qwen3.8 27B\nopen","display_name":"Qwen3.8 27B\nopen","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3.8 27B\nopen"]},{"model_id":"claude-4-6-opus","base_model":"Claude 4.6 Opus","display_name":"Claude 4.6 Opus","official_model_id":null,"provider":"Anthropic","aliases":["Claude 4.6 Opus Thinking High Effort"]},{"model_id":"deepseek-v4-flash-0731-open","base_model":"DeepSeek V4 Flash 0731\nopen","display_name":"DeepSeek V4 Flash 0731\nopen","official_model_id":null,"provider":null,"aliases":["DeepSeek V4 Flash 0731\nopen"]},{"model_id":"gpt-5-2-codex","base_model":"GPT-5.2 Codex","display_name":"GPT-5.2 Codex","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.2 Codex"]},{"model_id":"glm-5-2-open","base_model":"GLM-5.2\nopen","display_name":"GLM-5.2\nopen","official_model_id":null,"provider":null,"aliases":["GLM-5.2\nopen"]},{"model_id":"qwen-3-7","base_model":"Qwen 3.7","display_name":"Qwen 3.7","official_model_id":null,"provider":"Alibaba","aliases":["Qwen 3.7 Max"]},{"model_id":"claude-4-6-sonnet","base_model":"Claude 4.6 Sonnet","display_name":"Claude 4.6 Sonnet","official_model_id":null,"provider":"Anthropic","aliases":["Claude 4.6 Sonnet Thinking Medium Effort"]},{"model_id":"claude-4-5-opus","base_model":"Claude 4.5 Opus","display_name":"Claude 4.5 Opus","official_model_id":null,"provider":"Anthropic","aliases":["Claude 4.5 Opus Thinking High Effort"]},{"model_id":"inkling-xhigh-effort-open","base_model":"Inkling xHigh Effort\nopen","display_name":"Inkling xHigh Effort\nopen","official_model_id":null,"provider":null,"aliases":["Inkling xHigh Effort\nopen"]},{"model_id":"glm-5-3-flash-open","base_model":"GLM-5.3 Flash\nopen","display_name":"GLM-5.3 Flash\nopen","official_model_id":null,"provider":null,"aliases":["GLM-5.3 Flash\nopen"]},{"model_id":"kimi-k2-6-thinking-open","base_model":"Kimi K2.6 Thinking\nopen","display_name":"Kimi K2.6 Thinking\nopen","official_model_id":null,"provider":null,"aliases":["Kimi K2.6 Thinking\nopen"]},{"model_id":"gpt-5-4-nano","base_model":"GPT-5.4 Nano","display_name":"GPT-5.4 Nano","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5.4 Nano xHigh"]},{"model_id":"ox-alpha","base_model":"ox alpha","display_name":"ox alpha","official_model_id":null,"provider":null,"aliases":["ox-alpha-max"]},{"model_id":"qwen-3-6-plus","base_model":"Qwen 3.6 Plus","display_name":"Qwen 3.6 Plus","official_model_id":null,"provider":"Alibaba","aliases":["Qwen 3.6 Plus"]},{"model_id":"kimi-k2-7-code-open","base_model":"Kimi K2.7 Code\nopen","display_name":"Kimi K2.7 Code\nopen","official_model_id":null,"provider":null,"aliases":["Kimi K2.7 Code\nopen"]},{"model_id":"grok-build-0-1","base_model":"Grok Build 0.1","display_name":"Grok Build 0.1","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok Build 0.1"]},{"model_id":"nemotron-3-ultra-550b-a55b-open","base_model":"Nemotron 3 Ultra 550B A55B\nopen","display_name":"Nemotron 3 Ultra 550B A55B\nopen","official_model_id":null,"provider":null,"aliases":["Nemotron 3 Ultra 550B A55B\nopen"]},{"model_id":"qwen-3-6-27b-open","base_model":"Qwen 3.6 27B\nopen","display_name":"Qwen 3.6 27B\nopen","official_model_id":null,"provider":"Alibaba","aliases":["Qwen 3.6 27B\nopen"]},{"model_id":"qwen3-8-2-4t-a95b","base_model":"Qwen3.8 2.4T A95B","display_name":"Qwen3.8 2.4T A95B","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3.8 2.4T A95B"]},{"model_id":"deepseek-v4-pro-0813","base_model":"DeepSeek V4 Pro 0813","display_name":"DeepSeek V4 Pro 0813","official_model_id":null,"provider":"DeepSeek","aliases":["DeepSeek V4 Pro 0813 (max)"]},{"model_id":"deepseek-v4-flash-0731","base_model":"DeepSeek V4 Flash 0731","display_name":"DeepSeek V4 Flash 0731","official_model_id":null,"provider":"DeepSeek","aliases":["DeepSeek V4 Flash 0731 (max)"]},{"model_id":"deepseek-v4-flash-vision","base_model":"DeepSeek V4 Flash Vision","display_name":"DeepSeek V4 Flash Vision","official_model_id":null,"provider":"DeepSeek","aliases":["DeepSeek V4 Flash Vision (max)"]},{"model_id":"k2-horizon-375b-a23b","base_model":"K2 Horizon 375B A23B","display_name":"K2 Horizon 375B A23B","official_model_id":null,"provider":"MBZUAI Institute of Foundation Models","aliases":["K2 Horizon 375B A23B"]},{"model_id":"quasar-438b","base_model":"Quasar 438B","display_name":"Quasar 438B","official_model_id":null,"provider":"Multiverse Computing","aliases":["Quasar 438B (max)"]},{"model_id":"kimi-k2-7-code","base_model":"Kimi K2.7 Code","display_name":"Kimi K2.7 Code","official_model_id":null,"provider":"Kimi","aliases":["Kimi K2.7 Code"]},{"model_id":"inkling-small","base_model":"Inkling Small","display_name":"Inkling Small","official_model_id":null,"provider":"Thinking Machines","aliases":["Inkling Small"]},{"model_id":"nemotron-3-ultra","base_model":"Nemotron 3 Ultra","display_name":"Nemotron 3 Ultra","official_model_id":null,"provider":"NVIDIA","aliases":["Nemotron 3 Ultra"]},{"model_id":"ling-3-0-flash","base_model":"Ling 3.0 Flash","display_name":"Ling 3.0 Flash","official_model_id":null,"provider":"InclusionAI","aliases":["Ling 3.0 Flash"]},{"model_id":"claude-4-5-haiku","base_model":"Claude 4.5 Haiku","display_name":"Claude 4.5 Haiku","official_model_id":null,"provider":"Anthropic","aliases":["Claude 4.5 Haiku"]},{"model_id":"ling-3-0-tiny","base_model":"Ling 3.0 Tiny","display_name":"Ling 3.0 Tiny","official_model_id":null,"provider":"InclusionAI","aliases":["Ling 3.0 Tiny"]},{"model_id":"gpt-oss-120b","base_model":"gpt oss 120b","display_name":"gpt oss 120b","official_model_id":null,"provider":"OpenAI","aliases":["gpt-oss-120b (high)"]},{"model_id":"granite-4-2-8b","base_model":"Granite 4.2 8B","display_name":"Granite 4.2 8B","official_model_id":null,"provider":"IBM","aliases":["Granite 4.2 8B"]},{"model_id":"mistral-large-3","base_model":"Mistral Large 3","display_name":"Mistral Large 3","official_model_id":null,"provider":"Mistral","aliases":["Mistral Large 3"]},{"model_id":"granite-4-2-3b","base_model":"Granite 4.2 3B","display_name":"Granite 4.2 3B","official_model_id":null,"provider":"IBM","aliases":["Granite 4.2 3B"]},{"model_id":"celeris-1","base_model":"Celeris-1","display_name":"Celeris-1","official_model_id":null,"provider":"Celeris","aliases":["Celeris-1"]},{"model_id":"deepseek-v3-1-terminus-thinking","base_model":"deepseek v3.1 terminus thinking","display_name":"deepseek v3.1 terminus thinking","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.1-terminus-thinking"]},{"model_id":"claude-opus-4-20250514","base_model":"claude opus 4.20250514","display_name":"claude opus 4.20250514","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-20250514"]},{"model_id":"kimi-k2-0905-preview","base_model":"kimi k2 0905 preview","display_name":"kimi k2 0905 preview","official_model_id":null,"provider":"Moonshot","aliases":["kimi-k2-0905-preview"]},{"model_id":"deepseek-v3-1-terminus","base_model":"deepseek v3.1 terminus","display_name":"deepseek v3.1 terminus","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.1-terminus"]},{"model_id":"hunyuan-hy3-preview","base_model":"hunyuan hy3 preview","display_name":"hunyuan hy3 preview","official_model_id":null,"provider":"Tencent","aliases":["hunyuan-hy3-preview"]},{"model_id":"kimi-k2-0711-preview","base_model":"kimi k2 0711 preview","display_name":"kimi k2 0711 preview","official_model_id":null,"provider":"Moonshot","aliases":["kimi-k2-0711-preview"]},{"model_id":"amazon-nova-experimental-chat-26-01-10","base_model":"amazon nova experimental chat 26 01 10","display_name":"amazon nova experimental chat 26 01 10","official_model_id":null,"provider":"Amazon","aliases":["amazon-nova-experimental-chat-26-01-10"]},{"model_id":"grok-4-0709","base_model":"grok 4 0709","display_name":"grok 4 0709","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4-0709"]},{"model_id":"qwen3-235b-a22b-thinking-2507","base_model":"qwen3 235b a22b thinking 2507","display_name":"qwen3 235b a22b thinking 2507","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-235b-a22b-thinking-2507"]},{"model_id":"claude-haiku-4-5-20251001","base_model":"claude haiku 4 5 20251001","display_name":"claude haiku 4 5 20251001","official_model_id":null,"provider":"Anthropic","aliases":["claude-haiku-4-5-20251001"]},{"model_id":"minimax-m2-7","base_model":"minimax m2.7","display_name":"minimax m2.7","official_model_id":null,"provider":"MiniMax","aliases":["minimax-m2.7"]},{"model_id":"qwen3-5-122b-a10b","base_model":"qwen3.5 122b a10b","display_name":"qwen3.5 122b a10b","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.5-122b-a10b"]},{"model_id":"glm-4-5","base_model":"glm 4.5","display_name":"glm 4.5","official_model_id":null,"provider":"Z.ai","aliases":["glm-4.5"]},{"model_id":"qwen3-vl-235b-a22b-instruct","base_model":"qwen3 vl 235b a22b instruct","display_name":"qwen3 vl 235b a22b instruct","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-vl-235b-a22b-instruct"]},{"model_id":"qwen3-5-27b","base_model":"qwen3.5 27b","display_name":"qwen3.5 27b","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.5-27b"]},{"model_id":"gpt-5-4-pro-2026-03-05","base_model":"gpt 5.4 pro 2026 03 05","display_name":"gpt 5.4 pro 2026 03 05","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.4-pro-2026-03-05"]},{"model_id":"gemini-3-pro-preview","base_model":"gemini 3 pro preview","display_name":"gemini 3 pro preview","official_model_id":null,"provider":"Google","aliases":["gemini-3-pro-preview"]},{"model_id":"gpt-5-4-2026-03-05","base_model":"gpt 5.4 2026 03 05","display_name":"gpt 5.4 2026 03 05","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.4-2026-03-05 (xhigh thinking)"]},{"model_id":"claude-opus-4-6-thinking","base_model":"claude opus 4.6 thinking","display_name":"claude opus 4.6 thinking","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-6-thinking-max"]},{"model_id":"gpt-5-pro-2025-10-06","base_model":"gpt 5 pro 2025 10 06","display_name":"gpt 5 pro 2025 10 06","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-pro-2025-10-06"]},{"model_id":"gpt-5-2-2025-12-11","base_model":"gpt 5.2 2025 12 11","display_name":"gpt 5.2 2025 12 11","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.2-2025-12-11"]},{"model_id":"gpt-5-2025-08-07","base_model":"gpt 5 2025 08 07","display_name":"gpt 5 2025 08 07","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-2025-08-07"]},{"model_id":"claude-opus-4-5-20251101-thinking","base_model":"claude opus 4.5 20251101 thinking","display_name":"claude opus 4.5 20251101 thinking","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-5-20251101-thinking"]},{"model_id":"kimi-k2-5","base_model":"kimi k2.5","display_name":"kimi k2.5","official_model_id":null,"provider":null,"aliases":["kimi-k2.5"]},{"model_id":"gpt-5-1-thinking","base_model":"gpt 5.1 thinking","display_name":"gpt 5.1 thinking","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.1-thinking"]},{"model_id":"gemini-2-5-pro-preview-06-05","base_model":"gemini 2.5 pro preview 06 05","display_name":"gemini 2.5 pro preview 06 05","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-pro-preview-06-05"]},{"model_id":"o3","base_model":"o3","display_name":"o3","official_model_id":null,"provider":null,"aliases":["o3 (high) (April 2025)","o3 (medium) (April 2025)"]},{"model_id":"gpt-5-mini-2025-08-07","base_model":"gpt 5 mini 2025 08 07","display_name":"gpt 5 mini 2025 08 07","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-mini-2025-08-07"]},{"model_id":"gemini-2-5-pro-experimental","base_model":"Gemini 2.5 Pro Experimental","display_name":"Gemini 2.5 Pro Experimental","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Pro Experimental (March 2025)"]},{"model_id":"o4-mini","base_model":"o4 mini","display_name":"o4 mini","official_model_id":null,"provider":null,"aliases":["o4-mini (high) (April 2025)","o4-mini (medium) (April 2025)"]},{"model_id":"gemini-2-5-pro-preview","base_model":"Gemini 2.5 Pro Preview","display_name":"Gemini 2.5 Pro Preview","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Pro Preview (May 06 2025)"]},{"model_id":"claude-sonnet-4-5-20250929-thinking","base_model":"claude sonnet 4.5 20250929 thinking","display_name":"claude sonnet 4.5 20250929 thinking","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-5-20250929-thinking"]},{"model_id":"gemini-2-5-flash","base_model":"Gemini 2.5 Flash","display_name":"Gemini 2.5 Flash","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Flash (April 2025)"]},{"model_id":"claude-opus-4-1-20250805-thinking","base_model":"claude opus 4.1 20250805 thinking","display_name":"claude opus 4.1 20250805 thinking","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-1-20250805-thinking"]},{"model_id":"gemini-2-5-flash-preview","base_model":"Gemini 2.5 Flash Preview","display_name":"Gemini 2.5 Flash Preview","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Flash Preview (May 2025)"]},{"model_id":"claude-opus-4","base_model":"Claude Opus 4","display_name":"Claude Opus 4","official_model_id":null,"provider":"Anthropic","aliases":["Claude Opus 4","Claude Opus 4 (Thinking)"]},{"model_id":"glm-4p5","base_model":"glm 4p5","display_name":"glm 4p5","official_model_id":null,"provider":null,"aliases":["glm-4p5"]},{"model_id":"glm-4p5-air","base_model":"glm 4p5 air","display_name":"glm 4p5 air","official_model_id":null,"provider":null,"aliases":["glm-4p5-air"]},{"model_id":"o1-pro","base_model":"o1 Pro","display_name":"o1 Pro","official_model_id":null,"provider":null,"aliases":["o1 Pro"]},{"model_id":"claude-3-7-sonnet","base_model":"Claude 3.7 Sonnet","display_name":"Claude 3.7 Sonnet","official_model_id":null,"provider":"Anthropic","aliases":["Claude 3.7 Sonnet (Thinking)"]},{"model_id":"o1","base_model":"o1","display_name":"o1","official_model_id":null,"provider":null,"aliases":["o1 (December 2024)"]},{"model_id":"claude-sonnet-4","base_model":"Claude Sonnet 4","display_name":"Claude Sonnet 4","official_model_id":null,"provider":"Anthropic","aliases":["Claude Sonnet 4","Claude Sonnet 4 (Thinking)"]},{"model_id":"gpt-5-1-instant","base_model":"gpt 5.1 instant","display_name":"gpt 5.1 instant","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.1-instant"]},{"model_id":"gemini-2-0-flash","base_model":"Gemini 2.0 Flash","display_name":"Gemini 2.0 Flash","official_model_id":null,"provider":"Google","aliases":["Gemini 2.0 Flash Thinking (January 2025)"]},{"model_id":"llama-4-maverick","base_model":"Llama 4 Maverick","display_name":"Llama 4 Maverick","official_model_id":null,"provider":null,"aliases":["Llama 4 Maverick"]},{"model_id":"gpt-4-5-preview","base_model":"GPT-4.5 Preview","display_name":"GPT-4.5 Preview","official_model_id":null,"provider":"OpenAI","aliases":["GPT 4.5 Preview"]},{"model_id":"gpt-4-1","base_model":"GPT-4.1","display_name":"GPT-4.1","official_model_id":null,"provider":"OpenAI","aliases":["GPT-4.1"]},{"model_id":"gemini-1-5-pro-002","base_model":"Gemini-1.5-Pro-002","display_name":"Gemini-1.5-Pro-002","official_model_id":null,"provider":"Google","aliases":["Gemini-1.5-Pro-002"]},{"model_id":"mistral-medium-3","base_model":"Mistral Medium 3","display_name":"Mistral Medium 3","official_model_id":null,"provider":null,"aliases":["Mistral Medium 3"]},{"model_id":"nova-pro","base_model":"Nova Pro","display_name":"Nova Pro","official_model_id":null,"provider":null,"aliases":["Nova Pro"]},{"model_id":"claude-3-5-sonnet","base_model":"Claude 3.5 Sonnet","display_name":"Claude 3.5 Sonnet","official_model_id":null,"provider":"Anthropic","aliases":["Claude 3.5 Sonnet (October 2024)"]},{"model_id":"nova-lite","base_model":"Nova Lite","display_name":"Nova Lite","official_model_id":null,"provider":null,"aliases":["Nova Lite"]},{"model_id":"gpt-4o","base_model":"GPT-4o","display_name":"GPT-4o","official_model_id":null,"provider":"OpenAI","aliases":["GPT-4o (November 2024)"]},{"model_id":"qwen3-next-80b-a3b-instruct","base_model":"qwen3 next 80b a3b instruct","display_name":"qwen3 next 80b a3b instruct","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-next-80b-a3b-instruct"]},{"model_id":"o4-mini-2025-04-16","base_model":"o4 mini 2025 04 16","display_name":"o4 mini 2025 04 16","official_model_id":null,"provider":"OpenAI","aliases":["o4-mini-2025-04-16"]},{"model_id":"deepseek-v3-1-thinking","base_model":"deepseek v3.1 thinking","display_name":"deepseek v3.1 thinking","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.1-thinking"]},{"model_id":"claude-sonnet-4-20250514-thinking-32k","base_model":"claude sonnet 4.20250514 thinking 32k","display_name":"claude sonnet 4.20250514 thinking 32k","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-20250514-thinking-32k"]},{"model_id":"claude-3-7-sonnet-20250219-thinking-32k","base_model":"claude 3 7 sonnet 20250219 thinking 32k","display_name":"claude 3 7 sonnet 20250219 thinking 32k","official_model_id":null,"provider":"Anthropic","aliases":["claude-3-7-sonnet-20250219-thinking-32k"]},{"model_id":"grok-4-20-0309","base_model":"Grok 4.20 0309","display_name":"Grok 4.20 0309","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok 4.20 0309"]},{"model_id":"grok-4-20-0309-v2","base_model":"Grok 4.20 0309 v2","display_name":"Grok 4.20 0309 v2","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok 4.20 0309 v2"]},{"model_id":"gpt-4-1-2025-04-14","base_model":"gpt 4.1 2025 04 14","display_name":"gpt 4.1 2025 04 14","official_model_id":null,"provider":"OpenAI","aliases":["gpt-4.1-2025-04-14"]},{"model_id":"grok-3-preview-02-24","base_model":"grok 3 preview 02 24","display_name":"grok 3 preview 02 24","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-3-preview-02-24"]},{"model_id":"deepseek-v3-0324","base_model":"deepseek v3 0324","display_name":"deepseek v3 0324","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3-0324"]},{"model_id":"deepseek-v3-1","base_model":"deepseek v3.1","display_name":"deepseek v3.1","official_model_id":null,"provider":"DeepSeek","aliases":["deepseek-v3.1"]},{"model_id":"mistral-medium-2508","base_model":"mistral medium 2508","display_name":"mistral medium 2508","official_model_id":null,"provider":"Mistral","aliases":["mistral-medium-2508"]},{"model_id":"gemini-2-5-flash-preview-09-2025","base_model":"gemini 2.5 flash preview 09 2025","display_name":"gemini 2.5 flash preview 09 2025","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-flash-preview-09-2025"]},{"model_id":"gemini-3-1-pro-grounding","base_model":"gemini 3.1 pro grounding","display_name":"gemini 3.1 pro grounding","official_model_id":null,"provider":"Google","aliases":["gemini-3.1-pro-grounding"]},{"model_id":"gemini-3-pro-grounding","base_model":"gemini 3 pro grounding","display_name":"gemini 3 pro grounding","official_model_id":null,"provider":"Google","aliases":["gemini-3-pro-grounding"]},{"model_id":"gemini-3-flash-grounding","base_model":"gemini 3 flash grounding","display_name":"gemini 3 flash grounding","official_model_id":null,"provider":"Google","aliases":["gemini-3-flash-grounding"]},{"model_id":"claude-opus-4-5","base_model":"claude opus 4.5","display_name":"claude opus 4.5","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-5-search"]},{"model_id":"gpt-5-2-search-non-reasoning","base_model":"gpt 5.2 search non reasoning","display_name":"gpt 5.2 search non reasoning","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.2-search-non-reasoning"]},{"model_id":"grok-4-1-fast","base_model":"grok 4 1 fast","display_name":"grok 4 1 fast","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4-1-fast-search"]},{"model_id":"grok-4-fast","base_model":"grok 4 fast","display_name":"grok 4 fast","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4-fast-search"]},{"model_id":"claude-sonnet-4-5","base_model":"claude sonnet 4.5","display_name":"claude sonnet 4.5","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-5-search"]},{"model_id":"claude-opus-4-1","base_model":"claude opus 4.1","display_name":"claude opus 4.1","official_model_id":null,"provider":"Anthropic","aliases":["claude-opus-4-1-search"]},{"model_id":"gemini-2-5-pro-grounding","base_model":"gemini 2.5 pro grounding","display_name":"gemini 2.5 pro grounding","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-pro-grounding"]},{"model_id":"grok-4","base_model":"grok 4","display_name":"grok 4","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-4-search"]},{"model_id":"ppl-sonar-reasoning-pro","base_model":"ppl sonar reasoning pro","display_name":"ppl sonar reasoning pro","official_model_id":null,"provider":"Perplexity AI","aliases":["ppl-sonar-reasoning-pro-high"]},{"model_id":"ppl-sonar-pro","base_model":"ppl sonar pro","display_name":"ppl sonar pro","official_model_id":null,"provider":"Perplexity AI","aliases":["ppl-sonar-pro-high"]},{"model_id":"diffbot-small-xl","base_model":"diffbot small xl","display_name":"diffbot small xl","official_model_id":null,"provider":"Diffbot","aliases":["diffbot-small-xl"]},{"model_id":"api-gpt-4o","base_model":"api gpt 4o","display_name":"api gpt 4o","official_model_id":null,"provider":"OpenAI","aliases":["api-gpt-4o-search"]},{"model_id":"qwen3-8-max-0902","base_model":"qwen3.8 max 0902","display_name":"qwen3.8 max 0902","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.8-max-0902"]},{"model_id":"qwen3-8-flash-next","base_model":"qwen3.8 flash next","display_name":"qwen3.8 flash next","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.8-flash-next"]},{"model_id":"hy4-preview","base_model":"hy4 preview","display_name":"hy4 preview","official_model_id":null,"provider":"Tencent","aliases":["hy4-preview"]},{"model_id":"seed-2-1-pro-preview","base_model":"seed 2.1 pro preview","display_name":"seed 2.1 pro preview","official_model_id":null,"provider":"Bytedance","aliases":["seed-2.1-pro-preview"]},{"model_id":"qwen3-7-max-20260517","base_model":"qwen3.7 max 20260517","display_name":"qwen3.7 max 20260517","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.7-max-20260517"]},{"model_id":"gpt-5-3-codex","base_model":"gpt 5.3 codex","display_name":"gpt 5.3 codex","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.3-codex (codex-harness)"]},{"model_id":"minimax-m2-1-preview","base_model":"minimax m2.1 preview","display_name":"minimax m2.1 preview","official_model_id":null,"provider":"MiniMax","aliases":["minimax-m2.1-preview"]},{"model_id":"minimax-m2-5","base_model":"minimax m2.5","display_name":"minimax m2.5","official_model_id":null,"provider":"MiniMax","aliases":["minimax-m2.5"]},{"model_id":"solar-pro4","base_model":"solar pro4","display_name":"solar pro4","official_model_id":null,"provider":"Upstage","aliases":["solar-pro4"]},{"model_id":"laguna-m-1","base_model":"laguna m.1","display_name":"laguna m.1","official_model_id":null,"provider":"Poolside","aliases":["laguna-m.1"]},{"model_id":"gpt-5-1-codex","base_model":"gpt 5.1 codex","display_name":"gpt 5.1 codex","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5.1-codex"]},{"model_id":"mimo-v2-flash","base_model":"mimo v2 flash","display_name":"mimo v2 flash","official_model_id":null,"provider":"Xiaomi","aliases":["mimo-v2-flash (non-thinking)","mimo-v2-flash (thinking)"]},{"model_id":"laguna-xs-2","base_model":"laguna xs.2","display_name":"laguna xs.2","official_model_id":null,"provider":"Poolside","aliases":["laguna-xs.2"]},{"model_id":"minimax-m2","base_model":"minimax m2","display_name":"minimax m2","official_model_id":null,"provider":"MiniMax","aliases":["minimax-m2"]},{"model_id":"qwen3-coder-480b-a35b-instruct","base_model":"qwen3 coder 480b a35b instruct","display_name":"qwen3 coder 480b a35b instruct","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-coder-480b-a35b-instruct"]},{"model_id":"qwen-3-8-27b","base_model":"Qwen 3.8 27B","display_name":"Qwen 3.8 27B","official_model_id":null,"provider":"Alibaba","aliases":["Qwen 3.8 27B"]},{"model_id":"solar-pro-4","base_model":"Solar Pro 4","display_name":"Solar Pro 4","official_model_id":null,"provider":"Upstage","aliases":["Solar Pro 4"]},{"model_id":"gemini-3-1-pro","base_model":"Gemini 3.1 Pro","display_name":"Gemini 3.1 Pro","official_model_id":null,"provider":"Google","aliases":["Gemini 3.1 Pro"]},{"model_id":"grok-4-20","base_model":"Grok-4.20","display_name":"Grok-4.20","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok-4.20"]},{"model_id":"ernie-5-0-preview-1220","base_model":"ernie 5.0 preview 1220","display_name":"ernie 5.0 preview 1220","official_model_id":null,"provider":"Baidu","aliases":["ernie-5.0-preview-1220"]},{"model_id":"gpt-4-1-mini-2025-04-14","base_model":"gpt 4.1 mini 2025 04 14","display_name":"gpt 4.1 mini 2025 04 14","official_model_id":null,"provider":"OpenAI","aliases":["gpt-4.1-mini-2025-04-14"]},{"model_id":"o1-2024-12-17","base_model":"o1 2024 12 17","display_name":"o1 2024 12 17","official_model_id":null,"provider":"OpenAI","aliases":["o1-2024-12-17"]},{"model_id":"claude-sonnet-4-20250514","base_model":"claude sonnet 4.20250514","display_name":"claude sonnet 4.20250514","official_model_id":null,"provider":"Anthropic","aliases":["claude-sonnet-4-20250514"]},{"model_id":"gemini-2-5-flash-lite-preview-06-17-thinking","base_model":"gemini 2.5 flash lite preview 06 17 thinking","display_name":"gemini 2.5 flash lite preview 06 17 thinking","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-flash-lite-preview-06-17-thinking"]},{"model_id":"qwen3-vl-235b-a22b-thinking","base_model":"qwen3 vl 235b a22b thinking","display_name":"qwen3 vl 235b a22b thinking","official_model_id":null,"provider":"Alibaba","aliases":["qwen3-vl-235b-a22b-thinking"]},{"model_id":"qwen-vl-max-2025-08-13","base_model":"qwen vl max 2025 08 13","display_name":"qwen vl max 2025 08 13","official_model_id":null,"provider":"Alibaba","aliases":["qwen-vl-max-2025-08-13"]},{"model_id":"gpt-5-mini","base_model":"gpt 5 mini","display_name":"gpt 5 mini","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-mini-high"]},{"model_id":"claude-3-7-sonnet-20250219","base_model":"claude 3 7 sonnet 20250219","display_name":"claude 3 7 sonnet 20250219","official_model_id":null,"provider":"Anthropic","aliases":["claude-3-7-sonnet-20250219"]},{"model_id":"gemini-2-5-flash-lite-preview-09-2025-no-thinking","base_model":"gemini 2.5 flash lite preview 09 2025 no thinking","display_name":"gemini 2.5 flash lite preview 09 2025 no thinking","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-flash-lite-preview-09-2025-no-thinking"]},{"model_id":"gemini-2-0-flash-001","base_model":"gemini 2.0 flash 001","display_name":"gemini 2.0 flash 001","official_model_id":null,"provider":"Google","aliases":["gemini-2.0-flash-001"]},{"model_id":"gpt-4o-2024-05-13","base_model":"gpt 4o 2024 05 13","display_name":"gpt 4o 2024 05 13","official_model_id":null,"provider":"OpenAI","aliases":["gpt-4o-2024-05-13"]},{"model_id":"claude-3-5-sonnet-20241022","base_model":"claude 3 5 sonnet 20241022","display_name":"claude 3 5 sonnet 20241022","official_model_id":null,"provider":"Anthropic","aliases":["claude-3-5-sonnet-20241022"]},{"model_id":"glm-4-6v","base_model":"glm 4.6v","display_name":"glm 4.6v","official_model_id":null,"provider":"Z.ai","aliases":["glm-4.6v"]},{"model_id":"gemma-3-27b-it","base_model":"gemma 3 27b it","display_name":"gemma 3 27b it","official_model_id":null,"provider":"Google","aliases":["gemma-3-27b-it"]},{"model_id":"hunyuan-vision-1-5-thinking","base_model":"hunyuan vision 1.5 thinking","display_name":"hunyuan vision 1.5 thinking","official_model_id":null,"provider":"Tencent","aliases":["hunyuan-vision-1.5-thinking"]},{"model_id":"step-1o-turbo-202506","base_model":"step 1o turbo 202506","display_name":"step 1o turbo 202506","official_model_id":null,"provider":"StepFun","aliases":["step-1o-turbo-202506"]},{"model_id":"mistral-medium-2505","base_model":"mistral medium 2505","display_name":"mistral medium 2505","official_model_id":null,"provider":"Mistral","aliases":["mistral-medium-2505"]},{"model_id":"glm-4-5v","base_model":"glm 4.5v","display_name":"glm 4.5v","official_model_id":null,"provider":"Z.ai","aliases":["glm-4.5v"]},{"model_id":"hunyuan-large-vision","base_model":"hunyuan large vision","display_name":"hunyuan large vision","official_model_id":null,"provider":"Tencent","aliases":["hunyuan-large-vision"]},{"model_id":"step-3","base_model":"step 3","display_name":"step 3","official_model_id":null,"provider":"StepFun","aliases":["step-3"]},{"model_id":"claude-3-5-sonnet-20240620","base_model":"claude 3 5 sonnet 20240620","display_name":"claude 3 5 sonnet 20240620","official_model_id":null,"provider":"Anthropic","aliases":["claude-3-5-sonnet-20240620"]},{"model_id":"gpt-5-nano","base_model":"gpt 5 nano","display_name":"gpt 5 nano","official_model_id":null,"provider":"OpenAI","aliases":["gpt-5-nano-high"]},{"model_id":"llama-4-maverick-17b-128e-instruct","base_model":"llama 4 maverick 17b 128e instruct","display_name":"llama 4 maverick 17b 128e instruct","official_model_id":null,"provider":"Meta","aliases":["llama-4-maverick-17b-128e-instruct"]},{"model_id":"gemini-1-5-flash-002","base_model":"gemini 1.5 flash 002","display_name":"gemini 1.5 flash 002","official_model_id":null,"provider":"Google","aliases":["gemini-1.5-flash-002"]},{"model_id":"mistral-small-2506","base_model":"mistral small 2506","display_name":"mistral small 2506","official_model_id":null,"provider":"Mistral","aliases":["mistral-small-2506"]},{"model_id":"gemini-2-0-flash-lite-preview-02-05","base_model":"gemini 2.0 flash lite preview 02 05","display_name":"gemini 2.0 flash lite preview 02 05","official_model_id":null,"provider":"Google","aliases":["gemini-2.0-flash-lite-preview-02-05"]},{"model_id":"mistral-small-3-1-24b-instruct-2503","base_model":"mistral small 3.1 24b instruct 2503","display_name":"mistral small 3.1 24b instruct 2503","official_model_id":null,"provider":"Mistral","aliases":["mistral-small-3.1-24b-instruct-2503"]},{"model_id":"llama-4-scout-17b-16e-instruct","base_model":"llama 4 scout 17b 16e instruct","display_name":"llama 4 scout 17b 16e instruct","official_model_id":null,"provider":"Meta","aliases":["llama-4-scout-17b-16e-instruct"]},{"model_id":"claude-3-5-haiku-20241022","base_model":"claude 3 5 haiku 20241022","display_name":"claude 3 5 haiku 20241022","official_model_id":null,"provider":"Anthropic","aliases":["claude-3-5-haiku-20241022"]},{"model_id":"step-1o-vision-32k-highres","base_model":"step 1o vision 32k highres","display_name":"step 1o vision 32k highres","official_model_id":null,"provider":"StepFun","aliases":["step-1o-vision-32k-highres"]},{"model_id":"qwen2-5-vl-72b-instruct","base_model":"qwen2.5 vl 72b instruct","display_name":"qwen2.5 vl 72b instruct","official_model_id":null,"provider":"Alibaba","aliases":["qwen2.5-vl-72b-instruct"]},{"model_id":"gemini-1-5-pro-001","base_model":"gemini 1.5 pro 001","display_name":"gemini 1.5 pro 001","official_model_id":null,"provider":"Google","aliases":["gemini-1.5-pro-001"]},{"model_id":"gpt-4o-2024-08-06","base_model":"gpt 4o 2024 08 06","display_name":"gpt 4o 2024 08 06","official_model_id":null,"provider":"OpenAI","aliases":["gpt-4o-2024-08-06"]},{"model_id":"qwen2-5-vl-32b-instruct","base_model":"qwen2.5 vl 32b instruct","display_name":"qwen2.5 vl 32b instruct","official_model_id":null,"provider":"Alibaba","aliases":["qwen2.5-vl-32b-instruct"]},{"model_id":"molmo-2-8b","base_model":"molmo 2 8b","display_name":"molmo 2 8b","official_model_id":null,"provider":null,"aliases":["molmo-2-8b"]},{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","aliases":["GPT Image 2 (high)","gpt-image-2 (medium)"]},{"model_id":"mai-image-2-6","base_model":"MAI-Image 2.6","display_name":"MAI-Image 2.6","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2.6","mai-image-2.6"]},{"model_id":"grok-imagine-image-2-0","base_model":"Grok Imagine Image 2.0","display_name":"Grok Imagine Image 2.0","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-image-2.0 (low)"]},{"model_id":"reve-2-1","base_model":"Reve 2.1","display_name":"Reve 2.1","official_model_id":null,"provider":"Reve","aliases":["Reve 2.1","reve-2.1"]},{"model_id":"muse-image","base_model":"Muse Image","display_name":"Muse Image","official_model_id":null,"provider":"Meta","aliases":["Muse Image","muse-image"]},{"model_id":"reve-2-0","base_model":"reve 2.0","display_name":"reve 2.0","official_model_id":null,"provider":"Reve","aliases":["reve-2.0"]},{"model_id":"gemini-3-1-flash-image-web-search","base_model":"gemini 3.1 flash image [web search]","display_name":"gemini 3.1 flash image [web search]","official_model_id":null,"provider":"Google","aliases":["gemini-3.1-flash-image (nano-banana-2) [web-search]"]},{"model_id":"seedream-5-0-pro","base_model":"seedream 5.0 pro","display_name":"seedream 5.0 pro","official_model_id":null,"provider":"Bytedance","aliases":["Seedream 5.0 Pro","seedream-5.0-pro"]},{"model_id":"qwen-image-3-0-pro","base_model":"qwen image 3.0 pro","display_name":"qwen image 3.0 pro","official_model_id":null,"provider":"Alibaba","aliases":["Qwen-Image-3.0-Pro","qwen-image-3.0-pro"]},{"model_id":"mai-image-2-5","base_model":"mai image 2.5","display_name":"mai image 2.5","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2.5","mai-image-2.5"]},{"model_id":"gemini-3-1-flash-lite-image","base_model":"gemini 3.1 flash lite image","display_name":"gemini 3.1 flash lite image","official_model_id":null,"provider":"Google","aliases":["gemini-3.1-flash-lite-image (nano-banana-2-lite)"]},{"model_id":"gemini-3-pro-image-2k","base_model":"gemini 3 pro image 2k","display_name":"gemini 3 pro image 2k","official_model_id":null,"provider":"Google","aliases":["gemini-3-pro-image-2k (nano-banana-pro)"]},{"model_id":"gpt-image-1-5-high-fidelity","base_model":"gpt image 1.5 high fidelity","display_name":"gpt image 1.5 high fidelity","official_model_id":null,"provider":"OpenAI","aliases":["gpt-image-1.5-high-fidelity"]},{"model_id":"gemini-3-pro-image-preview","base_model":"gemini 3 pro image preview","display_name":"gemini 3 pro image preview","official_model_id":null,"provider":"Google","aliases":["gemini-3-pro-image-preview (nano-banana-pro)"]},{"model_id":"ideogram-4-0-quality","base_model":"ideogram 4.0 quality","display_name":"ideogram 4.0 quality","official_model_id":null,"provider":"Ideogram","aliases":["ideogram-4.0-quality"]},{"model_id":"qwen-image-2-0-pro-2026-06-22","base_model":"qwen image 2.0 pro 2026 06 22","display_name":"qwen image 2.0 pro 2026 06 22","official_model_id":null,"provider":"Alibaba","aliases":["qwen-image-2.0-pro-2026-06-22"]},{"model_id":"uni-1-1","base_model":"uni 1.1","display_name":"uni 1.1","official_model_id":null,"provider":"Luma AI","aliases":["uni-1.1","uni-1.1-max"]},{"model_id":"mai-image-2","base_model":"mai image 2","display_name":"mai image 2","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2","mai-image-2"]},{"model_id":"grok-imagine-image","base_model":"grok imagine image","display_name":"grok imagine image","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-image"]},{"model_id":"recraft-v4-1-utility-pro","base_model":"recraft v4.1 utility pro","display_name":"recraft v4.1 utility pro","official_model_id":null,"provider":"Recraft","aliases":["Recraft V4.1 Utility Pro","recraft-v4.1-utility-pro"]},{"model_id":"cosmos3-super-text2image","base_model":"Cosmos3-Super-Text2Image","display_name":"Cosmos3-Super-Text2Image","official_model_id":null,"provider":"Nvidia","aliases":["Cosmos3-Super-Text2Image","Cosmos3-Super-Text2Image (Agentic)","Cosmos3-Super-Text2Image (agentic)"]},{"model_id":"flux-2","base_model":"flux 2","display_name":"flux 2","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-2-max"]},{"model_id":"grok-imagine-image-pro","base_model":"grok imagine image pro","display_name":"grok imagine image pro","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-image-pro"]},{"model_id":"flux-2-flex","base_model":"flux 2 flex","display_name":"flux 2 flex","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [flex]","flux-2-flex"]},{"model_id":"flux-2-pro","base_model":"flux 2 pro","display_name":"flux 2 pro","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [pro]","flux-2-pro"]},{"model_id":"reve-v1-5","base_model":"reve v1.5","display_name":"reve v1.5","official_model_id":null,"provider":"Reve","aliases":["reve-v1.5"]},{"model_id":"hunyuan-image-3-0","base_model":"hunyuan image 3.0","display_name":"hunyuan image 3.0","official_model_id":null,"provider":"Tencent","aliases":["hunyuan-image-3.0"]},{"model_id":"gemini-2-5-flash-image-preview","base_model":"gemini 2.5 flash image preview","display_name":"gemini 2.5 flash image preview","official_model_id":null,"provider":"Google","aliases":["gemini-2.5-flash-image-preview (nano-banana)"]},{"model_id":"imagen-ultra-4-0-generate-001","base_model":"imagen ultra 4.0 generate 001","display_name":"imagen ultra 4.0 generate 001","official_model_id":null,"provider":"Google","aliases":["imagen-ultra-4.0-generate-001"]},{"model_id":"seedream-4-5","base_model":"seedream 4.5","display_name":"seedream 4.5","official_model_id":null,"provider":"Bytedance","aliases":["Seedream 4.5","seedream-4.5"]},{"model_id":"flux-2-dev","base_model":"flux 2 dev","display_name":"flux 2 dev","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [dev]","flux-2-dev"]},{"model_id":"seedream-4-2k","base_model":"seedream 4 2k","display_name":"seedream 4 2k","official_model_id":null,"provider":"Bytedance","aliases":["seedream-4-2k"]},{"model_id":"seedream-5-0-lite","base_model":"seedream 5.0 lite","display_name":"seedream 5.0 lite","official_model_id":null,"provider":"Bytedance","aliases":["Seedream 5.0 Lite","seedream-5.0-lite"]},{"model_id":"wan2-6-t2i","base_model":"wan2.6 t2i","display_name":"wan2.6 t2i","official_model_id":null,"provider":"Alibaba","aliases":["wan2.6-t2i"]},{"model_id":"recraft-v4-1-pro","base_model":"recraft v4.1 pro","display_name":"recraft v4.1 pro","official_model_id":null,"provider":"Recraft","aliases":["Recraft V4.1 Pro","recraft-v4.1-pro"]},{"model_id":"imagen-4-0-generate-001","base_model":"imagen 4.0 generate 001","display_name":"imagen 4.0 generate 001","official_model_id":null,"provider":"Google","aliases":["imagen-4.0-generate-001"]},{"model_id":"qwen-image-2512","base_model":"qwen image 2512","display_name":"qwen image 2512","official_model_id":null,"provider":"Alibaba","aliases":["qwen-image-2512"]},{"model_id":"krea-2","base_model":"krea 2","display_name":"krea 2","official_model_id":null,"provider":"Krea","aliases":["Krea 2 Medium","krea-2-medium"]},{"model_id":"wan2-5-t2i-preview","base_model":"wan2.5 t2i preview","display_name":"wan2.5 t2i preview","official_model_id":null,"provider":"Alibaba","aliases":["wan2.5-t2i-preview"]},{"model_id":"hidream-o1-image","base_model":"hidream o1 image","display_name":"hidream o1 image","official_model_id":null,"provider":"HiDream","aliases":["HiDream-O1-Image","hidream-o1-image"]},{"model_id":"seedream-4-fal","base_model":"seedream 4 fal","display_name":"seedream 4 fal","official_model_id":null,"provider":"Bytedance","aliases":["seedream-4-fal"]},{"model_id":"gpt-image-1","base_model":"gpt image 1","display_name":"gpt image 1","official_model_id":null,"provider":"OpenAI","aliases":["GPT Image 1 (high)","gpt-image-1"]},{"model_id":"recraft-v4","base_model":"recraft v4","display_name":"recraft v4","official_model_id":null,"provider":"Recraft","aliases":["Recraft V4","recraft-v4"]},{"model_id":"seedream-4-high-res-fal","base_model":"seedream 4 high res fal","display_name":"seedream 4 high res fal","official_model_id":null,"provider":"Bytedance","aliases":["seedream-4-high-res-fal"]},{"model_id":"krea-2-turbo","base_model":"krea 2 turbo","display_name":"krea 2 turbo","official_model_id":null,"provider":"Krea","aliases":["krea-2-turbo"]},{"model_id":"gpt-image-1-mini","base_model":"gpt image 1 mini","display_name":"gpt image 1 mini","official_model_id":null,"provider":"OpenAI","aliases":["GPT Image 1 Mini (medium)","gpt-image-1-mini"]},{"model_id":"krea-2-large","base_model":"krea 2 large","display_name":"krea 2 large","official_model_id":null,"provider":"Krea","aliases":["Krea 2 Large","krea-2-large"]},{"model_id":"wan2-7-image-pro","base_model":"wan2.7 image pro","display_name":"wan2.7 image pro","official_model_id":null,"provider":"Alibaba","aliases":["wan2.7-image-pro"]},{"model_id":"wan2-7-image","base_model":"wan2.7 image","display_name":"wan2.7 image","official_model_id":null,"provider":"Alibaba","aliases":["wan2.7-image"]},{"model_id":"mai-image-1","base_model":"mai image 1","display_name":"mai image 1","official_model_id":null,"provider":"Microsoft AI","aliases":["mai-image-1"]},{"model_id":"z-image-turbo","base_model":"z image turbo","display_name":"z image turbo","official_model_id":null,"provider":"Alibaba","aliases":["Z-Image Turbo","z-image-turbo"]},{"model_id":"seedream-3","base_model":"seedream 3","display_name":"seedream 3","official_model_id":null,"provider":"Bytedance","aliases":["seedream-3"]},{"model_id":"flux-1-kontext","base_model":"flux 1 kontext","display_name":"flux 1 kontext","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-1-kontext-max"]},{"model_id":"flux-2-klein-9b","base_model":"flux 2 klein 9b","display_name":"flux 2 klein 9b","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [klein] 9B","flux-2-klein-9b"]},{"model_id":"qwen-image-prompt-extend","base_model":"qwen image prompt extend","display_name":"qwen image prompt extend","official_model_id":null,"provider":"Alibaba","aliases":["qwen-image-prompt-extend"]},{"model_id":"flux-1-kontext-pro","base_model":"flux 1 kontext pro","display_name":"flux 1 kontext pro","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.1 Kontext [pro]","flux-1-kontext-pro"]},{"model_id":"imagen-3-0-generate-002","base_model":"imagen 3.0 generate 002","display_name":"imagen 3.0 generate 002","official_model_id":null,"provider":"Google","aliases":["imagen-3.0-generate-002"]},{"model_id":"qwen-image","base_model":"qwen image","display_name":"qwen image","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image","qwen-image"]},{"model_id":"ideogram-v3-quality","base_model":"ideogram v3 quality","display_name":"ideogram v3 quality","official_model_id":null,"provider":"Ideogram","aliases":["ideogram-v3-quality"]},{"model_id":"photon","base_model":"photon","display_name":"photon","official_model_id":null,"provider":"Luma AI","aliases":["photon"]},{"model_id":"flux-2-klein-4b","base_model":"flux 2 klein 4b","display_name":"flux 2 klein 4b","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-2-klein-4b"]},{"model_id":"runway-gen4","base_model":"runway gen4","display_name":"runway gen4","official_model_id":null,"provider":"Runway","aliases":["runway-gen4"]},{"model_id":"recraft-v3","base_model":"recraft v3","display_name":"recraft v3","official_model_id":null,"provider":"Recraft","aliases":["Recraft V3","recraft-v3"]},{"model_id":"flux-1-1-pro","base_model":"flux 1.1 pro","display_name":"flux 1.1 pro","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-1.1-pro"]},{"model_id":"lucid-origin","base_model":"lucid origin","display_name":"lucid origin","official_model_id":null,"provider":"Leonardo AI","aliases":["lucid-origin"]},{"model_id":"ideogram-v2","base_model":"ideogram v2","display_name":"ideogram v2","official_model_id":null,"provider":"Ideogram","aliases":["Ideogram v2","ideogram-v2"]},{"model_id":"glm-image","base_model":"glm image","display_name":"glm image","official_model_id":null,"provider":"Z.ai","aliases":["GLM-Image","glm-image"]},{"model_id":"gemini-2-0-flash-preview-image-generation","base_model":"gemini 2.0 flash preview image generation","display_name":"gemini 2.0 flash preview image generation","official_model_id":null,"provider":"Google","aliases":["gemini-2.0-flash-preview-image-generation"]},{"model_id":"flux-1-dev-fp8","base_model":"flux 1 dev fp8","display_name":"flux 1 dev fp8","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-1-dev-fp8"]},{"model_id":"dall-e-3","base_model":"dall e 3","display_name":"dall e 3","official_model_id":null,"provider":"OpenAI","aliases":["dall-e-3"]},{"model_id":"flux-1-kontext-dev","base_model":"flux 1 kontext dev","display_name":"flux 1 kontext dev","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-1-kontext-dev"]},{"model_id":"bagel","base_model":"bagel","display_name":"bagel","official_model_id":null,"provider":"Bytedance","aliases":["bagel"]},{"model_id":"nano-banana-2","base_model":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","display_name":"Nano Banana 2 (Gemini 3.1 Flash Image Preview)","official_model_id":null,"provider":"Google","aliases":["Nano Banana 2 (Gemini 3.1 Flash Image)"]},{"model_id":"gpt-image-1-5","base_model":"GPT Image 1.5","display_name":"GPT Image 1.5","official_model_id":null,"provider":"OpenAI","aliases":["GPT Image 1.5 (high)"]},{"model_id":"mai-image-2-6-flash","base_model":"MAI-Image-2.6-Flash","display_name":"MAI-Image-2.6-Flash","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2.6-Flash"]},{"model_id":"nano-banana-pro","base_model":"Nano Banana Pro","display_name":"Nano Banana Pro","official_model_id":null,"provider":"Google","aliases":["Nano Banana Pro (Gemini 3 Pro Image)"]},{"model_id":"mai-image-2-5-pro","base_model":"MAI-Image-2.5-Pro","display_name":"MAI-Image-2.5-Pro","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2.5-Pro"]},{"model_id":"nano-banana-2-lite","base_model":"Nano Banana 2 Lite","display_name":"Nano Banana 2 Lite","official_model_id":null,"provider":"Google","aliases":["Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)"]},{"model_id":"qwen-image-3-0","base_model":"Qwen-Image-3.0","display_name":"Qwen-Image-3.0","official_model_id":null,"provider":"Alibaba","aliases":["Qwen-Image-3.0"]},{"model_id":"grok-imagine-image-quality","base_model":"grok imagine image quality","display_name":"grok imagine image quality","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-image-quality"]},{"model_id":"qwen-image-2-0-pro","base_model":"Qwen Image 2.0 Pro","display_name":"Qwen Image 2.0 Pro","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image 2.0 Pro (2026-04-22)"]},{"model_id":"hidream-o1-image-1-5","base_model":"HiDream-O1-Image-1.5","display_name":"HiDream-O1-Image-1.5","official_model_id":null,"provider":"HiDream","aliases":["HiDream-O1-Image-1.5"]},{"model_id":"mai-image-2-5-flash","base_model":"MAI-Image-2.5-Flash","display_name":"MAI-Image-2.5-Flash","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2.5-Flash"]},{"model_id":"flux-2-max","base_model":"FLUX.2 [max]","display_name":"FLUX.2 [max]","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [max]"]},{"model_id":"seedream-4-0","base_model":"Seedream 4.0","display_name":"Seedream 4.0","official_model_id":null,"provider":"ByteDance Seed","aliases":["Seedream 4.0"]},{"model_id":"luma-uni-1","base_model":"Luma UNI 1","display_name":"Luma UNI 1","official_model_id":null,"provider":"Luma Labs","aliases":["Luma UNI 1","Luma UNI 1 Max"]},{"model_id":"krea-2-medium-turbo","base_model":"Krea 2 Medium Turbo","display_name":"Krea 2 Medium Turbo","official_model_id":null,"provider":"Krea","aliases":["Krea 2 Medium Turbo"]},{"model_id":"recraft-v4-1-utility","base_model":"Recraft V4.1 Utility","display_name":"Recraft V4.1 Utility","official_model_id":null,"provider":"Recraft","aliases":["Recraft V4.1 Utility"]},{"model_id":"ideogram-4-0","base_model":"Ideogram 4.0","display_name":"Ideogram 4.0","official_model_id":null,"provider":"Ideogram","aliases":["Ideogram 4.0","Ideogram 4.0 (Quality)"]},{"model_id":"wan2-6-text-to-image","base_model":"Wan2.6 Text to Image","display_name":"Wan2.6 Text to Image","official_model_id":null,"provider":"Alibaba","aliases":["Wan2.6 Text to Image"]},{"model_id":"wan-2-6-image","base_model":"Wan 2.6 Image","display_name":"Wan 2.6 Image","official_model_id":null,"provider":"Alibaba","aliases":["Wan 2.6 Image"]},{"model_id":"p-image-ideogram","base_model":"P-Image-Ideogram","display_name":"P-Image-Ideogram","official_model_id":null,"provider":"Pruna AI","aliases":["P-Image-Ideogram (High)","P-Image-Ideogram (Low)","P-Image-Ideogram (Medium)","P-Image-Ideogram (Very Low)"]},{"model_id":"recraft-v4-1","base_model":"Recraft V4.1","display_name":"Recraft V4.1","official_model_id":null,"provider":"Recraft","aliases":["Recraft V4.1"]},{"model_id":"flux-2-dev-turbo","base_model":"FLUX.2 [dev] Turbo","display_name":"FLUX.2 [dev] Turbo","official_model_id":null,"provider":"Fal","aliases":["FLUX.2 [dev] Turbo"]},{"model_id":"ideogram-4-0-fast","base_model":"Ideogram 4.0 Fast","display_name":"Ideogram 4.0 Fast","official_model_id":null,"provider":"Fal","aliases":["Ideogram 4.0 Fast","Ideogram 4.0 Fast (Quality)"]},{"model_id":"recraft-v4-pro","base_model":"Recraft V4 Pro","display_name":"Recraft V4 Pro","official_model_id":null,"provider":"Recraft","aliases":["Recraft V4 Pro"]},{"model_id":"nano-banana","base_model":"Nano Banana","display_name":"Nano Banana","official_model_id":null,"provider":"Google","aliases":["Nano Banana (Gemini 2.5 Flash Image)"]},{"model_id":"imagen-4-ultra","base_model":"Imagen 4 Ultra","display_name":"Imagen 4 Ultra","official_model_id":null,"provider":"Google","aliases":["Imagen 4 Ultra"]},{"model_id":"ideogram-4-0-instant","base_model":"Ideogram 4.0 Instant","display_name":"Ideogram 4.0 Instant","official_model_id":null,"provider":"Fal","aliases":["Ideogram 4.0 Instant"]},{"model_id":"mai-image-2-efficient","base_model":"MAI-Image-2-Efficient","display_name":"MAI-Image-2-Efficient","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Image-2-Efficient"]},{"model_id":"wan-2-7-pro","base_model":"Wan 2.7 Pro","display_name":"Wan 2.7 Pro","official_model_id":null,"provider":"Alibaba","aliases":["Wan 2.7 Pro"]},{"model_id":"flux-2-dev-flash","base_model":"FLUX.2 [dev] Flash","display_name":"FLUX.2 [dev] Flash","official_model_id":null,"provider":"Fal","aliases":["FLUX.2 [dev] Flash"]},{"model_id":"imagineart-2-0","base_model":"ImagineArt 2.0","display_name":"ImagineArt 2.0","official_model_id":null,"provider":"ImagineArt","aliases":["ImagineArt 2.0"]},{"model_id":"wan-2-7","base_model":"Wan 2.7","display_name":"Wan 2.7","official_model_id":null,"provider":"Alibaba","aliases":["Wan 2.7"]},{"model_id":"qwen-image-max-2512","base_model":"Qwen Image Max 2512","display_name":"Qwen Image Max 2512","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image Max 2512"]},{"model_id":"imagineart-1-5-preview","base_model":"ImagineArt 1.5 Preview","display_name":"ImagineArt 1.5 Preview","official_model_id":null,"provider":"ImagineArt","aliases":["ImagineArt 1.5 Preview"]},{"model_id":"cosmos3-super-text2image-4step","base_model":"Cosmos3-Super-Text2Image-4Step","display_name":"Cosmos3-Super-Text2Image-4Step","official_model_id":null,"provider":"NVIDIA","aliases":["Cosmos3-Super-Text2Image-4Step"]},{"model_id":"seedream-3-0","base_model":"Seedream 3.0","display_name":"Seedream 3.0","official_model_id":null,"provider":"ByteDance Seed","aliases":["Seedream 3.0"]},{"model_id":"hunyuanimage-3-0-instruct","base_model":"HunyuanImage 3.0 Instruct","display_name":"HunyuanImage 3.0 Instruct","official_model_id":null,"provider":"Tencent","aliases":["HunyuanImage 3.0 Instruct (Fal)"]},{"model_id":"vivago-2-1","base_model":"Vivago 2.1","display_name":"Vivago 2.1","official_model_id":null,"provider":"HiDream","aliases":["Vivago 2.1"]},{"model_id":"wan-2-5-preview","base_model":"Wan 2.5 Preview","display_name":"Wan 2.5 Preview","official_model_id":null,"provider":"Alibaba","aliases":["Wan 2.5 Preview"]},{"model_id":"kolors-2-1","base_model":"Kolors 2.1","display_name":"Kolors 2.1","official_model_id":null,"provider":"KlingAI","aliases":["Kolors 2.1"]},{"model_id":"image-1","base_model":"image 1","display_name":"image 1","official_model_id":null,"provider":"Api Airforce","aliases":["image-1"]},{"model_id":"flux-1-kontext-max","base_model":"FLUX.1 Kontext [max]","display_name":"FLUX.1 Kontext [max]","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.1 Kontext [max]"]},{"model_id":"qwen-image-2-0","base_model":"Qwen Image 2.0","display_name":"Qwen Image 2.0","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image 2.0 (2026-03-03)"]},{"model_id":"hunyuanimage-3-0","base_model":"HunyuanImage 3.0","display_name":"HunyuanImage 3.0","official_model_id":null,"provider":"Tencent","aliases":["HunyuanImage 3.0 (Fal)"]},{"model_id":"vivago-2-0","base_model":"Vivago 2.0","display_name":"Vivago 2.0","official_model_id":null,"provider":"HiDream","aliases":["Vivago 2.0"]},{"model_id":"imagen-3","base_model":"Imagen 3","display_name":"Imagen 3","official_model_id":null,"provider":"Google","aliases":["Imagen 3 (v002)"]},{"model_id":"imagen-4-standard","base_model":"Imagen 4 Standard","display_name":"Imagen 4 Standard","official_model_id":null,"provider":"Google","aliases":["Imagen 4 Standard"]},{"model_id":"ernie-image-turbo","base_model":"ERNIE Image Turbo","display_name":"ERNIE Image Turbo","official_model_id":null,"provider":"Baidu","aliases":["ERNIE Image Turbo"]},{"model_id":"lucid-origin-ultra","base_model":"Lucid Origin Ultra","display_name":"Lucid Origin Ultra","official_model_id":null,"provider":"Leonardo.Ai","aliases":["Lucid Origin Ultra"]},{"model_id":"eigen-image","base_model":"Eigen Image","display_name":"Eigen Image","official_model_id":null,"provider":"Eigen AI","aliases":["Eigen Image"]},{"model_id":"ernie-image","base_model":"ERNIE Image","display_name":"ERNIE Image","official_model_id":null,"provider":"Baidu","aliases":["ERNIE Image"]},{"model_id":"vidu-q2","base_model":"Vidu Q2","display_name":"Vidu Q2","official_model_id":null,"provider":"Vidu","aliases":["Vidu Q2"]},{"model_id":"reve-image","base_model":"Reve Image","display_name":"Reve Image","official_model_id":null,"provider":"Reve","aliases":["Reve Image (Halfmoon)"]},{"model_id":"kling-image-3-0-omni","base_model":"Kling Image 3.0 Omni","display_name":"Kling Image 3.0 Omni","official_model_id":null,"provider":"KlingAI","aliases":["Kling Image 3.0 Omni"]},{"model_id":"lucid-origin-fast","base_model":"Lucid Origin Fast","display_name":"Lucid Origin Fast","official_model_id":null,"provider":"Leonardo.Ai","aliases":["Lucid Origin Fast"]},{"model_id":"dreamina-3-1","base_model":"Dreamina 3.1","display_name":"Dreamina 3.1","official_model_id":null,"provider":"Bytedance","aliases":["Dreamina 3.1"]},{"model_id":"qwen-image-plus-2601","base_model":"Qwen Image Plus 2601","display_name":"Qwen Image Plus 2601","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image Plus 2601"]},{"model_id":"flux1-1-pro-ultra","base_model":"FLUX1.1 [pro] Ultra","display_name":"FLUX1.1 [pro] Ultra","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX1.1 [pro] Ultra"]},{"model_id":"ideogram-3-0","base_model":"Ideogram 3.0","display_name":"Ideogram 3.0","official_model_id":null,"provider":"Ideogram","aliases":["Ideogram 3.0"]},{"model_id":"imagen-4-fast","base_model":"Imagen 4 Fast","display_name":"Imagen 4 Fast","official_model_id":null,"provider":"Google","aliases":["Imagen 4 Fast"]},{"model_id":"flux-2-klein-base-9b","base_model":"FLUX.2 [klein] Base 9B","display_name":"FLUX.2 [klein] Base 9B","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [klein] Base 9B"]},{"model_id":"midjourney-v7-alpha","base_model":"Midjourney v7 Alpha","display_name":"Midjourney v7 Alpha","official_model_id":null,"provider":"Midjourney","aliases":["Midjourney v7 Alpha"]},{"model_id":"flux1-1-pro","base_model":"FLUX1.1 [pro]","display_name":"FLUX1.1 [pro]","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX1.1 [pro]"]},{"model_id":"p-image","base_model":"P-Image","display_name":"P-Image","official_model_id":null,"provider":"Pruna AI","aliases":["P-Image"]},{"model_id":"flux-1-pro","base_model":"FLUX.1 [pro]","display_name":"FLUX.1 [pro]","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.1 [pro]"]},{"model_id":"srpo","base_model":"SRPO","display_name":"SRPO","official_model_id":null,"provider":"Tencent","aliases":["SRPO"]},{"model_id":"hunyuanimage-2-1","base_model":"HunyuanImage 2.1","display_name":"HunyuanImage 2.1","official_model_id":null,"provider":"Tencent","aliases":["HunyuanImage 2.1"]},{"model_id":"midjourney-v6","base_model":"Midjourney v6","display_name":"Midjourney v6","official_model_id":null,"provider":"Midjourney","aliases":["Midjourney v6"]},{"model_id":"ideogram-v2-turbo","base_model":"Ideogram v2 Turbo","display_name":"Ideogram v2 Turbo","official_model_id":null,"provider":"Ideogram","aliases":["Ideogram v2 Turbo"]},{"model_id":"fibo","base_model":"FIBO","display_name":"FIBO","official_model_id":null,"provider":"Bria","aliases":["FIBO"]},{"model_id":"hidream-o1-image-dev","base_model":"HiDream-O1-Image-Dev","display_name":"HiDream-O1-Image-Dev","official_model_id":null,"provider":"HiDream","aliases":["HiDream-O1-Image-Dev"]},{"model_id":"luma-photon","base_model":"Luma Photon","display_name":"Luma Photon","official_model_id":null,"provider":"Luma Labs","aliases":["Luma Photon"]},{"model_id":"hidream-i1-dev","base_model":"HiDream-I1-Dev","display_name":"HiDream-I1-Dev","official_model_id":null,"provider":"HiDream","aliases":["HiDream-I1-Dev"]},{"model_id":"image-01","base_model":"Image-01","display_name":"Image-01","official_model_id":null,"provider":"MiniMax","aliases":["Image-01"]},{"model_id":"z-image-base","base_model":"Z-Image Base","display_name":"Z-Image Base","official_model_id":null,"provider":"Alibaba","aliases":["Z-Image Base"]},{"model_id":"chatgpt-image-latest-high-fidelity","base_model":"chatgpt image latest high fidelity","display_name":"chatgpt image latest high fidelity","official_model_id":null,"provider":"OpenAI","aliases":["chatgpt-image-latest-high-fidelity (20251216)"]},{"model_id":"hunyuan-image-3-0-instruct","base_model":"hunyuan image 3.0 instruct","display_name":"hunyuan image 3.0 instruct","official_model_id":null,"provider":"Tencent","aliases":["hunyuan-image-3.0-instruct"]},{"model_id":"reve-v1-1","base_model":"reve v1.1","display_name":"reve v1.1","official_model_id":null,"provider":"Reve","aliases":["reve-v1.1"]},{"model_id":"kling-image-o1","base_model":"kling image o1","display_name":"kling image o1","official_model_id":null,"provider":"KlingAI","aliases":["Kling Image O1","kling-image-o1"]},{"model_id":"qwen-image-edit","base_model":"qwen image edit","display_name":"qwen image edit","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image Edit","qwen-image-edit"]},{"model_id":"qwen-image-edit-2511","base_model":"qwen image edit 2511","display_name":"qwen image edit 2511","official_model_id":null,"provider":"Alibaba","aliases":["qwen-image-edit-2511"]},{"model_id":"reve-v1","base_model":"reve v1","display_name":"reve v1","official_model_id":null,"provider":"Reve","aliases":["Reve V1 (December)","reve-v1"]},{"model_id":"wan2-6-image","base_model":"wan2.6 image","display_name":"wan2.6 image","official_model_id":null,"provider":"Alibaba","aliases":["wan2.6-image"]},{"model_id":"reve-v1-1-fast","base_model":"reve v1.1 fast","display_name":"reve v1.1 fast","official_model_id":null,"provider":"Reve","aliases":["reve-v1.1-fast"]},{"model_id":"reve-edit-fast","base_model":"reve edit fast","display_name":"reve edit fast","official_model_id":null,"provider":"Reve","aliases":["reve-edit-fast"]},{"model_id":"wan2-5-i2i-preview","base_model":"wan2.5 i2i preview","display_name":"wan2.5 i2i preview","official_model_id":null,"provider":"Alibaba","aliases":["wan2.5-i2i-preview"]},{"model_id":"seededit-3-0","base_model":"seededit 3.0","display_name":"seededit 3.0","official_model_id":null,"provider":"Bytedance","aliases":["SeedEdit 3.0","seededit-3.0"]},{"model_id":"step1x-edit","base_model":"step1x edit","display_name":"step1x edit","official_model_id":null,"provider":"StepFun","aliases":["Step1X-Edit","step1x-edit"]},{"model_id":"hidream-o1-edit-1-5","base_model":"HiDream-O1-Edit-1.5","display_name":"HiDream-O1-Edit-1.5","official_model_id":null,"provider":"HiDream","aliases":["HiDream-O1-Edit-1.5"]},{"model_id":"dreamimage-2-0","base_model":"DreamImage 2.0","display_name":"DreamImage 2.0","official_model_id":null,"provider":"Newport AI","aliases":["DreamImage 2.0"]},{"model_id":"step-image-edit-2","base_model":"Step Image Edit 2","display_name":"Step Image Edit 2","official_model_id":null,"provider":"StepFun","aliases":["Step Image Edit 2"]},{"model_id":"kling-image-3-0","base_model":"Kling Image 3.0","display_name":"Kling Image 3.0","official_model_id":null,"provider":"KlingAI","aliases":["Kling Image 3.0"]},{"model_id":"agnes-image-2-0-flash","base_model":"Agnes Image 2.0 Flash","display_name":"Agnes Image 2.0 Flash","official_model_id":null,"provider":"Sapiens AI","aliases":["Agnes Image 2.0 Flash"]},{"model_id":"qwen-image-edit-plus-2511","base_model":"Qwen Image Edit Plus 2511","display_name":"Qwen Image Edit Plus 2511","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image Edit Plus 2511"]},{"model_id":"p-image-edit","base_model":"P-Image-Edit","display_name":"P-Image-Edit","official_model_id":null,"provider":"Pruna AI","aliases":["P-Image-Edit"]},{"model_id":"qwen-image-edit-max-2601","base_model":"Qwen Image Edit Max 2601","display_name":"Qwen Image Edit Max 2601","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image Edit Max 2601"]},{"model_id":"qwen-image-edit-plus-2509","base_model":"Qwen Image Edit Plus 2509","display_name":"Qwen Image Edit Plus 2509","official_model_id":null,"provider":"Alibaba","aliases":["Qwen Image Edit Plus 2509"]},{"model_id":"longcat-image","base_model":"LongCat Image","display_name":"LongCat Image","official_model_id":null,"provider":"Meituan","aliases":["LongCat Image"]},{"model_id":"step1x-edit-v1p2","base_model":"Step1X-Edit-v1p2","display_name":"Step1X-Edit-v1p2","official_model_id":null,"provider":"StepFun","aliases":["Step1X-Edit-v1p2"]},{"model_id":"fibo-edit","base_model":"FIBO Edit","display_name":"FIBO Edit","official_model_id":null,"provider":"Bria","aliases":["FIBO Edit"]},{"model_id":"flux-2-klein-base-4b","base_model":"FLUX.2 [klein] Base 4B","display_name":"FLUX.2 [klein] Base 4B","official_model_id":null,"provider":"Black Forest Labs","aliases":["FLUX.2 [klein] Base 4B"]},{"model_id":"hidream-e1-1","base_model":"HiDream-E1.1","display_name":"HiDream-E1.1","official_model_id":null,"provider":"HiDream","aliases":["HiDream-E1.1"]},{"model_id":"step1x-edit-v1p2-preview","base_model":"step1x edit v1p2 preview","display_name":"step1x edit v1p2 preview","official_model_id":null,"provider":"StepFun","aliases":["step1x-edit-v1p2-preview"]},{"model_id":"omnigen-v2","base_model":"OmniGen V2","display_name":"OmniGen V2","official_model_id":null,"provider":"VectorSpaceLab","aliases":["OmniGen V2"]},{"model_id":"hidream-e1-full","base_model":"HiDream-E1-Full","display_name":"HiDream-E1-Full","official_model_id":null,"provider":"HiDream","aliases":["HiDream-E1-Full"]},{"model_id":"gemini-omni-1-1-flash","base_model":"Gemini Omni 1.1 Flash","display_name":"Gemini Omni 1.1 Flash","official_model_id":null,"provider":"Google","aliases":["gemini-omni-1.1-flash"]},{"model_id":"gemini-omni-flash","base_model":"Gemini Omni Flash","display_name":"Gemini Omni Flash","official_model_id":null,"provider":"Google","aliases":["Gemini Omni Flash","gemini-omni-flash"]},{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","aliases":["Wan 3.0","wan3.0"]},{"model_id":"flux-3-video","base_model":"flux 3 video","display_name":"flux 3 video","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-3-video"]},{"model_id":"grok-imagine-video-1-5-agent","base_model":"grok imagine video 1.5 agent","display_name":"grok imagine video 1.5 agent","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-video-1.5-agent"]},{"model_id":"dreamina-seedance-2-5","base_model":"dreamina seedance 2.5","display_name":"dreamina seedance 2.5","official_model_id":null,"provider":"Bytedance","aliases":["dreamina-seedance-2.5-720p"]},{"model_id":"dreamina-seedance-2-0","base_model":"Dreamina Seedance 2.0","display_name":"Dreamina Seedance 2.0","official_model_id":null,"provider":"Bytedance","aliases":["Dreamina Seedance 2.0 720p","dreamina-seedance-2.0-720p"]},{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","aliases":["MiniMax H3","Minimax H3 Max (post-trained by fal)","minimax-h3"]},{"model_id":"muse-video","base_model":"muse video","display_name":"muse video","official_model_id":null,"provider":"Meta","aliases":["muse-video"]},{"model_id":"happyhorse-1-0","base_model":"happyhorse 1.0","display_name":"happyhorse 1.0","official_model_id":null,"provider":"Alibaba-ATH","aliases":["HappyHorse-1.0","happyhorse-1.0"]},{"model_id":"sora-2-pro","base_model":"sora 2 pro","display_name":"sora 2 pro","official_model_id":null,"provider":"OpenAI","aliases":["sora-2-pro"]},{"model_id":"veo-3-1-audio","base_model":"veo 3.1 audio","display_name":"veo 3.1 audio","official_model_id":null,"provider":"Google","aliases":["veo-3.1-audio","veo-3.1-audio-1080p"]},{"model_id":"veo-3-1-fast-audio","base_model":"veo 3.1 fast audio","display_name":"veo 3.1 fast audio","official_model_id":null,"provider":"Google","aliases":["veo-3.1-fast-audio","veo-3.1-fast-audio-1080p"]},{"model_id":"veo-3-fast-audio","base_model":"veo 3 fast audio","display_name":"veo 3 fast audio","official_model_id":null,"provider":"Google","aliases":["veo-3-fast-audio"]},{"model_id":"grok-imagine-video","base_model":"grok imagine video","display_name":"grok imagine video","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-video","grok-imagine-video-720p"]},{"model_id":"sora-2","base_model":"sora 2","display_name":"sora 2","official_model_id":null,"provider":"OpenAI","aliases":["sora-2"]},{"model_id":"wan2-7-t2v","base_model":"wan2.7 t2v","display_name":"wan2.7 t2v","official_model_id":null,"provider":"Alibaba","aliases":["wan2.7-t2v"]},{"model_id":"veo-3-audio","base_model":"veo 3 audio","display_name":"veo 3 audio","official_model_id":null,"provider":"Google","aliases":["veo-3-audio"]},{"model_id":"wan2-6-t2v","base_model":"wan2.6 t2v","display_name":"wan2.6 t2v","official_model_id":null,"provider":"Alibaba","aliases":["wan2.6-t2v"]},{"model_id":"seedance-v1-5-pro","base_model":"seedance v1.5 pro","display_name":"seedance v1.5 pro","official_model_id":null,"provider":"Bytedance","aliases":["seedance-v1.5-pro"]},{"model_id":"veo-3","base_model":"veo 3","display_name":"veo 3","official_model_id":null,"provider":"Google","aliases":["veo-3"]},{"model_id":"veo-3-fast","base_model":"veo 3 fast","display_name":"veo 3 fast","official_model_id":null,"provider":"Google","aliases":["veo-3-fast"]},{"model_id":"wan2-5-t2v-preview","base_model":"wan2.5 t2v preview","display_name":"wan2.5 t2v preview","official_model_id":null,"provider":"Alibaba","aliases":["wan2.5-t2v-preview"]},{"model_id":"runway-gen-4-5","base_model":"runway gen 4.5","display_name":"runway gen 4.5","official_model_id":null,"provider":"Runway","aliases":["runway-gen-4.5"]},{"model_id":"kling-2-5-turbo","base_model":"kling 2.5 turbo","display_name":"kling 2.5 turbo","official_model_id":null,"provider":"KlingAI","aliases":["kling-2.5-turbo-1080p"]},{"model_id":"kling-2-6-pro","base_model":"kling 2.6 pro","display_name":"kling 2.6 pro","official_model_id":null,"provider":"KlingAI","aliases":["Kling 2.6 Pro (January)","kling-2.6-pro"]},{"model_id":"ray-3","base_model":"ray 3","display_name":"ray 3","official_model_id":null,"provider":"Luma AI","aliases":["ray-3"]},{"model_id":"hailuo-2-3","base_model":"hailuo 2.3","display_name":"hailuo 2.3","official_model_id":null,"provider":"MiniMax","aliases":["hailuo-2.3"]},{"model_id":"kling-o1-pro","base_model":"kling o1 pro","display_name":"kling o1 pro","official_model_id":null,"provider":"KlingAI","aliases":["kling-o1-pro"]},{"model_id":"hailuo-02-pro","base_model":"hailuo 02 pro","display_name":"hailuo 02 pro","official_model_id":null,"provider":"MiniMax","aliases":["hailuo-02-pro"]},{"model_id":"seedance-v1-pro","base_model":"seedance v1 pro","display_name":"seedance v1 pro","official_model_id":null,"provider":"Bytedance","aliases":["seedance-v1-pro"]},{"model_id":"hailuo-02-standard","base_model":"hailuo 02 standard","display_name":"hailuo 02 standard","official_model_id":null,"provider":"MiniMax","aliases":["hailuo-02-standard"]},{"model_id":"image-kandinsky","base_model":"Image: Kandinsky","display_name":"Image: Kandinsky","official_model_id":null,"provider":"cite31†kandinsky-5.0-t2v-pro†github.com Kandinsky","aliases":["Image: Kandinsky"]},{"model_id":"hunyuan-video-1-5","base_model":"hunyuan video 1.5","display_name":"hunyuan video 1.5","official_model_id":null,"provider":"Tencent","aliases":["hunyuan-video-1.5"]},{"model_id":"veo-2","base_model":"veo 2","display_name":"veo 2","official_model_id":null,"provider":"Google","aliases":["veo-2"]},{"model_id":"kling-v2-1-master","base_model":"kling v2.1 master","display_name":"kling v2.1 master","official_model_id":null,"provider":"KlingAI","aliases":["kling-v2.1-master"]},{"model_id":"wan-v2-2-a14b","base_model":"wan v2.2 a14b","display_name":"wan v2.2 a14b","official_model_id":null,"provider":"Alibaba","aliases":["wan-v2.2-a14b"]},{"model_id":"seedance-v1-lite","base_model":"seedance v1 lite","display_name":"seedance v1 lite","official_model_id":null,"provider":"Bytedance","aliases":["seedance-v1-lite"]},{"model_id":"sora","base_model":"sora","display_name":"sora","official_model_id":null,"provider":"OpenAI","aliases":["sora"]},{"model_id":"ray2","base_model":"ray2","display_name":"ray2","official_model_id":null,"provider":"Luma AI","aliases":["ray2"]},{"model_id":"pika-v2-2","base_model":"pika v2.2","display_name":"pika v2.2","official_model_id":null,"provider":"Pika","aliases":["pika-v2.2"]},{"model_id":"mochi-v1","base_model":"mochi v1","display_name":"mochi v1","official_model_id":null,"provider":"Genmo AI","aliases":["mochi-v1"]},{"model_id":"wan2-7-260612","base_model":"Wan2.7-260612","display_name":"Wan2.7-260612","official_model_id":null,"provider":"Alibaba","aliases":["Wan2.7-260612"]},{"model_id":"happyhorse-1-1","base_model":"HappyHorse-1.1","display_name":"HappyHorse-1.1","official_model_id":null,"provider":"Alibaba-ATH","aliases":["HappyHorse-1.1"]},{"model_id":"magi-2-preview","base_model":"MAGI-2 Preview","display_name":"MAGI-2 Preview","official_model_id":null,"provider":"Sand.ai","aliases":["MAGI-2 Preview"]},{"model_id":"kling-3-0","base_model":"Kling 3.0","display_name":"Kling 3.0","official_model_id":null,"provider":"KlingAI","aliases":["Kling 3.0 1080p (Pro)","Kling 3.0 720p (Standard)"]},{"model_id":"skyreels-v4","base_model":"SkyReels V4","display_name":"SkyReels V4","official_model_id":null,"provider":"Skywork AI","aliases":["SkyReels V4"]},{"model_id":"veo-3-1","base_model":"Veo 3.1","display_name":"Veo 3.1","official_model_id":null,"provider":"Google","aliases":["Veo 3.1"]},{"model_id":"kling-3-0-omni","base_model":"Kling 3.0 Omni","display_name":"Kling 3.0 Omni","official_model_id":null,"provider":"KlingAI","aliases":["Kling 3.0 Omni 1080p (Pro)","Kling 3.0 Omni 720p (Standard)"]},{"model_id":"veo-3-1-lite","base_model":"Veo 3.1 Lite","display_name":"Veo 3.1 Lite","official_model_id":null,"provider":"Google","aliases":["Veo 3.1 Lite"]},{"model_id":"veo-3-1-fast","base_model":"Veo 3.1 Fast","display_name":"Veo 3.1 Fast","official_model_id":null,"provider":"Google","aliases":["Veo 3.1 Fast"]},{"model_id":"agnes-video-2-5","base_model":"Agnes-Video-2.5","display_name":"Agnes-Video-2.5","official_model_id":null,"provider":"Sapiens AI","aliases":["Agnes-Video-2.5"]},{"model_id":"vidu-q3-pro","base_model":"Vidu Q3 Pro","display_name":"Vidu Q3 Pro","official_model_id":null,"provider":"Vidu","aliases":["Vidu Q3 Pro"]},{"model_id":"pixverse-v6","base_model":"PixVerse V6","display_name":"PixVerse V6","official_model_id":null,"provider":"PixVerse","aliases":["PixVerse V6"]},{"model_id":"ltx-2-5-fast","base_model":"LTX-2.5 Fast","display_name":"LTX-2.5 Fast","official_model_id":null,"provider":"Lightricks","aliases":["LTX-2.5 Fast"]},{"model_id":"ltx-2-5-pro","base_model":"LTX-2.5 Pro","display_name":"LTX-2.5 Pro","official_model_id":null,"provider":"Lightricks","aliases":["LTX-2.5 Pro"]},{"model_id":"wan-2-6","base_model":"Wan 2.6","display_name":"Wan 2.6","official_model_id":null,"provider":"Alibaba","aliases":["Wan 2.6"]},{"model_id":"vidu-q3-turbo","base_model":"Vidu Q3 Turbo","display_name":"Vidu Q3 Turbo","official_model_id":null,"provider":"Vidu","aliases":["Vidu Q3 Turbo"]},{"model_id":"seedance-1-5-pro","base_model":"Seedance 1.5 pro","display_name":"Seedance 1.5 pro","official_model_id":null,"provider":"ByteDance Seed","aliases":["Seedance 1.5 pro"]},{"model_id":"ltx-2-3-fast","base_model":"LTX-2.3 Fast","display_name":"LTX-2.3 Fast","official_model_id":null,"provider":"Lightricks","aliases":["LTX-2.3 Fast"]},{"model_id":"ltx-2-3-pro","base_model":"LTX-2.3 Pro","display_name":"LTX-2.3 Pro","official_model_id":null,"provider":"Lightricks","aliases":["LTX-2.3 Pro"]},{"model_id":"pixverse-v5-6","base_model":"PixVerse V5.6","display_name":"PixVerse V5.6","official_model_id":null,"provider":"PixVerse","aliases":["PixVerse V5.6"]},{"model_id":"ltx-2-fast","base_model":"LTX-2 Fast","display_name":"LTX-2 Fast","official_model_id":null,"provider":"Lightricks","aliases":["LTX-2 Fast"]},{"model_id":"agnes-video-v2-0","base_model":"Agnes-Video-V2.0","display_name":"Agnes-Video-V2.0","official_model_id":null,"provider":"Sapiens AI","aliases":["Agnes-Video-V2.0"]},{"model_id":"ltx-2-pro","base_model":"LTX-2 Pro","display_name":"LTX-2 Pro","official_model_id":null,"provider":"Lightricks","aliases":["LTX-2 Pro"]},{"model_id":"grok-imagine-video-1-5","base_model":"grok imagine video 1.5","display_name":"grok imagine video 1.5","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-video-1.5","grok-imagine-video-1.5-720p"]},{"model_id":"flux-3-video-20260811","base_model":"flux 3 video 20260811","display_name":"flux 3 video 20260811","official_model_id":null,"provider":"Black Forest Labs","aliases":["flux-3-video-20260811"]},{"model_id":"wan2-7-i2v","base_model":"wan2.7 i2v","display_name":"wan2.7 i2v","official_model_id":null,"provider":"Alibaba","aliases":["wan2.7-i2v"]},{"model_id":"grok-imagine-video-480p","base_model":"grok imagine video 480p","display_name":"grok imagine video 480p","official_model_id":null,"provider":"SpaceXAI","aliases":["grok-imagine-video-480p"]},{"model_id":"kling-v3-pro","base_model":"kling v3 pro","display_name":"kling v3 pro","official_model_id":null,"provider":"KlingAI","aliases":["kling-v3-pro"]},{"model_id":"wan2-5-i2v-preview","base_model":"wan2.5 i2v preview","display_name":"wan2.5 i2v preview","official_model_id":null,"provider":"Alibaba","aliases":["wan2.5-i2v-preview"]},{"model_id":"wan2-6-i2v","base_model":"wan2.6 i2v","display_name":"wan2.6 i2v","official_model_id":null,"provider":"Alibaba","aliases":["wan2.6-i2v"]},{"model_id":"vidu-q2-turbo","base_model":"vidu q2 turbo","display_name":"vidu q2 turbo","official_model_id":null,"provider":"Shengshu","aliases":["vidu-q2-turbo"]},{"model_id":"kling-v2-1-standard","base_model":"kling v2.1 standard","display_name":"kling v2.1 standard","official_model_id":null,"provider":"KlingAI","aliases":["kling-v2.1-standard"]},{"model_id":"vidu-q2-pro","base_model":"vidu q2 pro","display_name":"vidu q2 pro","official_model_id":null,"provider":"Shengshu","aliases":["vidu-q2-pro"]},{"model_id":"hailuo-02-fast","base_model":"hailuo 02 fast","display_name":"hailuo 02 fast","official_model_id":null,"provider":"MiniMax","aliases":["hailuo-02-fast"]},{"model_id":"runway-gen4-turbo","base_model":"runway gen4 turbo","display_name":"runway gen4 turbo","official_model_id":null,"provider":"Runway","aliases":["runway-gen4-turbo"]},{"model_id":"kling-o3-pro","base_model":"kling o3 pro","display_name":"kling o3 pro","official_model_id":null,"provider":"KlingAI","aliases":["kling-o3-pro"]},{"model_id":"runway-gen4-aleph","base_model":"runway gen4 aleph","display_name":"runway gen4 aleph","official_model_id":null,"provider":"Runway","aliases":["runway-gen4-aleph"]},{"model_id":"aleph-2-0","base_model":"Aleph 2.0","display_name":"Aleph 2.0","official_model_id":null,"provider":"Runway","aliases":["Aleph 2.0"]},{"model_id":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","display_name":"Fun-Realtime-ASR-preview","official_model_id":null,"provider":"Alibaba","aliases":["Fun-Realtime-ASR-preview"]},{"model_id":"mai-transcribe-2","base_model":"MAI-Transcribe-2","display_name":"MAI-Transcribe-2","official_model_id":null,"provider":"Microsoft AI","aliases":["MAI-Transcribe-2"]},{"model_id":"elevenlabs-scribe-v2","base_model":"ElevenLabs Scribe v2","display_name":"ElevenLabs Scribe v2","official_model_id":null,"provider":"ElevenLabs","aliases":["ElevenLabs Scribe v2"]},{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","aliases":["Sonic 3.6"]},{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","aliases":["Realtime TTS-2"]},{"model_id":"qwen-audio-3-0-tts-plus","base_model":"Qwen-Audio-3.0-TTS-Plus","display_name":"Qwen-Audio-3.0-TTS-Plus","official_model_id":null,"provider":"Alibaba","aliases":["Qwen-Audio-3.0-TTS-Plus"]},{"model_id":"simba-3-2","base_model":"Simba 3.2","display_name":"Simba 3.2","official_model_id":null,"provider":"SpeechifyAI","aliases":["Simba 3.2"]},{"model_id":"luna-tts","base_model":"Luna TTS","display_name":"Luna TTS","official_model_id":null,"provider":"VUI Labs","aliases":["Luna TTS"]},{"model_id":"realtime-tts-2-flash-research-preview","base_model":"Realtime TTS-2 Flash - Research Preview","display_name":"Realtime TTS-2 Flash - Research Preview","official_model_id":null,"provider":"Inworld","aliases":["Realtime TTS-2 Flash - Research Preview"]},{"model_id":"breeze-tts-2","base_model":"Breeze TTS 2","display_name":"Breeze TTS 2","official_model_id":null,"provider":"BreezeBlue","aliases":["Breeze TTS 2"]},{"model_id":"v3-conversational","base_model":"v3 Conversational","display_name":"v3 Conversational","official_model_id":null,"provider":"ElevenLabs","aliases":["v3 Conversational"]},{"model_id":"gemini-3-1-flash-tts","base_model":"Gemini 3.1 Flash TTS","display_name":"Gemini 3.1 Flash TTS","official_model_id":null,"provider":"Google","aliases":["Gemini 3.1 Flash TTS"]},{"model_id":"stepaudio-2-5-tts","base_model":"StepAudio 2.5 TTS","display_name":"StepAudio 2.5 TTS","official_model_id":null,"provider":"StepFun","aliases":["StepAudio 2.5 TTS (Aug 2026)"]},{"model_id":"sonic-3-5","base_model":"Sonic 3.5","display_name":"Sonic 3.5","official_model_id":null,"provider":"Cartesia","aliases":["Sonic 3.5"]},{"model_id":"lightning-v3-1-pro","base_model":"Lightning V3.1 Pro","display_name":"Lightning V3.1 Pro","official_model_id":null,"provider":"Smallest.ai","aliases":["Lightning V3.1 Pro (Jul 2026)"]},{"model_id":"soniox-tts-real-time-v2","base_model":"Soniox TTS Real-Time v2","display_name":"Soniox TTS Real-Time v2","official_model_id":null,"provider":"Soniox","aliases":["Soniox TTS Real-Time v2"]},{"model_id":"eleven-v3","base_model":"Eleven v3","display_name":"Eleven v3","official_model_id":null,"provider":"ElevenLabs","aliases":["Eleven v3"]},{"model_id":"speech-2-8-hd","base_model":"Speech 2.8 HD","display_name":"Speech 2.8 HD","official_model_id":null,"provider":"MiniMax","aliases":["Speech 2.8 HD"]},{"model_id":"falcon-2","base_model":"Falcon 2","display_name":"Falcon 2","official_model_id":null,"provider":"Murf AI","aliases":["Falcon 2"]},{"model_id":"speech-2-8-turbo","base_model":"Speech 2.8 Turbo","display_name":"Speech 2.8 Turbo","official_model_id":null,"provider":"MiniMax","aliases":["Speech 2.8 Turbo"]},{"model_id":"gradium-tts","base_model":"Gradium TTS","display_name":"Gradium TTS","official_model_id":null,"provider":"Gradium","aliases":["Gradium TTS (Aug 2026)"]},{"model_id":"async-flash-v1-5","base_model":"Async Flash v1.5","display_name":"Async Flash v1.5","official_model_id":null,"provider":"async","aliases":["Async Flash v1.5"]},{"model_id":"fish-audio-s2-1-pro","base_model":"Fish Audio S2.1 Pro","display_name":"Fish Audio S2.1 Pro","official_model_id":null,"provider":"Fish Audio","aliases":["Fish Audio S2.1 Pro"]},{"model_id":"step-tts-2","base_model":"Step TTS 2","display_name":"Step TTS 2","official_model_id":null,"provider":"StepFun","aliases":["Step TTS 2 (Mar 2026)"]},{"model_id":"speech-2-6-hd","base_model":"Speech 2.6 HD","display_name":"Speech 2.6 HD","official_model_id":null,"provider":"MiniMax","aliases":["Speech 2.6 HD"]},{"model_id":"lightning-v3-1-pro-tts","base_model":"Lightning V3.1 Pro TTS","display_name":"Lightning V3.1 Pro TTS","official_model_id":null,"provider":"Smallest.ai","aliases":["Lightning V3.1 Pro TTS (Jun 2026)"]},{"model_id":"azure-hd-2-5","base_model":"Azure HD 2.5","display_name":"Azure HD 2.5","official_model_id":null,"provider":"Microsoft","aliases":["Azure HD 2.5"]},{"model_id":"fish-audio-s2-pro","base_model":"Fish Audio S2 Pro","display_name":"Fish Audio S2 Pro","official_model_id":null,"provider":"Fish Audio","aliases":["Fish Audio S2 Pro"]},{"model_id":"speech-2-6-turbo","base_model":"Speech 2.6 Turbo","display_name":"Speech 2.6 Turbo","official_model_id":null,"provider":"MiniMax","aliases":["Speech 2.6 Turbo"]},{"model_id":"spacexai-tts","base_model":"SpaceXAI TTS","display_name":"SpaceXAI TTS","official_model_id":null,"provider":"SpaceXAI","aliases":["SpaceXAI TTS"]},{"model_id":"simba-3-0","base_model":"Simba 3.0","display_name":"Simba 3.0","official_model_id":null,"provider":"SpeechifyAI","aliases":["Simba 3.0"]},{"model_id":"async-pro-v1-0","base_model":"Async Pro v1.0","display_name":"Async Pro v1.0","official_model_id":null,"provider":"async","aliases":["Async Pro v1.0"]},{"model_id":"speech-02-hd","base_model":"Speech-02-HD","display_name":"Speech-02-HD","official_model_id":null,"provider":"MiniMax","aliases":["Speech-02-HD"]},{"model_id":"tts-1-hd","base_model":"TTS-1 HD","display_name":"TTS-1 HD","official_model_id":null,"provider":"OpenAI","aliases":["TTS-1 HD"]},{"model_id":"step-audio-editx","base_model":"Step Audio EditX","display_name":"Step Audio EditX","official_model_id":null,"provider":"StepFun","aliases":["Step Audio EditX (Mar 2026)"]},{"model_id":"turbo-v2-5","base_model":"Turbo v2.5","display_name":"Turbo v2.5","official_model_id":null,"provider":"ElevenLabs","aliases":["Turbo v2.5"]},{"model_id":"multilingual-v2","base_model":"Multilingual v2","display_name":"Multilingual v2","official_model_id":null,"provider":"ElevenLabs","aliases":["Multilingual v2"]},{"model_id":"chatterbox-hd","base_model":"Chatterbox HD","display_name":"Chatterbox HD","official_model_id":null,"provider":"Resemble AI","aliases":["Chatterbox HD"]},{"model_id":"tts-1","base_model":"TTS-1","display_name":"TTS-1","official_model_id":null,"provider":"OpenAI","aliases":["TTS-1"]},{"model_id":"gemini-2-5-flash-lite-tts","base_model":"Gemini 2.5 Flash Lite TTS","display_name":"Gemini 2.5 Flash Lite TTS","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Flash Lite TTS"]},{"model_id":"speech-2-6","base_model":"Speech 2.6","display_name":"Speech 2.6","official_model_id":null,"provider":"Hithink","aliases":["Speech 2.6"]},{"model_id":"speech-02-turbo","base_model":"Speech-02-Turbo","display_name":"Speech-02-Turbo","official_model_id":null,"provider":"MiniMax","aliases":["Speech-02-Turbo"]},{"model_id":"studio","base_model":"Studio","display_name":"Studio","official_model_id":null,"provider":"Google","aliases":["Studio"]},{"model_id":"openaudio-s1","base_model":"OpenAudio S1","display_name":"OpenAudio S1","official_model_id":null,"provider":"Fish Audio","aliases":["OpenAudio S1"]},{"model_id":"flash-v2-5","base_model":"Flash v2.5","display_name":"Flash v2.5","official_model_id":null,"provider":"ElevenLabs","aliases":["Flash v2.5"]},{"model_id":"voxtral-tts","base_model":"Voxtral TTS","display_name":"Voxtral TTS","official_model_id":null,"provider":"Mistral","aliases":["Voxtral TTS"]},{"model_id":"journey","base_model":"Journey","display_name":"Journey","official_model_id":null,"provider":"Google","aliases":["Journey"]},{"model_id":"maya-2-flash","base_model":"Maya 2 Flash","display_name":"Maya 2 Flash","official_model_id":null,"provider":"Maya Research","aliases":["Maya 2 Flash"]},{"model_id":"sonic-3","base_model":"Sonic 3","display_name":"Sonic 3","official_model_id":null,"provider":"Cartesia","aliases":["Sonic 3"]},{"model_id":"gpt-realtime-2","base_model":"GPT-Realtime-2","display_name":"GPT-Realtime-2","official_model_id":null,"provider":"OpenAI","aliases":["GPT-Realtime-2"]},{"model_id":"t2a-01-hd","base_model":"T2A-01-HD","display_name":"T2A-01-HD","official_model_id":null,"provider":"MiniMax","aliases":["T2A-01-HD"]},{"model_id":"magpie-multilingual-357m","base_model":"Magpie-Multilingual 357M","display_name":"Magpie-Multilingual 357M","official_model_id":null,"provider":"NVIDIA","aliases":["Magpie-Multilingual 357M (Feb 2026)"]},{"model_id":"polly-generative","base_model":"Polly Generative","display_name":"Polly Generative","official_model_id":null,"provider":"Amazon","aliases":["Polly Generative"]},{"model_id":"simba-1-6","base_model":"SIMBA 1.6","display_name":"SIMBA 1.6","official_model_id":null,"provider":"SpeechifyAI","aliases":["SIMBA 1.6"]},{"model_id":"kokoro-82m-v1-0","base_model":"Kokoro 82M v1.0","display_name":"Kokoro 82M v1.0","official_model_id":null,"provider":"Kokoro","aliases":["Kokoro 82M v1.0"]},{"model_id":"mimo-v2-5-tts","base_model":"MiMo-V2.5-TTS","display_name":"MiMo-V2.5-TTS","official_model_id":null,"provider":"Xiaomi","aliases":["MiMo-V2.5-TTS"]},{"model_id":"maya-2-global","base_model":"Maya 2 Global","display_name":"Maya 2 Global","official_model_id":null,"provider":"Maya Research","aliases":["Maya 2 Global"]},{"model_id":"coda","base_model":"Coda","display_name":"Coda","official_model_id":null,"provider":"Rime","aliases":["Coda"]},{"model_id":"chirp-3-hd","base_model":"Chirp 3: HD","display_name":"Chirp 3: HD","official_model_id":null,"provider":"Google","aliases":["Chirp 3: HD"]},{"model_id":"octave-2","base_model":"Octave 2","display_name":"Octave 2","official_model_id":null,"provider":"Hume AI","aliases":["Octave 2"]},{"model_id":"gemini-2-5-flash-tts","base_model":"Gemini 2.5 Flash TTS","display_name":"Gemini 2.5 Flash TTS","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Flash TTS (Dec 2025)"]},{"model_id":"openaudio-s1-mini","base_model":"OpenAudio S1 Mini","display_name":"OpenAudio S1 Mini","official_model_id":null,"provider":"Fish Audio","aliases":["OpenAudio S1 Mini"]},{"model_id":"async-flash-v1-0","base_model":"Async Flash v1.0","display_name":"Async Flash v1.0","official_model_id":null,"provider":"async","aliases":["Async Flash v1.0"]},{"model_id":"polly-long-form","base_model":"Polly Long-Form","display_name":"Polly Long-Form","official_model_id":null,"provider":"Amazon","aliases":["Polly Long-Form"]},{"model_id":"maya1","base_model":"Maya1","display_name":"Maya1","official_model_id":null,"provider":"Maya Research","aliases":["Maya1"]},{"model_id":"higgs-audio-v3-tts","base_model":"Higgs Audio V3 TTS","display_name":"Higgs Audio V3 TTS","official_model_id":null,"provider":"Boson AI","aliases":["Higgs Audio V3 TTS"]},{"model_id":"simba-1-0","base_model":"SIMBA 1.0","display_name":"SIMBA 1.0","official_model_id":null,"provider":"SpeechifyAI","aliases":["SIMBA 1.0"]},{"model_id":"mai-voice-1","base_model":"MAI-Voice-1","display_name":"MAI-Voice-1","official_model_id":null,"provider":"Microsoft","aliases":["MAI-Voice-1"]},{"model_id":"bland-speech-v3","base_model":"Bland Speech v3","display_name":"Bland Speech v3","official_model_id":null,"provider":"Bland AI","aliases":["Bland Speech v3"]},{"model_id":"t2a-01-turbo","base_model":"T2A-01-Turbo","display_name":"T2A-01-Turbo","official_model_id":null,"provider":"MiniMax","aliases":["T2A-01-Turbo"]},{"model_id":"octave-tts","base_model":"Octave TTS","display_name":"Octave TTS","official_model_id":null,"provider":"Hume AI","aliases":["Octave TTS"]},{"model_id":"azure-neural","base_model":"Azure Neural","display_name":"Azure Neural","official_model_id":null,"provider":"Microsoft","aliases":["Azure Neural"]},{"model_id":"mimo-v2-tts","base_model":"MiMo-V2-TTS","display_name":"MiMo-V2-TTS","official_model_id":null,"provider":"Xiaomi","aliases":["MiMo-V2-TTS"]},{"model_id":"chatterbox","base_model":"Chatterbox","display_name":"Chatterbox","official_model_id":null,"provider":"Resemble AI","aliases":["Chatterbox"]},{"model_id":"lightning-v3-1","base_model":"Lightning v3.1","display_name":"Lightning v3.1","official_model_id":null,"provider":"Smallest.ai","aliases":["Lightning v3.1"]},{"model_id":"raon-speechlm","base_model":"Raon SpeechLM","display_name":"Raon SpeechLM","official_model_id":null,"provider":"Krafton","aliases":["Raon SpeechLM"]},{"model_id":"arcana-v3","base_model":"Arcana v3","display_name":"Arcana v3","official_model_id":null,"provider":"Rime","aliases":["Arcana v3"]},{"model_id":"zonos-v0-1","base_model":"Zonos-v0.1","display_name":"Zonos-v0.1","official_model_id":null,"provider":"Zyphra","aliases":["Zonos-v0.1"]},{"model_id":"murf-speech-gen-2","base_model":"Murf Speech Gen 2","display_name":"Murf Speech Gen 2","official_model_id":null,"provider":"Murf AI","aliases":["Murf Speech Gen 2"]},{"model_id":"lmnt","base_model":"LMNT","display_name":"LMNT","official_model_id":null,"provider":"LMNT","aliases":["LMNT"]},{"model_id":"vibevoice-7b","base_model":"VibeVoice 7B","display_name":"VibeVoice 7B","official_model_id":null,"provider":"Microsoft","aliases":["VibeVoice 7B"]},{"model_id":"vibevoice-1-5b","base_model":"VibeVoice 1.5B","display_name":"VibeVoice 1.5B","official_model_id":null,"provider":"Microsoft","aliases":["VibeVoice 1.5B"]},{"model_id":"openvoice-v2","base_model":"OpenVoice v2","display_name":"OpenVoice v2","official_model_id":null,"provider":"OpenVoice","aliases":["OpenVoice v2"]},{"model_id":"magpie-multilingual","base_model":"Magpie Multilingual","display_name":"Magpie Multilingual","official_model_id":null,"provider":"NVIDIA","aliases":["Magpie Multilingual"]},{"model_id":"qwen3-tts-flash","base_model":"Qwen3 TTS Flash","display_name":"Qwen3 TTS Flash","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3 TTS Flash"]},{"model_id":"neuphonic-tts","base_model":"Neuphonic TTS","display_name":"Neuphonic TTS","official_model_id":null,"provider":"Neuphonic","aliases":["Neuphonic TTS"]},{"model_id":"kugel-3","base_model":"Kugel 3","display_name":"Kugel 3","official_model_id":null,"provider":"KugelAudio","aliases":["Kugel 3"]},{"model_id":"qwen3-tts","base_model":"Qwen3 TTS","display_name":"Qwen3 TTS","official_model_id":null,"provider":"Alibaba","aliases":["Qwen3 TTS"]},{"model_id":"xtts-v2","base_model":"XTTS v2","display_name":"XTTS v2","official_model_id":null,"provider":"Coqui","aliases":["XTTS v2"]},{"model_id":"wavenet","base_model":"WaveNet","display_name":"WaveNet","official_model_id":null,"provider":"Google","aliases":["WaveNet"]},{"model_id":"mist-v2","base_model":"Mist V2","display_name":"Mist V2","official_model_id":null,"provider":"Rime","aliases":["Mist V2"]},{"model_id":"styletts-2","base_model":"StyleTTS 2","display_name":"StyleTTS 2","official_model_id":null,"provider":"StyleTTS","aliases":["StyleTTS 2"]},{"model_id":"neural2","base_model":"Neural2","display_name":"Neural2","official_model_id":null,"provider":"Google","aliases":["Neural2"]},{"model_id":"polly-neural","base_model":"Polly Neural","display_name":"Polly Neural","official_model_id":null,"provider":"Amazon","aliases":["Polly Neural"]},{"model_id":"standard","base_model":"Standard","display_name":"Standard","official_model_id":null,"provider":"Google","aliases":["Standard"]},{"model_id":"noiz-tts","base_model":"Noiz TTS","display_name":"Noiz TTS","official_model_id":null,"provider":"Noiz","aliases":["Noiz TTS"]},{"model_id":"metavoice-v1","base_model":"MetaVoice v1","display_name":"MetaVoice v1","official_model_id":null,"provider":"MetaVoice","aliases":["MetaVoice v1"]},{"model_id":"polly-standard","base_model":"Polly Standard","display_name":"Polly Standard","official_model_id":null,"provider":"Amazon","aliases":["Polly Standard"]},{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","aliases":["Qwen Audio 3.0 Realtime Plus"]},{"model_id":"qwen-audio-3-0-realtime-flash","base_model":"Qwen Audio 3.0 Realtime Flash","display_name":"Qwen Audio 3.0 Realtime Flash","official_model_id":null,"provider":"Alibaba Cloud","aliases":["Qwen Audio 3.0 Realtime Flash"]},{"model_id":"higgs-realtime","base_model":"Higgs Realtime","display_name":"Higgs Realtime","official_model_id":null,"provider":"Boson AI","aliases":["Higgs Realtime"]},{"model_id":"deepslate-opal","base_model":"Deepslate Opal","display_name":"Deepslate Opal","official_model_id":null,"provider":"Deepslate","aliases":["Deepslate Opal"]},{"model_id":"gemini-3-1-flash-live","base_model":"Gemini 3.1 Flash Live","display_name":"Gemini 3.1 Flash Live","official_model_id":null,"provider":"Google","aliases":["Gemini 3.1 Flash Live High","Gemini 3.1 Flash Live Minimal"]},{"model_id":"gemini-2-5-flash-native-audio-preview","base_model":"Gemini 2.5 Flash Native Audio Preview","display_name":"Gemini 2.5 Flash Native Audio Preview","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Flash Native Audio Preview (Dec 2025)"]},{"model_id":"gpt-realtime-2-1","base_model":"GPT-Realtime-2.1","display_name":"GPT-Realtime-2.1","official_model_id":null,"provider":"OpenAI","aliases":["GPT-Realtime-2.1 High","GPT-Realtime-2.1 Minimal"]},{"model_id":"gpt-realtime","base_model":"GPT Realtime","display_name":"GPT Realtime","official_model_id":null,"provider":"OpenAI","aliases":["GPT Realtime (Aug '25)"]},{"model_id":"gpt-realtime-1-5","base_model":"GPT-Realtime-1.5","display_name":"GPT-Realtime-1.5","official_model_id":null,"provider":"OpenAI","aliases":["GPT-Realtime-1.5"]},{"model_id":"gpt-realtime-2-1-mini","base_model":"GPT-Realtime-2.1 Mini","display_name":"GPT-Realtime-2.1 Mini","official_model_id":null,"provider":"OpenAI","aliases":["GPT-Realtime-2.1 Mini High","GPT-Realtime-2.1 Mini Minimal"]},{"model_id":"gpt-realtime-mini","base_model":"GPT Realtime Mini","display_name":"GPT Realtime Mini","official_model_id":null,"provider":"OpenAI","aliases":["GPT Realtime Mini (Oct '25)"]},{"model_id":"gpt-4o-realtime","base_model":"GPT-4o Realtime","display_name":"GPT-4o Realtime","official_model_id":null,"provider":"OpenAI","aliases":["GPT-4o Realtime (Dec 2024)"]},{"model_id":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","display_name":"Grok Voice Think Fast 2.0","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok Voice Think Fast 2.0 High"]},{"model_id":"grok-voice-think-fast-1-0","base_model":"Grok Voice Think Fast 1.0","display_name":"Grok Voice Think Fast 1.0","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok Voice Think Fast 1.0"]},{"model_id":"grok-voice-fast-1-0","base_model":"Grok Voice Fast 1.0","display_name":"Grok Voice Fast 1.0","official_model_id":null,"provider":"SpaceXAI","aliases":["Grok Voice Fast 1.0"]},{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","aliases":["Suno V5.5"]},{"model_id":"mureka-v9","base_model":"Mureka V9","display_name":"Mureka V9","official_model_id":null,"provider":"Mureka","aliases":["Mureka V9"]},{"model_id":"mureka-v8","base_model":"Mureka V8","display_name":"Mureka V8","official_model_id":null,"provider":"Mureka","aliases":["Mureka V8"]},{"model_id":"suno-v5","base_model":"Suno V5","display_name":"Suno V5","official_model_id":null,"provider":"Suno","aliases":["Suno V5"]},{"model_id":"lyria-3-pro","base_model":"Lyria 3 Pro","display_name":"Lyria 3 Pro","official_model_id":null,"provider":"Google","aliases":["Lyria 3 Pro"]},{"model_id":"suno-v4-5","base_model":"Suno V4.5","display_name":"Suno V4.5","official_model_id":null,"provider":"Suno","aliases":["Suno V4.5"]},{"model_id":"minimax-music-2-6","base_model":"MiniMax Music 2.6","display_name":"MiniMax Music 2.6","official_model_id":null,"provider":"MiniMax","aliases":["MiniMax Music 2.6"]},{"model_id":"eleven-music-v2","base_model":"Eleven Music v2","display_name":"Eleven Music v2","official_model_id":null,"provider":"ElevenLabs","aliases":["Eleven Music v2"]},{"model_id":"minimax-music-2-5","base_model":"MiniMax Music 2.5+","display_name":"MiniMax Music 2.5+","official_model_id":null,"provider":"MiniMax","aliases":["MiniMax Music 2.5+"]},{"model_id":"fuzz-1-1-pro","base_model":"FUZZ-1.1 Pro","display_name":"FUZZ-1.1 Pro","official_model_id":null,"provider":"Producer.ai","aliases":["FUZZ-1.1 Pro"]},{"model_id":"eleven-music","base_model":"Eleven Music","display_name":"Eleven Music","official_model_id":null,"provider":"ElevenLabs","aliases":["Eleven Music"]},{"model_id":"fuzz-2-0-raw","base_model":"FUZZ-2.0 Raw","display_name":"FUZZ-2.0 Raw","official_model_id":null,"provider":"Producer.ai","aliases":["FUZZ-2.0 Raw"]},{"model_id":"fuzz-2-0","base_model":"FUZZ-2.0","display_name":"FUZZ-2.0","official_model_id":null,"provider":"Producer.ai","aliases":["FUZZ-2.0"]},{"model_id":"lyria-2","base_model":"Lyria 2","display_name":"Lyria 2","official_model_id":null,"provider":"Google","aliases":["Lyria 2"]},{"model_id":"stable-audio-2-0","base_model":"Stable Audio 2.0","display_name":"Stable Audio 2.0","official_model_id":null,"provider":"Stability.ai","aliases":["Stable Audio 2.0"]},{"model_id":"udio-v1-5-allegro","base_model":"Udio v1.5 Allegro","display_name":"Udio v1.5 Allegro","official_model_id":null,"provider":"Udio","aliases":["Udio v1.5 Allegro"]},{"model_id":"sonauto-v2-1","base_model":"Sonauto V2.1","display_name":"Sonauto V2.1","official_model_id":null,"provider":"Sonauto","aliases":["Sonauto V2.1"]},{"model_id":"musicgen","base_model":"MusicGen","display_name":"MusicGen","official_model_id":null,"provider":"Meta","aliases":["MusicGen"]},{"model_id":"moonshotai-kimi-k2-instruct","base_model":"Moonshotai-Kimi-K2-Instruct","display_name":"Moonshotai-Kimi-K2-Instruct","official_model_id":null,"provider":"MoonshotAI","aliases":["Moonshotai-Kimi-K2-Instruct (FC)"]},{"model_id":"grok-4-1-fast-non-reasoning","base_model":"Grok-4-1-fast-non-reasoning","display_name":"Grok-4-1-fast-non-reasoning","official_model_id":null,"provider":"xAI","aliases":["Grok-4-1-fast-non-reasoning (FC)"]},{"model_id":"command-a-reasoning","base_model":"Command A Reasoning","display_name":"Command A Reasoning","official_model_id":null,"provider":"Cohere","aliases":["Command A Reasoning (FC)"]},{"model_id":"xlam-2-32b-fc-r","base_model":"xLAM-2-32b-fc-r","display_name":"xLAM-2-32b-fc-r","official_model_id":null,"provider":"Salesforce","aliases":["xLAM-2-32b-fc-r (FC)"]},{"model_id":"xlam-2-70b-fc-r","base_model":"xLAM-2-70b-fc-r","display_name":"xLAM-2-70b-fc-r","official_model_id":null,"provider":"Salesforce","aliases":["xLAM-2-70b-fc-r (FC)"]},{"model_id":"gpt-5-nano-2025-08-07","base_model":"GPT-5-nano-2025-08-07","display_name":"GPT-5-nano-2025-08-07","official_model_id":null,"provider":"OpenAI","aliases":["GPT-5-nano-2025-08-07 (FC)","GPT-5-nano-2025-08-07 (Prompt)"]},{"model_id":"nanbeige4-3b-thinking-2511","base_model":"Nanbeige4-3B-Thinking-2511","display_name":"Nanbeige4-3B-Thinking-2511","official_model_id":null,"provider":"Nanbeige","aliases":["Nanbeige4-3B-Thinking-2511 (FC)"]},{"model_id":"qwen3-32b","base_model":"Qwen3-32B","display_name":"Qwen3-32B","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-32B (FC)","Qwen3-32B (Prompt)"]},{"model_id":"nanbeige3-5-pro-thinking","base_model":"Nanbeige3.5-Pro-Thinking","display_name":"Nanbeige3.5-Pro-Thinking","official_model_id":null,"provider":"Nanbeige","aliases":["Nanbeige3.5-Pro-Thinking (FC)"]},{"model_id":"xlam-2-8b-fc-r","base_model":"xLAM-2-8b-fc-r","display_name":"xLAM-2-8b-fc-r","official_model_id":null,"provider":"Salesforce","aliases":["xLAM-2-8b-fc-r (FC)"]},{"model_id":"command-a","base_model":"Command A","display_name":"Command A","official_model_id":null,"provider":"Cohere","aliases":["Command A (FC)"]},{"model_id":"bitagent-bounty-8b","base_model":"BitAgent-Bounty-8B","display_name":"BitAgent-Bounty-8B","official_model_id":null,"provider":"Bittensor","aliases":["BitAgent-Bounty-8B"]},{"model_id":"arch-agent-32b","base_model":"Arch-Agent-32B","display_name":"Arch-Agent-32B","official_model_id":null,"provider":"katanemo","aliases":["Arch-Agent-32B"]},{"model_id":"qwen3-8b","base_model":"Qwen3-8B","display_name":"Qwen3-8B","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-8B (FC)","Qwen3-8B (Prompt)"]},{"model_id":"toolace-2-8b","base_model":"ToolACE-2-8B","display_name":"ToolACE-2-8B","official_model_id":null,"provider":"Huawei Noah & USTC","aliases":["ToolACE-2-8B (FC)"]},{"model_id":"qwen3-30b-a3b-instruct-2507","base_model":"Qwen3-30B-A3B-Instruct-2507","display_name":"Qwen3-30B-A3B-Instruct-2507","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-30B-A3B-Instruct-2507 (FC)","Qwen3-30B-A3B-Instruct-2507 (Prompt)"]},{"model_id":"xlam-2-3b-fc-r","base_model":"xLAM-2-3b-fc-r","display_name":"xLAM-2-3b-fc-r","official_model_id":null,"provider":"Salesforce","aliases":["xLAM-2-3b-fc-r (FC)"]},{"model_id":"qwen3-14b","base_model":"Qwen3-14B","display_name":"Qwen3-14B","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-14B (FC)","Qwen3-14B (Prompt)"]},{"model_id":"mistral-large-2411","base_model":"mistral large 2411","display_name":"mistral large 2411","official_model_id":null,"provider":"Mistral AI","aliases":["mistral-large-2411 (FC)","mistral-large-2411 (Prompt)"]},{"model_id":"llama-4-maverick-17b-128e-instruct-fp8","base_model":"Llama-4-Maverick-17B-128E-Instruct-FP8","display_name":"Llama-4-Maverick-17B-128E-Instruct-FP8","official_model_id":null,"provider":"Meta","aliases":["Llama-4-Maverick-17B-128E-Instruct-FP8 (FC)"]},{"model_id":"gemini-2-5-flash-lite","base_model":"Gemini-2.5-Flash-Lite","display_name":"Gemini-2.5-Flash-Lite","official_model_id":null,"provider":"Google","aliases":["Gemini-2.5-Flash-Lite (FC)","Gemini-2.5-Flash-Lite (Prompt)"]},{"model_id":"qwen3-4b-instruct-2507","base_model":"Qwen3-4B-Instruct-2507","display_name":"Qwen3-4B-Instruct-2507","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-4B-Instruct-2507 (FC)","Qwen3-4B-Instruct-2507 (Prompt)"]},{"model_id":"arch-agent-3b","base_model":"Arch-Agent-3B","display_name":"Arch-Agent-3B","official_model_id":null,"provider":"katanemo","aliases":["Arch-Agent-3B"]},{"model_id":"gpt-4-1-nano-2025-04-14","base_model":"GPT-4.1-nano-2025-04-14","display_name":"GPT-4.1-nano-2025-04-14","official_model_id":null,"provider":"OpenAI","aliases":["GPT-4.1-nano-2025-04-14 (FC)","GPT-4.1-nano-2025-04-14 (Prompt)"]},{"model_id":"arch-agent-1-5b","base_model":"Arch-Agent-1.5B","display_name":"Arch-Agent-1.5B","official_model_id":null,"provider":"katanemo","aliases":["Arch-Agent-1.5B"]},{"model_id":"command-r7b","base_model":"Command R7B","display_name":"Command R7B","official_model_id":null,"provider":"Cohere","aliases":["Command R7B (FC)"]},{"model_id":"llama-3-3-70b-instruct","base_model":"Llama-3.3-70B-Instruct","display_name":"Llama-3.3-70B-Instruct","official_model_id":null,"provider":"Meta","aliases":["Llama-3.3-70B-Instruct (FC)"]},{"model_id":"hammer2-1-7b","base_model":"Hammer2.1-7b","display_name":"Hammer2.1-7b","official_model_id":null,"provider":"MadeAgents","aliases":["Hammer2.1-7b (FC)"]},{"model_id":"xlam-2-1b-fc-r","base_model":"xLAM-2-1b-fc-r","display_name":"xLAM-2-1b-fc-r","official_model_id":null,"provider":"Salesforce","aliases":["xLAM-2-1b-fc-r (FC)"]},{"model_id":"gemma-3-12b-it","base_model":"Gemma-3-12b-it","display_name":"Gemma-3-12b-it","official_model_id":null,"provider":"Google","aliases":["Gemma-3-12b-it (Prompt)"]},{"model_id":"hammer2-1-3b","base_model":"Hammer2.1-3b","display_name":"Hammer2.1-3b","official_model_id":null,"provider":"MadeAgents","aliases":["Hammer2.1-3b (FC)"]},{"model_id":"phi-4","base_model":"Phi-4","display_name":"Phi-4","official_model_id":null,"provider":"Microsoft","aliases":["Phi-4 (Prompt)"]},{"model_id":"qwen3-1-7b","base_model":"Qwen3-1.7B","display_name":"Qwen3-1.7B","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-1.7B (FC)"]},{"model_id":"coalm-70b","base_model":"CoALM-70B","display_name":"CoALM-70B","official_model_id":null,"provider":"UIUC + Oumi","aliases":["CoALM-70B"]},{"model_id":"hammer2-1-1-5b","base_model":"Hammer2.1-1.5b","display_name":"Hammer2.1-1.5b","official_model_id":null,"provider":"MadeAgents","aliases":["Hammer2.1-1.5b (FC)"]},{"model_id":"palmyra-x-004","base_model":"palmyra x 004","display_name":"palmyra x 004","official_model_id":null,"provider":"Writer","aliases":["palmyra-x-004 (FC)"]},{"model_id":"open-mistral-nemo-2407","base_model":"Open-Mistral-Nemo-2407","display_name":"Open-Mistral-Nemo-2407","official_model_id":null,"provider":"Mistral AI","aliases":["Open-Mistral-Nemo-2407 (FC)","Open-Mistral-Nemo-2407 (Prompt)"]},{"model_id":"amazon-nova-2-lite-v1-0","base_model":"Amazon-Nova-2-Lite-v1:0","display_name":"Amazon-Nova-2-Lite-v1:0","official_model_id":null,"provider":"Amazon","aliases":["Amazon-Nova-2-Lite-v1:0 (FC)"]},{"model_id":"granite-3-1-8b-instruct","base_model":"Granite-3.1-8B-Instruct","display_name":"Granite-3.1-8B-Instruct","official_model_id":null,"provider":"IBM","aliases":["Granite-3.1-8B-Instruct (FC)"]},{"model_id":"falcon3-10b-instruct","base_model":"Falcon3-10B-Instruct","display_name":"Falcon3-10B-Instruct","official_model_id":null,"provider":"TII UAE","aliases":["Falcon3-10B-Instruct (FC)"]},{"model_id":"granite-3-2-8b-instruct","base_model":"Granite-3.2-8B-Instruct","display_name":"Granite-3.2-8B-Instruct","official_model_id":null,"provider":"IBM","aliases":["Granite-3.2-8B-Instruct (FC)"]},{"model_id":"coalm-8b","base_model":"CoALM-8B","display_name":"CoALM-8B","official_model_id":null,"provider":"UIUC + Oumi","aliases":["CoALM-8B"]},{"model_id":"llama-3-1-8b-instruct","base_model":"Llama-3.1-8B-Instruct","display_name":"Llama-3.1-8B-Instruct","official_model_id":null,"provider":"Meta","aliases":["Llama-3.1-8B-Instruct (Prompt)"]},{"model_id":"minicpm3-4b-fc","base_model":"MiniCPM3-4B-FC","display_name":"MiniCPM3-4B-FC","official_model_id":null,"provider":"openbmb","aliases":["MiniCPM3-4B-FC (FC)"]},{"model_id":"amazon-nova-pro-v1-0","base_model":"Amazon-Nova-Pro-v1:0","display_name":"Amazon-Nova-Pro-v1:0","official_model_id":null,"provider":"Amazon","aliases":["Amazon-Nova-Pro-v1:0 (FC)"]},{"model_id":"falcon3-7b-instruct","base_model":"Falcon3-7B-Instruct","display_name":"Falcon3-7B-Instruct","official_model_id":null,"provider":"TII UAE","aliases":["Falcon3-7B-Instruct (FC)"]},{"model_id":"qwen3-0-6b","base_model":"Qwen3-0.6B","display_name":"Qwen3-0.6B","official_model_id":null,"provider":"Qwen","aliases":["Qwen3-0.6B (FC)","Qwen3-0.6B (Prompt)"]},{"model_id":"granite-20b-functioncalling","base_model":"Granite-20b-FunctionCalling","display_name":"Granite-20b-FunctionCalling","official_model_id":null,"provider":"IBM","aliases":["Granite-20b-FunctionCalling (FC)"]},{"model_id":"amazon-nova-micro-v1-0","base_model":"Amazon-Nova-Micro-v1:0","display_name":"Amazon-Nova-Micro-v1:0","official_model_id":null,"provider":"Amazon","aliases":["Amazon-Nova-Micro-v1:0 (FC)"]},{"model_id":"rzn-t","base_model":"RZN-T","display_name":"RZN-T","official_model_id":null,"provider":"Phronetic AI","aliases":["RZN-T (Prompt)"]},{"model_id":"minicpm3-4b","base_model":"MiniCPM3-4B","display_name":"MiniCPM3-4B","official_model_id":null,"provider":"openbmb","aliases":["MiniCPM3-4B (Prompt)"]},{"model_id":"llama-3-2-3b-instruct","base_model":"Llama-3.2-3B-Instruct","display_name":"Llama-3.2-3B-Instruct","official_model_id":null,"provider":"Meta","aliases":["Llama-3.2-3B-Instruct (FC)"]},{"model_id":"bielik-11b-v2-3-instruct","base_model":"Bielik-11B-v2.3-Instruct","display_name":"Bielik-11B-v2.3-Instruct","official_model_id":null,"provider":"SpeakLeash & ACK Cyfronet AGH","aliases":["Bielik-11B-v2.3-Instruct (Prompt)"]},{"model_id":"hammer2-1-0-5b","base_model":"Hammer2.1-0.5b","display_name":"Hammer2.1-0.5b","official_model_id":null,"provider":"MadeAgents","aliases":["Hammer2.1-0.5b (FC)"]},{"model_id":"gemma-3-4b-it","base_model":"Gemma-3-4b-it","display_name":"Gemma-3-4b-it","official_model_id":null,"provider":"Google","aliases":["Gemma-3-4b-it (Prompt)"]},{"model_id":"granite-4-0-350m","base_model":"Granite-4.0-350m","display_name":"Granite-4.0-350m","official_model_id":null,"provider":"IBM","aliases":["Granite-4.0-350m (FC)"]},{"model_id":"falcon3-3b-instruct","base_model":"Falcon3-3B-Instruct","display_name":"Falcon3-3B-Instruct","official_model_id":null,"provider":"TII UAE","aliases":["Falcon3-3B-Instruct (FC)"]},{"model_id":"ministral-8b-instruct-2410","base_model":"Ministral-8B-Instruct-2410","display_name":"Ministral-8B-Instruct-2410","official_model_id":null,"provider":"Mistral AI","aliases":["Ministral-8B-Instruct-2410 (FC)"]},{"model_id":"falcon3-1b-instruct","base_model":"Falcon3-1B-Instruct","display_name":"Falcon3-1B-Instruct","official_model_id":null,"provider":"TII UAE","aliases":["Falcon3-1B-Instruct (FC)"]},{"model_id":"llama-3-2-1b-instruct","base_model":"Llama-3.2-1B-Instruct","display_name":"Llama-3.2-1B-Instruct","official_model_id":null,"provider":"Meta","aliases":["Llama-3.2-1B-Instruct (FC)"]},{"model_id":"llama-3-1-nemotron-ultra-253b-v1","base_model":"Llama-3.1-Nemotron-Ultra-253B-v1","display_name":"Llama-3.1-Nemotron-Ultra-253B-v1","official_model_id":null,"provider":"NVIDIA","aliases":["Llama-3.1-Nemotron-Ultra-253B-v1 (FC)"]},{"model_id":"gemma-3-1b-it","base_model":"Gemma-3-1b-it","display_name":"Gemma-3-1b-it","official_model_id":null,"provider":"Google","aliases":["Gemma-3-1b-it (Prompt)"]},{"model_id":"fish-audio-s1","base_model":"Fish Audio S1","display_name":"Fish Audio S1","official_model_id":null,"provider":"Fish Audio","aliases":["Fish Audio S1"]},{"model_id":"magpie-tts-zeroshot","base_model":"Magpie TTS Zeroshot","display_name":"Magpie TTS Zeroshot","official_model_id":null,"provider":"NVIDIA","aliases":["Magpie TTS Zeroshot\nOpen Weights"]},{"model_id":"qwen3-5-35b-a3b","base_model":"qwen3.5 35b a3b","display_name":"qwen3.5 35b a3b","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.5-35b-a3b"]},{"model_id":"qwen3-5-flash","base_model":"qwen3.5 flash","display_name":"qwen3.5 flash","official_model_id":null,"provider":"Alibaba","aliases":["qwen3.5-flash"]},{"model_id":"gpt-5-3","base_model":"GPT-5.3","display_name":"GPT-5.3","official_model_id":null,"provider":"OpenAI","aliases":["GPT 5.3 (Codex) xHigh"]},{"model_id":"qwen3-5-omni-plus-realtime","base_model":"Qwen3.5 Omni Plus Realtime","display_name":"Qwen3.5 Omni Plus Realtime","official_model_id":null,"provider":"Alibaba Cloud","aliases":["Qwen3.5 Omni Plus Realtime"]},{"model_id":"qwen3-5-omni-flash-realtime","base_model":"Qwen3.5 Omni Flash Realtime","display_name":"Qwen3.5 Omni Flash Realtime","official_model_id":null,"provider":"Alibaba Cloud","aliases":["Qwen3.5 Omni Flash Realtime"]},{"model_id":"qwen3-omni-flash","base_model":"Qwen3 Omni Flash","display_name":"Qwen3 Omni Flash","official_model_id":null,"provider":"Alibaba Cloud","aliases":["Qwen3 Omni Flash"]},{"model_id":"qwen3-omni-realtime","base_model":"Qwen3 Omni Realtime","display_name":"Qwen3 Omni Realtime","official_model_id":null,"provider":"Alibaba Cloud","aliases":["Qwen3 Omni Realtime"]},{"model_id":"nova-2-0-sonic","base_model":"Nova 2.0 Sonic","display_name":"Nova 2.0 Sonic","official_model_id":null,"provider":"Amazon Bedrock","aliases":["Nova 2.0 Sonic (Mar 2026)"]},{"model_id":"flm-audio","base_model":"FLM-Audio","display_name":"FLM-Audio","official_model_id":null,"provider":"Cofe AI","aliases":["FLM-Audio"]},{"model_id":"gemini-2-5-flash-native-audio-dialog","base_model":"Gemini 2.5 Flash Native Audio Dialog","display_name":"Gemini 2.5 Flash Native Audio Dialog","official_model_id":null,"provider":"Google","aliases":["Gemini 2.5 Flash Native Audio Dialog","Gemini 2.5 Flash Native Audio Dialog Thinking"]},{"model_id":"moshi","base_model":"Moshi","display_name":"Moshi","official_model_id":null,"provider":"Kyutai","aliases":["Moshi"]},{"model_id":"nemotron-voicechat","base_model":"Nemotron Voicechat","display_name":"Nemotron Voicechat","official_model_id":null,"provider":"NVIDIA","aliases":["Nemotron Voicechat"]},{"model_id":"personaplex","base_model":"PersonaPlex","display_name":"PersonaPlex","official_model_id":null,"provider":"NVIDIA","aliases":["PersonaPlex"]},{"model_id":"gpt-4o-mini-realtime","base_model":"GPT-4o mini Realtime","display_name":"GPT-4o mini Realtime","official_model_id":null,"provider":"OpenAI","aliases":["GPT-4o mini Realtime (Dec 2024)"]},{"model_id":"gpt-4o-audio-chatcompletions","base_model":"GPT-4o audio chatcompletions","display_name":"GPT-4o audio chatcompletions","official_model_id":null,"provider":"OpenAI","aliases":["GPT-4o audio chatcompletions"]},{"model_id":"step-audio-r1-1","base_model":"Step-Audio R1.1","display_name":"Step-Audio R1.1","official_model_id":null,"provider":"StepFun","aliases":["Step-Audio R1.1 (Realtime)"]},{"model_id":"freeze-omni","base_model":"Freeze-Omni","display_name":"Freeze-Omni","official_model_id":null,"provider":"VITA","aliases":["Freeze-Omni"]}],"sources":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-3","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🧮Math","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/math","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better"},{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Agentic Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Agentic Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Language","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Language","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"terminal21","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"2.1","source_url":"https://www.tbench.ai/?version=2.1","published_at":null,"captured_at":"2026-09-07T10:10:19.707Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"vocals","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Vocals","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/vocals","published_at":null,"captured_at":"2026-09-07T10:10:29.205Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"voice-2","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech-to-Speech Index","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better"},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better"},{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better"},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better"}],"methodology":{"method":"weighted_reciprocal_rank","formula":"weighted_mean(1 / log2(rank + 1))","raw_scores_averaged":false,"source_family_policy":"Within each source family, average benchmark reciprocal ranks; then weight source families. Republished benchmark results are not independent.","configuration_policy":"One base model per top three. Best reported rank configuration per benchmark contributes once; every raw configuration remains in source_results. Different versions remain separate base models. H3 Max is explicitly a fal post-trained configuration.","admission_policy":"Final results take priority over preliminary ones. When at least three models have two independent source families, only those enter the consensus top three. Other evaluated models remain candidates; missing evidence is never a bad score.","tie_break":"Exact consensus ties: coverage, then mean displayed source position, then stable model_id; this order is not statistical superiority.","freshness_policy":"published_at is the dated leaderboard snapshot, never a model release date or benchmark release version. Unknown publication dates stay null. Evidence older than 30 days is stale; 14 days is a warning.","limitations":"Source coverage and confidence describe this captured evidence set. No vendor-reported result determines rank. Unknown API IDs, prices and context sizes are not inferred."},"unavailable_tasks":[{"id":"translation","name":"Translation","evaluation_status":"unavailable","reason":"Previous ranking used an agency article and unnamed model families; comparable version-specific primary evidence has not been established."}],"schemaVersion":2,"id":"lll-bz-llm-ranking-for-ai","name":"Task-specific AI model rankings","canonicalUrl":"https://lll.bz/ai","jsonUrl":"https://lll.bz/ai.json","sourcePage":"https://lll.bz/llm","stats":{"tasks":29,"taskGroups":5,"rankedLists":30,"uniqueModels":39},"winners":[{"taskId":"chat","taskTitle":"General chat","category":"text","model":{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.84463946,"mean_rank":3.3333333333333335,"median_rank":2,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-0","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1507,"raw_unit":"Elo","ci_low":1502,"ci_high":1512,"rank_spread_min":1,"rank_spread_max":6,"sample_count":27189,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Overall","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Overall","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":2,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":2},{"id":"aa-intelligence","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Intelligence Index","benchmark_version":"4.2","source_url":"https://artificialanalysis.ai/leaderboards/models","published_at":null,"captured_at":"2026-09-07T10:10:22.585Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 (with fallback)","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":7,"raw_score":53,"raw_unit":"index","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-0|claude-fable-5","lb-Overall|Claude Fable 5 Max Effort","aa-intelligence|Claude Fable 5 (with fallback)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.845","sourceUrl":"https://arena.ai/leaderboard/text","likeKey":"chat:claude-fable-5","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 3.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Human preference is weighted 70%; objective broad ability provides two secondary checks."},"deepLink":"https://lll.bz/llm?task=chat"},{"taskId":"russian","taskTitle":"Russian language","category":"text","model":{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-1","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🇷🇺Russian","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/russian","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1521,"raw_unit":"Elo","ci_low":1509,"ci_high":1533,"rank_spread_min":1,"rank_spread_max":11,"sample_count":2706,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-1|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text/russian","likeKey":"russian:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Russian-language preference only; overlapping rank ranges limit certainty. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=russian"},{"taskId":"expert","taskTitle":"Expert analysis","category":"text","model":{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"partially_evaluated","consensus_score":0.73788625,"mean_rank":5,"median_rank":5,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena🤓Expert","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/expert","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1548,"raw_unit":"Elo","ci_low":1537,"ci_high":1559,"rank_spread_min":1,"rank_spread_max":13,"sample_count":2939,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"lb-Reasoning","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Reasoning","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5 Max Effort","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":"Max","reasoning_effort":"max","rank":9,"raw_score":89.7,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":9}],"aggregation_source_results":["arena-2|claude-fable-5","lb-Reasoning|Claude Fable 5 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.738","sourceUrl":"https://arena.ai/leaderboard/text/expert","likeKey":"expert:claude-fable-5","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 5.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. General expert reasoning; does not establish a winner for individual professions."},"deepLink":"https://lll.bz/llm?task=expert"},{"taskId":"math","taskTitle":"Mathematics","category":"text","model":{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"partially_evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":0.6666666666666666,"independent_source_count":2,"fresh_source_count":0,"source_results":[{"id":"lb-Mathematics","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Mathematics","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":97,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hle","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"Humanity’s Last Exam","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/humanitys_last_exam","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable 5.1 (xhigh)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":46.5,"raw_unit":"percent","ci_low":44.5,"ci_high":48.5,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["lb-Mathematics|Claude Fable 5.1 Max Effort","scale-hle|Fable 5.1 (xhigh)"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"math:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 67%.","confidence":"medium","note":"Sources disagree on #1. Mathematics receives 60%; HLE is a broader reasoning cross-check, not a math-only score."},"deepLink":"https://lll.bz/llm?task=math"},{"taskId":"instructions","taskTitle":"Instruction following","category":"text","model":{"model_id":"grok-4-3","base_model":"Grok 4.3","display_name":"Grok 4.3","official_model_id":null,"provider":"SpaceXAI","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.44489779,"mean_rank":49.333333333333336,"median_rank":40,"source_coverage":1,"independent_source_count":3,"fresh_source_count":1,"source_results":[{"id":"arena-4","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena📝Instruction Following","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/instruction-following","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"grok-4.3","normalized_model_family":"grok-4-3","base_model":"grok 4.3","variant":null,"reasoning_effort":null,"rank":107,"raw_score":1416,"raw_unit":"Elo","ci_low":1411,"ci_high":1421,"rank_spread_min":86,"rank_spread_max":130,"sample_count":22801,"is_preliminary":false,"provider":"SpaceXAI","source_order":107},{"id":"lb-Instruction Following","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Instruction Following","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":null,"reasoning_effort":null,"rank":40,"raw_score":62.8,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":40},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (medium)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":83.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1},{"id":"aa-if","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"IFBench","benchmark_version":"58 constraints; visible top-10 chart","source_url":"https://artificialanalysis.ai/evaluations/ifbench","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok 4.3 (high)","normalized_model_family":"grok-4-3","base_model":"Grok 4.3","variant":"High","reasoning_effort":"high","rank":5,"raw_score":81.3,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":5}],"aggregation_source_results":["arena-4|grok-4.3","lb-Instruction Following|Grok 4.3","aa-if|Grok 4.3 (medium)"],"is_preliminary":false,"rank":1,"modelId":"grok-4-3","modelName":"Grok 4.3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.445","sourceUrl":"https://arena.ai/leaderboard/text/instruction-following","likeKey":"instructions:grok-4-3","whyRanked":"Rank-based consensus across 3 independent source families. Mean source rank 49.33; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Preference, objective instruction following and IFBench measure different constraints; see each result."},"deepLink":"https://lll.bz/llm?task=instructions"},{"taskId":"writing","taskTitle":"Copywriting","category":"text","model":{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-5","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Creative Writing","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/creative-writing","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1504,"raw_unit":"Elo","ci_low":1495,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":6,"sample_count":5480,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"arena-writing2","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text Arena✍️Writing, Literature, & Language","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text/industry-writing-and-literature-and-language-no-style-control","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":2,"raw_score":1505,"raw_unit":"Elo","ci_low":1497,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":8,"sample_count":7328,"is_preliminary":false,"provider":"Anthropic","source_order":2}],"aggregation_source_results":["arena-5|claude-fable-5","arena-writing2|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/text/creative-writing","likeKey":"writing:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"low","note":"Sources disagree on #1. Creative writing and writing/literature/language without style control. These are proxies for copywriting, not conversion tests. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=writing"},{"taskId":"research","taskTitle":"Search and research","category":"text","model":{"model_id":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","display_name":"GPT-5.6 Sol","official_model_id":null,"provider":"OpenAI","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-9","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Search Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/search","published_at":"2026-08-24","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"warning","metric_direction":"higher_is_better","source_model_name":"gpt-5.6-sol-xhigh","normalized_model_family":"gpt-5-6-sol","base_model":"GPT-5.6 Sol","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":1257,"raw_unit":"Elo","ci_low":1250,"ci_high":1264,"rank_spread_min":1,"rank_spread_max":2,"sample_count":29663,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-9|gpt-5.6-sol-xhigh"],"is_preliminary":false,"rank":1,"modelId":"gpt-5-6-sol","modelName":"GPT-5.6 Sol","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/search","likeKey":"research:gpt-5-6-sol","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Search-enabled configurations only. General intelligence is not search evidence. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=research"},{"taskId":"documents","taskTitle":"PDF and documents","category":"text","model":{"model_id":"claude-opus-5","base_model":"Claude Opus 5","display_name":"Claude Opus 5","official_model_id":null,"provider":"Anthropic","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"arena-6","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Document Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/document","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"claude-opus-5-high","normalized_model_family":"claude-opus-5","base_model":"Claude Opus 5","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1520,"raw_unit":"Elo","ci_low":1505,"ci_high":1535,"rank_spread_min":1,"rank_spread_max":4,"sample_count":1663,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-6|claude-opus-5-high"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-5","modelName":"Claude Opus 5","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/document","likeKey":"documents:claude-opus-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Document Arena preference; newly released models without a document evaluation remain pending. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=documents"},{"taskId":"coding","taskTitle":"Terminal software engineering","category":"code","model":{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Codex / (max)","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"terminal","source_name":"Terminal-Bench","source_type":"independent_primary","benchmark_name":"Terminal-Bench","benchmark_version":"4.0","source_url":"https://www.tbench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.178Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra (max)","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Codex / (max)","reasoning_effort":"max","rank":1,"raw_score":58.2,"raw_unit":"percent","ci_low":55.400000000000006,"ci_high":61,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["terminal|GPT-6 Astra (max)"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Codex / (max)","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://www.tbench.ai/","likeKey":"coding:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Terminal-Bench 4.0 with the stated agent harness; does not measure standalone code reasoning. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=coding"},{"taskId":"webdev","taskTitle":"Web development","category":"code","model":{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-10","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-6-astra-max","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1797,"raw_unit":"Elo","ci_low":1773,"ci_high":1821,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1199,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-10|gpt-6-astra-max"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code","likeKey":"webdev:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. WebDev overall preference. The leading models have overlapping rank spreads. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=webdev"},{"taskId":"agents","taskTitle":"AI agents","category":"code","model":{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-agent","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Agent Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/agent","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 (Max)","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":15.87,"raw_unit":"percent","ci_low":13.03,"ci_high":18.71,"rank_spread_min":1,"rank_spread_max":3,"sample_count":6796,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"scale-hil","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"HiL-Bench","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/hil","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":null,"reasoning_effort":null,"rank":1,"raw_score":61.5,"raw_unit":"percent","ci_low":55.03,"ci_high":67.97,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["arena-agent|Claude Fable 5.1 (Max)","scale-hil|Claude Fable 5.1"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/agent","likeKey":"agents:claude-fable-5-1","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Agent Arena overall plus targeted clarification ability; no claim about every agent workload."},"deepLink":"https://lll.bz/llm?task=agents"},{"taskId":"vision","taskTitle":"Image understanding","category":"image","model":{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-7","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/vision","published_at":"2026-08-27","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1313,"raw_unit":"Elo","ci_low":1305,"ci_high":1321,"rank_spread_min":1,"rank_spread_max":6,"sample_count":10002,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-7|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision","likeKey":"vision:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Visual question-answering preference; does not establish performance on every vision subtask. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=vision"},{"taskId":"ocr","taskTitle":"Text from image (OCR)","category":"image","model":{"model_id":"claude-fable-5","base_model":"Claude Fable 5","display_name":"Claude Fable 5","official_model_id":null,"provider":"Anthropic","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"ocr","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Vision — OCR","benchmark_version":null,"source_url":"https://arena.ai/leaderboard/vision/ocr","published_at":"2026-09-02","captured_at":"2026-09-07T10:10:38.778Z","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5","normalized_model_family":"claude-fable-5","base_model":"Claude Fable 5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1329,"raw_unit":"Elo","ci_low":1320,"ci_high":1338,"rank_spread_min":1,"rank_spread_max":5,"sample_count":7174,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["ocr|claude-fable-5"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5","modelName":"Claude Fable 5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/vision/ocr","likeKey":"ocr:claude-fable-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. OCR task slice; includes confidence intervals and vote counts. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=ocr"},{"taskId":"image-generation","taskTitle":"Image generation","category":"image","model":{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-12","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Image Arena🏆Overall","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-image","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1382,"raw_unit":"Elo","ci_low":1378,"ci_high":1386,"rank_spread_min":1,"rank_spread_max":1,"sample_count":77830,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-17","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Image Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/text-to-image","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":1,"raw_score":1178,"raw_unit":"Elo","ci_low":1168,"ci_high":1188,"rank_spread_min":1,"rank_spread_max":1,"sample_count":14585,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["arena-12|gpt-image-2 (medium)","aa-17|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/text-to-image","likeKey":"image-generation:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Independent image preference sources; configurations are retained separately."},"deepLink":"https://lll.bz/llm?task=image-generation"},{"taskId":"image-editing","taskTitle":"Image editing","category":"image","model":{"model_id":"gpt-image-2","base_model":"GPT Image 2","display_name":"GPT Image 2","official_model_id":null,"provider":"OpenAI","variant":"Medium","reasoning_effort":"medium","evaluation_status":"evaluated","consensus_score":0.81546488,"mean_rank":1.5,"median_rank":1.5,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-13","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image Edit Arena🏆Single Image Edit","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-edit","published_at":"2026-09-03","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"gpt-image-2 (medium)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"Medium","reasoning_effort":"medium","rank":1,"raw_score":1461,"raw_unit":"Elo","ci_low":1457,"ci_high":1465,"rank_spread_min":1,"rank_spread_max":1,"sample_count":228827,"is_preliminary":false,"provider":"OpenAI","source_order":1},{"id":"aa-18","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image Editing Leaderboard - Top AI Image Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/image/leaderboard/editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT Image 2 (high)","normalized_model_family":"gpt-image-2","base_model":"GPT Image 2","variant":"High","reasoning_effort":"high","rank":2,"raw_score":1117,"raw_unit":"Elo","ci_low":1107,"ci_high":1127,"rank_spread_min":1,"rank_spread_max":2,"sample_count":11046,"is_preliminary":false,"provider":"OpenAI","source_order":2}],"aggregation_source_results":["arena-13|gpt-image-2 (medium)","aa-18|GPT Image 2 (high)"],"is_preliminary":false,"rank":1,"modelId":"gpt-image-2","modelName":"GPT Image 2","testedVariant":"Medium","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.815","sourceUrl":"https://arena.ai/leaderboard/image-edit","likeKey":"image-editing:gpt-image-2","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.50; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Both GPT Image 2 and MAI-Image 2.6 are top tier."},"deepLink":"https://lll.bz/llm?task=image-editing"},{"taskId":"text-to-video","taskTitle":"Text → video","category":"video","model":{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":0.75,"mean_rank":2,"median_rank":2,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-14","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Text-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/text-to-video","published_at":"2026-09-04","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1494,"raw_unit":"Elo","ci_low":1475,"ci_high":1513,"rank_spread_min":1,"rank_spread_max":7,"sample_count":1167,"is_preliminary":false,"provider":"Alibaba","source_order":3},{"id":"aa-19","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/text-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1239,"raw_unit":"Elo","ci_low":1229,"ci_high":1249,"rank_spread_min":1,"rank_spread_max":3,"sample_count":5591,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-14|wan3.0","aa-19|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"0.750","sourceUrl":"https://arena.ai/leaderboard/text-to-video","likeKey":"text-to-video:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 2.00; coverage 100%.","confidence":"medium","note":"Sources disagree on #1. Independent preference sources disagree; overlapping intervals prevent a definitive winner."},"deepLink":"https://lll.bz/llm?task=text-to-video"},{"taskId":"image-to-video","taskTitle":"Image → video","category":"video","model":{"model_id":"minimax-h3","base_model":"MiniMax H3","display_name":"MiniMax H3","official_model_id":null,"provider":"MiniMax","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-15","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Image-to-Video Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/image-to-video","published_at":"2026-09-02","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"minimax-h3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1497,"raw_unit":"Elo","ci_low":1491,"ci_high":1503,"rank_spread_min":1,"rank_spread_max":3,"sample_count":36137,"is_preliminary":false,"provider":"MiniMax","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Minimax H3 Max (post-trained by fal)","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1201,"raw_unit":"Elo","ci_low":1192,"ci_high":1210,"rank_spread_min":1,"rank_spread_max":2,"sample_count":5587,"is_preliminary":false,"provider":"Fal","source_order":1},{"id":"aa-20","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Image to Video Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/image-to-video","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"MiniMax H3","normalized_model_family":"minimax-h3","base_model":"MiniMax H3","variant":null,"reasoning_effort":null,"rank":3,"raw_score":1187,"raw_unit":"Elo","ci_low":1179,"ci_high":1195,"rank_spread_min":2,"rank_spread_max":4,"sample_count":7465,"is_preliminary":false,"provider":"MiniMax","source_order":3}],"aggregation_source_results":["arena-15|minimax-h3","aa-20|Minimax H3 Max (post-trained by fal)"],"is_preliminary":false,"rank":1,"modelId":"minimax-h3","modelName":"MiniMax H3","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/image-to-video","likeKey":"image-to-video:minimax-h3","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. H3 Max is a fal post-trained configuration. Source-specific configuration evidence is not interchangeable."},"deepLink":"https://lll.bz/llm?task=image-to-video"},{"taskId":"video-editing","taskTitle":"Video editing","category":"video","model":{"model_id":"wan-3-0","base_model":"Wan 3.0","display_name":"Wan 3.0","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":2,"fresh_source_count":1,"source_results":[{"id":"arena-16","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Video Edit Arena","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/video-edit","published_at":"2026-08-26","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"wan3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1414,"raw_unit":"Elo","ci_low":1388,"ci_high":1440,"rank_spread_min":1,"rank_spread_max":3,"sample_count":463,"is_preliminary":false,"provider":"Alibaba","source_order":1},{"id":"aa-21","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Video Editing Leaderboard - Top AI Video Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/video/leaderboard/video-editing","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Wan 3.0","normalized_model_family":"wan-3-0","base_model":"Wan 3.0","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1190,"raw_unit":"Elo","ci_low":1183,"ci_high":1197,"rank_spread_min":1,"rank_spread_max":1,"sample_count":5315,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["arena-16|wan3.0","aa-21|Wan 3.0"],"is_preliminary":false,"rank":1,"modelId":"wan-3-0","modelName":"Wan 3.0","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/video-edit","likeKey":"video-editing:wan-3-0","whyRanked":"Rank-based consensus across 2 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Both sources put Wan 3.0 first, with uncertainty on Arena."},"deepLink":"https://lll.bz/llm?task=video-editing"},{"taskId":"speech-to-text","taskTitle":"Speech to text","category":"audio","model":{"model_id":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","display_name":"Fun-Realtime-ASR-preview","official_model_id":null,"provider":"Alibaba","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"stt","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"AA-WER Non-streaming","benchmark_version":null,"source_url":"https://artificialanalysis.ai/speech-to-text/non-streaming","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"lower_is_better","source_model_name":"Fun-Realtime-ASR-preview","normalized_model_family":"fun-realtime-asr-preview","base_model":"Fun-Realtime-ASR-preview","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1.7,"raw_unit":"percent WER","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba","source_order":1}],"aggregation_source_results":["stt|Fun-Realtime-ASR-preview"],"is_preliminary":false,"rank":1,"modelId":"fun-realtime-asr-preview","modelName":"Fun-Realtime-ASR-preview","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-text/non-streaming","likeKey":"speech-to-text:fun-realtime-asr-preview","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"AA-WER transcription accuracy only. Lower WER is better; latency is a separate criterion. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=speech-to-text"},{"taskId":"text-to-speech","taskTitle":"Text to speech","category":"audio","model":{"model_id":"sonic-3-6","base_model":"Sonic 3.6","display_name":"Sonic 3.6","official_model_id":null,"provider":"Cartesia","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"aa-22","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Text to Speech Leaderboard - Top AI Speech Models | Artificial Analysis","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Sonic 3.6","normalized_model_family":"sonic-3-6","base_model":"Sonic 3.6","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1282,"raw_unit":"Elo","ci_low":1265,"ci_high":1299,"rank_spread_min":1,"rank_spread_max":1,"sample_count":1790,"is_preliminary":false,"provider":"Cartesia","source_order":1}],"aggregation_source_results":["aa-22|Sonic 3.6"],"is_preliminary":false,"rank":1,"modelId":"sonic-3-6","modelName":"Sonic 3.6","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice","likeKey":"text-to-speech:sonic-3-6","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Provider Voice Arena measures preference with each provider’s selected voices. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=text-to-speech"},{"taskId":"realtime-voice","taskTitle":"Voice agents","category":"audio","model":{"model_id":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","display_name":"Grok Voice Think Fast 2.0","official_model_id":null,"provider":"SpaceXAI","variant":"High","reasoning_effort":"high","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-5","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Voice Agentic Performance","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Grok Voice Think Fast 2.0 High","normalized_model_family":"grok-voice-think-fast-2-0","base_model":"Grok Voice Think Fast 2.0","variant":"High","reasoning_effort":"high","rank":1,"raw_score":56.5,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"SpaceXAI","component_scores":{"Speech to Speech Index %":"79.0%","Speech Reasoning %":"97%","Conversational Dynamics %":"95.1%","Agentic Performance %":"56.5%","Arena Preference Elo":"908","Task Success Rate %":"94.7%","Time to First Audio Seconds":"0.70"},"source_order":19}],"aggregation_source_results":["voice-5|Grok Voice Think Fast 2.0 High"],"is_preliminary":false,"rank":1,"modelId":"grok-voice-think-fast-2-0","modelName":"Grok Voice Think Fast 2.0","testedVariant":"High","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"realtime-voice:grok-voice-think-fast-2-0","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Voice agents ranked by customer-service task completion (tau-Voice); conversation is a separate task. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=realtime-voice"},{"taskId":"music","taskTitle":"Music generation","category":"audio","model":{"model_id":"suno-v5-5","base_model":"Suno V5.5","display_name":"Suno V5.5","official_model_id":null,"provider":"Suno","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"music","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Music Arena — Instrumental","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/music/leaderboard/instrumental","published_at":null,"captured_at":"2026-09-07T10:10:29.413Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Suno V5.5","normalized_model_family":"suno-v5-5","base_model":"Suno V5.5","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1186,"raw_unit":"Elo","ci_low":1177,"ci_high":1195,"rank_spread_min":1,"rank_spread_max":1,"sample_count":6469,"is_preliminary":false,"provider":"Suno","source_order":1}],"aggregation_source_results":["music|Suno V5.5"],"is_preliminary":false,"rank":1,"modelId":"suno-v5-5","modelName":"Suno V5.5","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/music/leaderboard/instrumental","likeKey":"music:suno-v5-5","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Instrumental and vocal preference remain separate lists. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=music"},{"taskId":"data-analysis","taskTitle":"Data analysis","category":"code","model":{"model_id":"gpt-6-astra","base_model":"GPT-6 Astra","display_name":"GPT-6 Astra","official_model_id":null,"provider":"OpenAI","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Data Analysis","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Data Analysis","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"GPT-6 Astra Max Effort","normalized_model_family":"gpt-6-astra","base_model":"GPT-6 Astra","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":83,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"OpenAI","source_order":1}],"aggregation_source_results":["lb-Data Analysis|GPT-6 Astra Max Effort"],"is_preliminary":false,"rank":1,"modelId":"gpt-6-astra","modelName":"GPT-6 Astra","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"data-analysis:gpt-6-astra","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective data analysis; this is not a web dashboard design benchmark and does not establish a separate SQL winner. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=data-analysis"},{"taskId":"tool-calling","taskTitle":"Structured output and tool calling","category":"code","model":{"model_id":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","display_name":"Claude-Opus-4.5-20251101","official_model_id":null,"provider":"Anthropic","variant":"function calling","reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (FC)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":1,"raw_score":77.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1},{"id":"bfcl","source_name":"Berkeley BFCL","source_type":"independent_primary","benchmark_name":"BFCL overall function calling","benchmark_version":"V4 / f7cf735","source_url":"https://gorilla.cs.berkeley.edu/leaderboard.html","published_at":"2026-04-12","captured_at":"2026-09-07T10:10:33.001Z","evidence_freshness":"stale","metric_direction":"higher_is_better","source_model_name":"Claude-Opus-4-5-20251101 (Prompt)","normalized_model_family":"claude-opus-4-5-20251101","base_model":"Claude-Opus-4.5-20251101","variant":"function calling","reasoning_effort":null,"rank":57,"raw_score":33.47,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":57}],"aggregation_source_results":["bfcl|Claude-Opus-4-5-20251101 (FC)"],"is_preliminary":false,"rank":1,"modelId":"claude-opus-4-5-20251101","modelName":"Claude-Opus-4.5-20251101","testedVariant":"function calling","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://gorilla.cs.berkeley.edu/leaderboard.html","likeKey":"tool-calling:claude-opus-4-5-20251101","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"BFCL function-calling accuracy, with explicit benchmark configurations. Single source family; independent cross-source confirmation is unavailable in this edition. Warning: the published benchmark snapshot is more than 30 days old."},"deepLink":"https://lll.bz/llm?task=tool-calling"},{"taskId":"voice-cloning","taskTitle":"Controlled-voice synthesis","category":"audio","model":{"model_id":"realtime-tts-2","base_model":"Realtime TTS-2","display_name":"Realtime TTS-2","official_model_id":null,"provider":"Inworld","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"cloning","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Controlled Voice Arena","benchmark_version":"live leaderboard","source_url":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","published_at":null,"captured_at":"2026-09-07T10:10:32.121Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Realtime TTS-2","normalized_model_family":"realtime-tts-2","base_model":"Realtime TTS-2","variant":null,"reasoning_effort":null,"rank":1,"raw_score":1123,"raw_unit":"Elo","ci_low":1107,"ci_high":1139,"rank_spread_min":1,"rank_spread_max":2,"sample_count":1292,"is_preliminary":false,"provider":"Inworld","source_order":1}],"aggregation_source_results":["cloning|Realtime TTS-2"],"is_preliminary":false,"rank":1,"modelId":"realtime-tts-2","modelName":"Realtime TTS-2","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/text-to-speech/leaderboard/controlled-voice","likeKey":"voice-cloning:realtime-tts-2","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"low","note":"Approximately tied at the top. Controlled Voice Arena tests common-voice synthesis preference; it does not separately establish speaker identity similarity. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=voice-cloning"},{"taskId":"code-reasoning","taskTitle":"Code reasoning","category":"code","model":{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"lb-Coding","source_name":"LiveBench","source_type":"independent_primary","benchmark_name":"LiveBench Coding","benchmark_version":"2026-06-25 (latest release)","source_url":"https://livebench.ai/","published_at":null,"captured_at":"2026-09-07T10:10:19.053Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Claude Fable 5.1 Max Effort","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":86.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["lb-Coding|Claude Fable 5.1 Max Effort"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://livebench.ai/","likeKey":"code-reasoning:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Objective coding problems without a terminal agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=code-reasoning"},{"taskId":"reference-design","taskTitle":"Reference-based frontend design","category":"code","model":{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Max","reasoning_effort":"max","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":1,"source_results":[{"id":"arena-reference","source_name":"Arena","source_type":"independent_primary","benchmark_name":"Code Arena | WebDev🎨Reference-Based Design","benchmark_version":"live leaderboard","source_url":"https://arena.ai/leaderboard/code/webdev/reference-based-design","published_at":"2026-09-05","captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"fresh","metric_direction":"higher_is_better","source_model_name":"claude-fable-5.1-max","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Max","reasoning_effort":"max","rank":1,"raw_score":1815,"raw_unit":"Elo","ci_low":1773,"ci_high":1857,"rank_spread_min":1,"rank_spread_max":2,"sample_count":366,"is_preliminary":false,"provider":"Anthropic","source_order":1}],"aggregation_source_results":["arena-reference|claude-fable-5.1-max"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Max","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://arena.ai/leaderboard/code/webdev/reference-based-design","likeKey":"reference-design:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Recreate a frontend from a design reference; separate from general WebDev. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=reference-design"},{"taskId":"repo-refactoring","taskTitle":"Repository refactoring","category":"code","model":{"model_id":"claude-fable-5-1","base_model":"Claude Fable 5.1","display_name":"Claude Fable 5.1","official_model_id":null,"provider":"Anthropic","variant":"Xhigh","reasoning_effort":"xhigh","evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"scale-refactor","source_name":"Scale Labs","source_type":"independent_primary","benchmark_name":"SWE Atlas — Refactoring","benchmark_version":"current leaderboard","source_url":"https://labs.scale.com/leaderboard/sweatlas-refactoring","published_at":null,"captured_at":"2026-09-07T10:16:44.291125+00:00","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Fable-5.1 (Claude Code) xHigh","normalized_model_family":"claude-fable-5-1","base_model":"Claude Fable 5.1","variant":"Xhigh","reasoning_effort":"xhigh","rank":1,"raw_score":56.67,"raw_unit":"percent","ci_low":50.150000000000006,"ci_high":63.19,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":null,"source_order":1}],"aggregation_source_results":["scale-refactor|Fable-5.1 (Claude Code) xHigh"],"is_preliminary":false,"rank":1,"modelId":"claude-fable-5-1","modelName":"Claude Fable 5.1","testedVariant":"Xhigh","subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://labs.scale.com/leaderboard/sweatlas-refactoring","likeKey":"repo-refactoring:claude-fable-5-1","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Approximately tied at the top. Restructure repositories while preserving behavior, using the stated agent harness. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=repo-refactoring"},{"taskId":"voice-conversation","taskTitle":"Realtime voice conversation","category":"audio","model":{"model_id":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","display_name":"Qwen Audio 3.0 Realtime Plus","official_model_id":null,"provider":"Alibaba Cloud","variant":null,"reasoning_effort":null,"evaluation_status":"evaluated","consensus_score":1,"mean_rank":1,"median_rank":1,"source_coverage":1,"independent_source_count":1,"fresh_source_count":0,"source_results":[{"id":"voice-3","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Speech Reasoning","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":99,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1},{"id":"voice-4","source_name":"Artificial Analysis","source_type":"independent_primary","benchmark_name":"Conversational Dynamics","benchmark_version":"current components","source_url":"https://artificialanalysis.ai/speech-to-speech","published_at":null,"captured_at":"2026-09-07T10:10:23.006Z","evidence_freshness":"unknown","metric_direction":"higher_is_better","source_model_name":"Qwen Audio 3.0 Realtime Plus","normalized_model_family":"qwen-audio-3-0-realtime-plus","base_model":"Qwen Audio 3.0 Realtime Plus","variant":null,"reasoning_effort":null,"rank":1,"raw_score":98.4,"raw_unit":"percent","ci_low":null,"ci_high":null,"rank_spread_min":null,"rank_spread_max":null,"sample_count":null,"is_preliminary":false,"provider":"Alibaba Cloud","component_scores":{"Speech to Speech Index %":"66.8%","Speech Reasoning %":"99%","Conversational Dynamics %":"98.4%","Agentic Performance %":"54.6%","Arena Preference Elo":"699","Task Success Rate %":"77.8%","Time to First Audio Seconds":"1.54"},"source_order":1}],"aggregation_source_results":["voice-3|Qwen Audio 3.0 Realtime Plus","voice-4|Qwen Audio 3.0 Realtime Plus"],"is_preliminary":false,"rank":1,"modelId":"qwen-audio-3-0-realtime-plus","modelName":"Qwen Audio 3.0 Realtime Plus","testedVariant":null,"subtitle":"Task-specific evidence; compare configurations and source results.","metricName":"Rank consensus","metricValue":"1.000","sourceUrl":"https://artificialanalysis.ai/speech-to-speech","likeKey":"voice-conversation:qwen-audio-3-0-realtime-plus","whyRanked":"Rank-based consensus across 1 independent source families. Mean source rank 1.00; coverage 100%.","confidence":"medium","note":"Sources disagree on ranking order. Equal rank weight for speech reasoning and conversational dynamics. The composite index and agent completion are retained as component context. Single source family; independent cross-source confirmation is unavailable in this edition."},"deepLink":"https://lll.bz/llm?task=voice-conversation"}]}