MODEL LEDGER

模型评测

主流大模型能力对比评测,通过实际题目测试各模型的推理、代码、创意等能力

13条记录

Anthropic

Claude Opus 4.5

Anthropic发布

  • 推理
  • 代码
  • 创意

Anthropic

Claude Opus 4.1

Anthropic 发布

  • 推理
  • 代码
  • 多模态

OpenAI

GPT 5.1 Codex Max

OpenAI推出的编码模型

  • 代码

DeepSeek

DeepSeek V3.2

国产开源大模型,性价比极高

  • 开源
  • 代码
  • 推理
  • 数学

OpenAI

gpt-5.2 xhigh

OpenAI推出的旗舰模型

  • 代码
  • 推理
  • 数学

Google

Gemini 3 Pro(high)

Google推出的新一代旗舰模型

  • 代码
  • 推理
  • 写作

Z.ai

GLM-4.6

智谱推出的国产开源大模型

  • 代码
  • 开源

Qwen

Qwen3-Coder

阿里千问推出的开源代码模型

  • 代码
  • 开源

Xiaomi

Xiaomi MIMO

小米公司推出的开源大模型

  • 代码
  • 推理

Google

Gemini 3 Flash Preview

Google推出的新一代轻量旗舰模型

  • 代码
  • 推理
  • 写作
  • 速度

Z.ai

GLM-4.7

智谱推出的国产开源大模型

  • 代码
  • 开源

MiniMax

MiniMax-M2.1

MiniMax推出的国产开源大模型

  • Agent
  • 开源

Qwen

Qwen3-Max-Thinking

阿里千问推出的Qwen3最新思考模型(闭源)

  • 代码
  • 推理