导航首页 » AI 实测 » 国产大模型同题实测:DeepSeek / 豆包 / Kimi / 通义 / 元宝
国产大模型同题实测:DeepSeek / 豆包 / Kimi / 通义 / 元宝

这篇不排名,而是给你一套可复用的同题测试方法,并用同一套题看这几个模型的表现倾向。

测试题设计(5 类)

  1. 事实类:问一个近期公开事件的时间线。
  2. 逻辑类:一道需要多步推理的应用题。
  3. 长文类:给 1 万字材料,要求提取要点并指出矛盾处。
  4. 写作类:给受众和约束写一段 300 字文案。
  5. 代码类:让它们修一个带边界条件 bug 的函数。

观察倾向

  • DeepSeek:逻辑与代码题完成度稳定,长上下文不易跑偏。
  • Kimi:长文类表现突出,摘要层次清楚,喜欢给结构化输出。
  • 豆包:写作与日常问答顺手,语气自然,速度体验好。
  • 通义千问:文档与表格类任务省事,输出格式规范。
  • 腾讯元宝:生态联动方便,日常问答稳,适合微信场景。

怎么自己测

固定题目、固定提示词、固定轮次,逐条记录「可用 / 需修改 / 不可用」。测 20 题就能看出哪个模型更适合你的日常任务——别人的排名永远不如你自己的二十道题。

本文为编辑整理的使用观察,不含厂商赞助,具体能力随模型版本变化,请以你自己的实测为准。