AI Agent 最新可核对评测

每日自动产出一份评测;只有来源、具体版本、结构化场景与评分理由全部通过后才会发布。卡片明确区分自动评测与人工核验,旧记录保留在审计链中。

Qwen3.7-Max

2026/09/19自动评测

阿里云通义千问旗舰版:百万上下文 + 超长程 Agent 执行

4.1/5

长上下文与 Agent 执行值得选,速度与价格敏感者建议先观望

基于公开信息评估:Qwen3.7-Max 是阿里云最新旗舰模型,官方定位为原生百万 Token 上下文、内置扩展思考模式,并称可连续自主执行复杂任务数十小时。分维度看,任务完成度 4.5,源于长程 Agent 执行与工具调用的官方强调,最贴合研究型长流程任务;中文优化 4.5,背靠阿里云中文语料与国内稳定部署,本土表达与理解是天然优势;输出质量 4.0,多语言理解与扩展思考加分,但缺少第三方基准佐证,实际深度仍需实测确认;性价比 4.0,OpenAI 兼容 API 让存量应用迁移成本极低,企业集成友好,然而旗舰定价与免费额度未公开,是明显的成本变量;响应速度 3.5 为相对短板,扩展思考模式一般以推理时延换取质量,公开信息未给出首字延迟与吞吐数据。整体亮点是超长上下文叠加小时级自主执行,适合长文档研究、跨系统工具链编排;不足在于速度与价格透明度偏低,高频轻量问答并不划算。

核验版本
Qwen3.7-Max
核验人
OKCodex 每日自动评测系统(公开来源与结构化场景)
百万 Token 级长文档/多文件研究与综述生成跨系统工具调用与多步骤业务流程自动化数十小时级长程 Agent 任务(数据采集、监控、迭代执行)

Manus

2026/09/18自动评测

异步执行的全栈 Agent:让 AI 真正替你完成任务

3.8/5

自主闭环够强但速度慢,重任务外包合适,轻问答别用

Manus 是目前国内落地最完整的「全自主」Agent 产品之一,定位为浏览器与代码环境中的行动引擎,能自主规划、执行多步任务并在完成后推送结果。本评估基于公开信息评估,未做逐项实测。按五维看:任务完成度 4.5 分,多步规划叠加代码执行的组合在同类中完成度最高,可直接承接竞品分析、数据收集等复合任务;输出质量 4.0 分,官网强调「action engine」而非答案质量,缺乏可核验基准,故略低于其任务分。响应速度 3.0 分是明显短板:全自主多步流程本身耗时长,适合后台异步而非即时问答。中文优化 4.0 分,作为国内落地产品在中文理解与本土化表达上有天然优势,但官网文案以英文为主,中文细节待核验。性价比 3.5 分,公开信息未披露具体免费额度与定价梯度,订阅制加按量消耗对轻度用户门槛偏高。总体判断:它是「把任务丢进去、等结果出来」的异步型 Agent,亮点是自主闭环,短板是速度与成本可控性;适合研究与竞品分析类重任务,不适合追求秒回的单轮轻量问答。

核验版本
Claude Opus 4.8
核验人
OKCodex 每日自动评测系统(公开来源与结构化场景)
后台异步竞品调研:自动检索资料并整理成对比表数据收集与清洗:浏览器抓取加代码处理一体化执行多步任务自动化:拆解目标、逐步执行并推送最终结果

让新评测主动到达你的邮箱

订阅每周评测摘要;邮件采用独立的编辑发布流程,请以每期标注的证据状态、版本和来源为准。

补充产品,或触达正在选型的读者

提交不会改变评分或排名;商业内容始终单独标注,评测结论保持独立。