我用 $0.3 的白菜价,雇了个干掉 50% 脏活的 “数字同事” - MiniMax M2.7

MiniMax M2.7。

文章集更新 · 2026-03-224 min read
大家好!我是瓜哥。前互联网技术副总裁,现在带队死磕 AI 编程。

用了几天 MiniMax M2.7,我发现它确实卷。

最震撼的不是跑分,而是它开始 “写代码优化自己” 了。

昨天我试着让它重构一个旧项目,效果立竿见影。

这不再是个简单的补全工具。

它更像是一个能干掉 50% 研发活儿的 “数字同事”。

01 / 别卷跑分了,看它自己找活干

AI 竞争已经进入了 2.0 阶段。

以前大家都在卷模型规模,卷参数量。现在,领跑者们开始卷 - 自优化执行能力。

MiniMax M2.7 的发布,释放了一个强烈的信号:未来的模型不需要人类去调参,它会自己寻找最优解。

这不仅仅是功能的更新,更是大模型进化方式的转变。

我们正在从 “手工模型时代” 跨入 “自进化时代”。

02 / 报错自己修,这进化速度绝了

为什么 M2.7 能在无需人工干预下提升 30% 的内部评测性能?

答案就在它的“研究型 Agent 框架”里。

在 M2.7 的研发过程中,模型自主承担了 30%-50% 的研发工作流。

它会自己读文献,配置实验,甚至修复自己的代码。

这是一个完整的、递归的自我改进闭环。

模型会经历超过 100 轮这样的循环。

每次失败,它都会根据日志自主纠错。

这种 “大幅降低人类参与” 的进化速度,非常可怕。

03 / 扔 200 页财报,直出全套 PPT

很多人关注 M2.7 的跑分,但我想聊聊它的交付感。

在硬核的 SWE-bench Pro 测试中,它拿到了 56.22% 的高分。

这个成绩意味着,它能处理真实、复杂的项目 Bug。不像有些模型只会在对话框里写片段代码,它还会预读整个代码库,理清依赖关系。

看看官方放出的实战案例:扔给它复杂的台积电年报,它能自己构建营收预测模型,连 Excel 透视表、Word 报告和汇报 PPT 都一波带走。

更可怕的是它的排障能力。线上系统一告警,它居然能自己连数据库排查原因,发现漏了索引文件后,自动采用 “非阻塞建索引” 的方式把 Bug 给修了,将故障恢复时间直接缩短到 3 分钟以内。

这种任务闭环的能力,正是它性价比的核心体现。

04 / 只要 1 成价格,纯纯降维打击

在目前的旗舰模型市场,M2.7 的定价极具杀伤力。

每百万 Token$0.3 的输入价格,只有 Claude 同级别模型(如 Sonnet 4.6)的 10% 左右。

为什么价格这么关键?

因为 “自我进化” 需要高频的递归调用。

如果 Token 太贵,这种进化成本根本承受不起。

MiniMax 把价格打下来,实际上是给了 Agent 更多的 “思考额度”。

比起 Gemini 3 Flash 的极致低价,M2.7 更侧重于重推理的性价比。比起 Claude 4.6 的极致精度,M2.7 更侧重于工程自动化的普及。

05 / 醒醒,AI 早不是聊天工具了

如果你还在把 AI 当成简单的聊天机器人,你已经落后了。

M2.7 的出现告诉我们:AI 正在从辅助变成执行。

未来的竞争不再是看谁的提示词写得好。

而是看谁能构建出更高效的 “自优化执行流”。

模型自己卷自己,只是进化的开始。

我们要做的,是开始把繁琐的研发、分析任务交给这些 “数字同事”。

哪怕从一个简单的自动化脚本开始。

因为当进化的齿轮开始转动,谁也无法阻挡。

06 / 写在最后

当然,M2.7 现在还不完美,遇到比较复杂的问题,它依旧搞不定,更不可能明天就干掉你身边的资深架构师。

但真正值得注意的地方,是打通了 “跑测试 ➡️ 看报错 ➡️ 改代码 ➡️ 再跑一次” 的闭环。

之前我们用 AI,就像在使用一台极度聪明的 “超级打字机”,你的 Prompt 稍微给偏一点,它就胡说八道;而现在,它开始像一个坐在你旁边的实习生,你给个大概方向,它能自己摸索着把活儿干完。

这种底层逻辑的转变,比跑分榜上的数字重要一万倍。

还没用过的小伙伴,瓜哥建议别着急先花钱,因为每个人用 Agent 来跑的任务不同,对大模型的期待也不同,所以我更建议你先在 opencode 里免费体验下,觉得好你再考虑付费。

评论区

暂无公开评论

还没有公开评论。

提交反馈

图文我用 $0.3 的白菜价,雇了个干掉 50% 脏活的 “数字同事” - MiniMax M2.7

反馈类型

请等待管理员审核,通过后将显示在评论区。

0 / 500