Skip to content

大模型体验记录 ​

一、背景 ​

最早接触大模型编程是在 2022 年,使用的是当时的 Copilot 插件。功能比较基础,可以生成简单函数,但整体提效有限,模型能力也尚未成熟,用了两三个月后便暂停了使用。

2023 至 2024 年间,随着 GPT 和 DeepSeek 等模型能力的明显提升,大模型开始具备实际生产价值。尤其是去年底突然爆发了,所以我在今年年初又重新开始花大精力投入其中捣鼓了。下文便是记录了这一阶段的工具选择、使用感受以及目前形成的使用方案。

二、IDE 与插件的使用体验 ​

工具体验
Cline最早尝试的是 Cline 插件,接入公司内部模型使用。整体体验一般,使用频率不高,属于偶尔辅助的工具,后面直接不用了。
TraeTrae 免费后进行了试用,体验尚可,后面开了一个月的会员,主要用于业务代码的处理,与手动编码交替进行,感觉 Trae 的 Gemini 模型在某些推理、深入分析等方面比其他模型好一些。不过后续由于主力到了 Codex 上,Trae 没有明显的优势,所以也就不再使用了。
OpenCode 与 Claude当时看到 Agent 团队协同工作,所以便开始研究这个。由于 OpenCode 的配置过程相对简单,便选择 OpenCode 进行配置实验。Claude 官方工具配置感觉比较麻烦,因此未深入使用。虽然后来安装了 Claude,但用起来不习惯它的界面,有时候还会卡着不动,体验很不好,所以也就不再使用了。
Cursor因为公司可以报销,所以就开通了 Cursor 会员。不过由于我是使用小酷办公网,当时没有申请国际化办公的线路,所以使用时需要再切换到自己的 VPN 开启 TUN 模式,请求过程不够稳定,在 Cursor 中反应也是很慢的样子(也可能是当时我自己的 VPN 不稳定,后面有了国际化办公权限后也没有继续尝试了),同时个人对 VSCode 风格的交互界面偏好度不高,因此未作为主力工具。
Codex最初我是对其失望的,因为我误以为 Codex 可以接入任意模型,我当时是有除编程外其他需求的。不过正好当时 GPT 给的额度多,开发起来很爽,所以后续就摆正了自己的看法,只把它当做开发软件挺好的,毕竟它就是为了开发。同时由于其性价比还是挺高的,配合一些 SKill 体验很好,所以目前 Codex 是编程场景下的主要工具。
CopilotCopilot 其实是我最开始接触的编程插件,但是由于其一直反响平平,所以就没关注过。后面看到公司群里说了这个就又去体验了下。虽说其有很大的短板,上下文窗口只有 128K,但是它是目前唯一一个能够省心省钱用 Claude 模型的方案,所以开了个入门套餐,在 Opencode 中搭配 OMO 使用,只使用它的 Claude 模型。注意:这个模型在 Opencode 中搭配 OMO + GSD 一起使用的话,仅理解问题就能爆窗口,所以要自己衡量下 Opencode 的配置。

个人总结:

如果只有编程工作,单吊 Codex 就够用了;如果有其他要求(如多 Agent 协作),可以再开一个 Copilot 搭配 Opencode + OMO 使用。

三、模型订阅与成本 ​

在整个尝试过程中,订阅了多个服务:

  • Cursor 会员(公司报销,流程太多,就买了一次)
  • 两个中转站服务(中转站 A 充值 100 元,中转站 B 站购买 12 元套餐)
  • GPT Plus 会员(用于 Codex)
  • Google One 会员(因地区问题未能正常使用,拉跨)
  • 联通活动渠道的 GLM-5(虽然便宜,但是这种套餐存在敏感词检测,后用于 OpenClaw)
  • Trae 会员(用于 Gemini)

试用的 GPT Plus 到期后,曾在闲鱼购买 Team 账号,但 GPT 额度有所减少,因此到期后重新开通了 Plus。本次 Plus 通过土耳其区苹果账号订阅,费用约为 80 元人民币 / 月,比官方渠道的约 140 元低 60 元左右。有需要可参考以下信息:

后续模型方案 ​

后续计划将模型来源精简为以下组合:

  • GitHub Copilot(Claude 模型)
  • Codex(GPT-4 模型)
  • 公司模型(GLM-5)

成本估算:

  • Copilot 土耳其区订阅:约 50 元 / 月(10 美元)
  • Codex 土耳其区订阅:约 80 元 / 月
  • 合计约 130 元 / 月

0413 更新:codex 的 plus 被砍了,可能后面会切 100 档的 PRO 吧。

四、Codex 使用感受 ​

1 计划模式的重要性 ​

Codex 的计划模式很重要。开始自己完全手动输入,模型虽然能理解,但是没有自己的思考;切换到计划模式后,它能够帮你提示很多你想不到的点,当然这个时候消耗的 token 也会增多。

2 SKILL 和 MCP 配置 ​

开发 skill:Superpowers 套组(最近在试 GSD)+ 其他一些乱七八糟的。

主要 MCP:serena(分析项目)+ confluence-mcp(读取文档)。

3 模型体验 ​

首先就是模型很强大,但是很考验使用者的规划能力,你需要明确或者说至少是有自己大概的思路,才能很好地完成一个项目。比如让 ai 写小说,只发命令肯定不行,ai 写个十来章就开始跑偏了,啥都不是。那么可行的解决方案就是你给它设计一套工作流,加上 “方向盘” 才能跑的更稳更快。

其次,你要有一定的先验知识。比如设计一个系统,AI 只会完成功能,即使安装了许多 skill(ui-ux-pro-max/web-design)和 MCP(如 pencil),项目的前端交互和 ui 依然很难一次定型。相比于自然语言,大模型明显更容易理解 hover、flex 布局、fixed 等这些专业化的名词,另外你还需要一定的美学能力,比如我自己虽然是做前端的,但也断断续续花了一周时间去调整这个项目的交互(当然这里也有因为不想要某些功能、新增功能进而调整的)。

最后,感觉 Codex 在代码实现上没有那么灵活。在我的项目中我期望后端把一些内容给第三方模型,然后把第三方模型的结果返回给前端,Codex 就想着需要对返回的数据进行 Json 格式的审查,导致开发卡在这里就一直重试。后来看了下它的思考发现是卡在返回格式的问题上,和它明确表示不需要用严格形式后,这个流程才走通。因此感觉 codex 没有那么灵通,在尝试多次无效后还继续往前走,非要一条道走到黑。如果模型能辩证地去看用户问题,比如是不是用户某个操作有问题,是否能用其他方法来绕过具体问题会更人性化和强大。

4 界面设计疑问 ​

Codex 将 “线程”(即对话记录)置于首页主要位置,但该功能仅用于查看历史对话,无法删除只能归档,我就觉得有点困惑,感觉其重要性与页面层级设置之间存在不匹配。

其他后续有空再记录...