假设一位教师已经能够用通用 Agent 生成教案、制作课件,甚至写出可以拖动参数的交互实验,他为什么还需要一个专门的教学产品?
这不是一个遥远的商业假设。在 TeachFlow 的讨论中,课程生成和实验生成仍有不少缺陷,但我们已经需要重新判断:哪些问题应该现在修,哪些应该依靠模型升级改善,哪些值得投入长期工程?看到缺陷,只能说明结果还不够好;它尚未回答最合适的投资方向。
这个问题也不限于教育。报告生成、内容创作、数据分析等产品,都面临类似的选择:自己开发的能力,可能在下一代通用工具里成为默认功能;而简单接入一个强模型,又未必足以让用户完成工作。
我的判断是,垂直产品需要同时管理两类投入:一类帮助用户今天完成任务,另一类帮助产品持续利用未来的能力进步。前者允许有使用期限,后者也必须接受效果检验。决定投入价值的,是它为具体用户减少了什么成本,而不是它属于模型、Agent、工作流还是界面。
通用化正在越过“生成一段内容”的边界。
观察这些产品,首先要区分它们所在的层面。模型、执行框架和用户工作台解决的问题不同,把它们混在一起比较“谁更智能”,容易错过真正的变化。
OpenAI 当前把 Chat、Work 和 Codex 放进同一产品体系:分别承接日常对话、多步骤成果交付和软件开发。这意味着用户可以从澄清需求走向执行任务,产品入口已经覆盖更长的工作过程。OpenAI:ChatGPT Work 与 Codex
Claude 的电脑操作能力则进入了 Cowork 和 Claude Code。官方说明,它可以通过指向、点击等操作完成任务。用户原有的软件由此成为 Agent 可以工作的环境,而不只是需要人工复制粘贴的终点。Anthropic:让 Claude 在电脑上工作
DeepSeek Harness 从开发者一侧推进复用。其开发者预览将模型、工具、Skills、会话、沙箱、调度等能力设计为插件,允许选择和替换。它提供的是执行基础设施的组合方式;预览状态也意味着接口仍会变化。DeepSeek Harness 官方说明
WorkBuddy 则把可执行脚本与工作流封装为 Skills,提供查找、创建和安装入口。腾讯在 2026 年第一季度业绩公告中称,按日活跃用户衡量,它已是中国最受欢迎的效率 AI Agent 服务。这个公司披露口径说明它获得了采用,但不足以单独解释增长原因,更不能替代任务质量的评估。WorkBuddy 技能文档、腾讯业绩公告
把这些变化放在一起,可以看到三个正在降低的门槛:生成内容、执行多步工作、让普通用户采用执行能力。编码在其中尤其重要:当任务可以转化为程序、文件操作和可检查的输出时,编码能力就可能成为处理数字工作的通用手段。这是本文对产品趋势的解释,并不意味着任意教学任务已经可以可靠自动完成。
对垂直产品的直接影响是:竞争基线需要更新。只拿自己的产品和一个空白聊天框比较,容易高估定制开发的价值。更有意义的对手,是用户实际能够获得的通用 Agent,连同它已有的文件、工具和技能能力。
相近的能力,并不会自动形成相同的产品。
AIPM-Wiki 的《WorkBuddy 与 Marvis》提供了另一个视角。该文基于 2026 年 7 月的材料,把前者分析为办公工作台,把后者分析为系统级个人助手,并围绕交付对象和权限边界展开比较。这里采用的是它提出的分析视角,不把其中标注为推测的内部架构当作事实。WorkBuddy 与 Marvis:腾讯的两条 Agent 产品线
这个对比提醒我们,用户不仅在选择能力,还在选择把哪一件工作交给谁、交到什么程度。整理一份报告、管理电脑文件、为下周课堂准备材料,可能调用相似的技术,却有不同的输入、检查方式和失败代价。
因此,通用能力扩张既可能替代某些垂直功能,也可能降低垂直产品的建设成本。一个原来做不起交互实验的小团队,可能因为通用编码能力进步而拥有这项能力。机会与压力来自同一件事:其他团队和用户本人也更容易获得它。
垂直产品的任务,是找到通用能力进入具体工作时仍然存在的困难,并证明自己的设计确实减少了这些困难。行业名称本身不会产生差异化,把通用提示词改成教学措辞也不够。
哪些工程会随着模型升级失去价值?
Anthropic 的长任务研究提供了一个具体例子:为了应对旧模型临近上下文上限时提前收尾的行为,团队曾使用上下文重置;模型升级后,他们移除了这项机制。这项观察来自特定的编码实验,但它揭示了一种值得迁移的工程习惯:持续检查旧机制所依赖的能力假设是否仍然成立。Anthropic:长任务应用开发的 harness 设计
这并不表示旧机制当初不值得建设。只要它在有效期内帮助用户完成了足够多的工作,临时工程也可能是合理投资。真正的问题,是临时补偿逐渐变成不再被质疑的固定架构。
例如,为了减少输出格式错误而增加的修复提示、为旧模型设计的任务拆分、反复尝试直到产物可解析的分支,都应当有重新评估的时点。模型升级后,团队可以尝试删除它们,检查质量是否下降、耗时是否减少。保留与删除都需要观察结果。
但这条原则不能成为推迟一切修复的理由。如果保存会丢失修改,或者预览无法展示内容,用户今天就无法完成任务。这样的可用性问题必须解决。模型未来的进步不能代替当前产品对已承诺行为的责任。

分析示意:这张矩阵用于组织投入判断,不是经过验证的行业评分标准。一个机制未来可被替代,仍可能因当前价值较高而值得建设。
对课程与实验生成,值得花力气的地方是什么?
以杠杆实验为例,交互代码能够运行只是一个条件。力、力臂和平衡关系是否一致,参数范围是否合理,单位是否清楚,学生是否知道应该改变什么、观察什么,都会影响实验能否服务于教学。
可以优先复用通用 Agent 来生成代码,同时投入可执行的领域检查:给出已知平衡条件,验证改变力臂后的趋势,检查零值和极端参数。检查本身也需要维护与验证,但它有机会在模型更换后继续发挥作用。新的生成器可以进入同一组约束,而不必连验收方法一起重建。
课程生成也类似。“生成一节分数课”包含许多尚未说清的选择:学生已理解哪些概念,教学目标是计算熟练还是意义理解,例题之间如何递进,哪些内容必须保留。值得积累的是这些任务约束及其与结果的关系,而不仅是一条越来越长的提示词。
从这个角度,我会把投入具体分到以下对象。它们是候选方向,每一项都需要用实际差距决定预算。
| 投入对象 | 希望积累的东西 | 应如何检验 |
|---|---|---|
| 教学任务表达 | 目标、前置知识、教材范围和必须保留的内容 | 是否减少教师反复解释与返工 |
| 领域检查 | 正确性约束、边界案例、可复现失败 | 是否发现模型自评遗漏的关键错误 |
| 内容控制 | 指定修改范围、对比、采用、撤销和保存 | 教师能否保留满意部分并完成连续修改 |
| 任务接入 | 已有资料与课程成果的读取和复用 | 是否减少搬运信息与重复录入 |
| 能力升级 | 可替换的模型接口、固定案例和退出条件 | 换模型后能否减少复杂度而保持效果 |
这里没有哪一项天然不可替代。通用平台也会提供上下文管理、版本记录和领域 Skills。我们的检查或流程如果不能比通用基线更有效,就没有必要仅因“自主建设”而保留。
Skill 的价值同样要看内容。一个通用的写作步骤很容易复制;包含真实失败案例、任务边界和经过检查的领域约束的技能包,可能更有用。但文件形式不会自动形成优势,优势只能来自持续使用和改进后的效果。
也要允许“直接使用通用产品”成为正确答案。
假如教师只需要偶尔制作一份讲义,已有材料足够,通用 Agent 的结果经过少量修改便能采用,单独进入一个教学平台可能增加负担。此时,给出可复用的模板或技能,甚至直接推荐既有工具,都可能比扩建产品更合适。
相反,如果任务高频发生,需要跨次保留材料、持续修改同一份内容,并有稳定的检查要求,专门的工作环境才更有机会产生价值。即便如此,也不能把这些需求存在,直接推导为某个产品已经解决了它们。
这意味着产品策略不能只统计新增能力,还要衡量采用成本。教师是否需要重新整理资料、学习一套入口、理解大量状态、纠正系统误解?这些时间都属于成本。一次模型调用更便宜,却让教师多修改半小时,未必是更好的方案。
怎样知道自己的投入仍然有效?
可以从一组真实备课与实验任务开始,保留原始材料、验收要求和难点,比较三种配置:通用 Agent 的常规使用方式;同一 Agent 加入教学上下文与素材;再加入我们的领域检查和产品流程。
这是建议的实验设计,目前不能当作 TeachFlow 已取得的对照结果。执行时需要记录模型与工具版本、时间和调用预算,对有随机性的任务重复运行;请教师尽量在不知道方案来源的条件下评价成果,同时单独记录使用流程的成本。也应保留未完成的任务,避免只计算成功样本。
结果至少要覆盖关键错误、完成率、教师修改时间、等待时间和成功交付的总成本。若领域检查让模型多运行几轮,却减少了教师纠错时间,它可能值得保留;若复杂编排与简单配置结果接近,简化就有了依据。
三种配置的比较能帮助定位价值来源,但不能一次证明每个组件的贡献。发现第三种更好后,还需要逐项移除检查或流程,观察差异。否则,团队仍然不知道真正起作用的是教材上下文、检验工具,还是额外运行预算。
模型主要版本升级、成本显著变化,或失败类型发生迁移时,都值得重做这组比较。评测不仅用来决定新增什么,也用来决定停止维护什么。
最后回到开头的问题:课程与实验生成仍有缺陷,是否应该继续投入?应该,但投入对象需要经过选择。阻断当前任务的缺陷要修;能够复用的领域知识和检查能力值得积累;仅为某代模型服务的复杂机制,应当留有退出路径。
下一代模型到来时,一个值得继续投入的垂直产品,应当能更快接住它的能力,让用户更容易完成真实工作,同时有依据地删掉已经多余的工程。产品的价值,就在这一次次可以检查的差距里。