智能体的演示很容易令人兴奋。一份材料变成文章,一段想法变成计划,几个角色同时完成不同工作。可回到自己的桌前,我还是会问:这些变化究竟帮我改善了什么?

这不是怀疑技术,而是尊重自己的时间和工作。做教育、做企业,需要考虑投入;做教练,也需要区分期待与实际发生。工具值得长期使用,应该有自己的证据,而不只是别人演示中的效果。

这个系列的最后一篇,我想把协作评估讲得具体一点。先从一件低风险的工作开始,不急着计算宏大的投资回报,也不把每一个变化都归功于AI。

一、选择结构之前,先问四个问题

手册用控制要求、任务复杂度和资源约束讨论架构选择,也强调领域条件。放到教练实践,我会整理成四个问题:这件事需要多大控制,复杂到什么程度,有多少时间与预算,以及领域里有哪些不能忽略的边界。

整理公开资料和处理客户私人记录,控制要求不同;一篇文章和跨平台内容项目,复杂度不同;偶尔使用和每天运行,成本安排也不同。

如果只有一个明确任务,先用简单结构;如果步骤能够预先确定,采用清楚流程;如果确实需要不同角度,再考虑更多协作者。不能把复杂结构当成默认升级方向。

在教练领域,保密、授权和专业责任应当影响选择。一个结构在其他业务里有效,不意味着可以直接移到客户关系中。

二、评估之前,先保留原来的做法

没有比较,就容易把新鲜感当成改善。可以选一项反复发生的工作,记录原来人工完成需要什么、通常花多少时间、哪些地方容易返工。

无需为了评估建立复杂研究。可以先保留几次类似工作的记录,但要说明任务难度和材料质量可能不同。少量观察可以帮助个人决定,不代表证明所有教练都能得到同样结果。

如果第一次使用花很久,要区分建立规则的投入和每次都需要的投入。前者可能在后续摊开,后者则需要长期承担。不能全部忽略,也不能混成一个无法解释的数字。

起点越清楚,后面越容易知道是工具改善了执行,还是自己终于把要求写明白了。

三、时间要从开始准备算到能够使用

一个工具几分钟生成初稿,并不意味着这项工作只用了几分钟。准备材料、说明要求、检查输出、修改、转换格式和处理异常,都属于完成任务的时间。

比如一篇公开文章,人工原来需要一百二十分钟;协作后准备二十分钟、生成十分钟、核查三十分钟、修订二十分钟,总共八十分钟。这只是示例,不是我的实测结果。比较的是四十分钟的变化,不是把生成十分钟说成效率提高十二倍。

还要看省下的时间有没有真正出现。如果你把它全部用于新增任务,工作量可能增加,而个人负担没有减少。这不是不能接受,但应该准确称为扩大产出,而不是自动等于节省时间。

看时间,也看质量,看成本,也看风险,把准备、返工与维护一起算进去

四、质量要在任务开始前确定

如果先看输出,再临时决定标准,人很容易接受看起来不错的部分,忽略原本重要的要求。

可以提前列出几项必须通过的标准。例如,事实可核对、没有虚构经历、边界说明完整、读者能理解、格式可使用。不同任务需要不同标准,不必用同一套评分评估所有工作。

如果文章很流畅,却出现一个不真实的客户案例,不能靠其他部分表现好把这个问题平均掉。关键风险应该单独处理,不是全部变成综合分数。

质量也包括作者声音。AI把所有表达改得很像,却丢失了你的判断条件和具体观察,可能形成一篇标准文章,却没有形成你需要的文章。

五、成本不只包括订阅费

工具费用容易看见,学习、维护和协调比较容易被忽略。一次任务需要几轮改写、几个角色、多少人工核查,都影响实际投入。

不必急着把所有时间折算成精确金额,但至少记录主要成本。若只有很低频的需求,一套复杂系统可能不值得维护;若任务长期重复,前期规范投入可能有价值,需要持续观察。

不要直接套用手册或其他人的耗费倍率。不同环境、任务和模型的成本差异很大。自己的选择,应当建立在当前使用条件和实际账单上。

预算也可以成为边界。达到某个试用时间或费用上限,就先回顾,不因为已经投入很多而无限继续。

六、风险不是等出事以后才计算

一个试验省了时间,但材料使用不符合约定,不能算作整体成功。一个流程很快,却没有人在外部发布前确认,也不能只看速度。

开始之前,列出可能的影响:错误信息、过度承诺、私人资料暴露、未经授权的动作,以及对工具的过度依赖。再说明哪些可以通过检查降低,哪些意味着任务暂时不适合这样做。

出现严重边界问题,应先暂停和处理,不必为了完成试验继续积累风险。是否继续不是看平均得分,而是看关键条件能不能满足。

最好保留人工或更简单的替代方式。工具不能用时,仍然知道怎样完成必要工作,不让技术协作变成新的单点依赖。

七、不要把自己的改善全部归因于AI

在评估教练项目价值时,我强调过,满意、学习、行为和业务结果需要区分。AI协作也一样。

文章数量增加,可能因为工具,也可能因为你安排了固定写作时间;客户更清楚服务,可能因为重新整理了范围;合作更稳定,可能因为终于明确负责人。技术参与其中,不等于独占全部贡献。

我们可以说“这次协作与这些改善同时发生”“在当前任务中减少了某类返工”,不必急着声称已经证明因果。对个人经营而言,诚实的观察已经足够帮助下一步决定。

不能确定的时候,保留不确定。专业的表达不在于每个结论都精确,而在于知道证据能支持到哪里。

什么时候该增加复杂度,什么时候该简化

试验有效以后,下一步并不一定是增加更多角色。可以先问:现有结构在哪个地方达到限制?是材料量太大,核查遗漏多,还是需要不同专业任务?只有限制具体,升级才有明确目的。

如果问题是要求不清楚,就先改要求;如果是资料混乱,就先整理资料;如果是事实没有依据,增加生成角色也不会补出真实证据。结构变化应当对应原因,而不是对应对技术的期待。

有时候需要简化。某个评价角色反复提出表达偏好,却没有减少关键错误,可以撤掉;某条自动流程频繁中断,可以先回到人工确认;某个知识库长期不维护,可以缩小到一个明确用途。

简化不等于倒退。一个较小系统,如果更可靠、更容易检查,也许更适合当前事业。尤其个人教练的工作容量有限,维护成本应当进入判断。

升级以后,原来的评估标准继续保留,再加上新结构需要观察的部分。否则,每次换工具都更换标准,很难知道变化究竟改善了什么。

也可以规定复查时间。不是永久认为这套安排最好,而是在一段实际使用后重新看。使用频率、服务范围和工具条件变化,原来合理的选择也可能需要调整。

我希望这种评估带来的是更自由的选择:能继续,也能暂停;能扩大,也能收缩。技术热情与专业谨慎不必对立。当我们能够解释为什么采用一套方式,也能够承认它什么时候不再合适,协作才真正掌握在自己手里。

先做两周小试验,再决定继续或调整,能扩大,也能简化与停止

一个两周的小试验

选择一件可以重复、材料适合使用的工作,确定终点和几项质量底线。第一周建立规则并完成一次,第二周在相近条件下再做,记录完整时间、可用程度、返工和异常。

结束时作出三种可能的决定:继续并保持现有结构;调整一个主要问题后再试;停止使用这种方式。不要预先规定结果必须是扩大,也不要把停止解释为自己不懂技术。

如果继续,把有效规则留下;如果调整,说明改的是材料、要求还是结构;如果停止,也把原因记录下来。以后条件改变,才知道是否值得重新尝试。

这一系列从整理经验开始,讨论任务选择、工作规则、分工和交付,最后落在评估。我想保留的始终是同一个立场:积极使用新的能力,同时保留人的选择与责任。

AI能够支持专业工作,但它的价值需要在真实任务中被看见。把执行交出去,把判断留下来;把工具用起来,也让结果接受核对。这样形成的协作,才有机会长期帮助一位教练,而不只是带来一阵兴奋。

主播:薛铁鏻(铁林)

ICF MCC认证教练|Coach8创始人|企业管理者|营销与投资实践者

薛铁鏻(铁林,Xue Tielin),Coach8(教练吧)创始人,拥有20余年互联网、教育、企业管理与市场营销经验。曾在水晶石数字科技及新高教集团相关企业担任高管,长期参与市场营销、销售管理、企业运营、互联网教育、团队管理与人才培养,并拥有教育项目投资和早期创业项目投资经验。

2014年创立Coach8,开始系统开展中文教练教育与在线教练社群实践;2022年获得ICF MCC认证,2024年带领Coach8获得ICF Level 3课程认证。具有国家二级心理咨询师、LUXX Profile Master级分析师及导师、乐高工作法系统引导师等专业背景。

个人网站:https://www.xuetielin.com;教练吧(Coach8):https://jl8.cn/

阅读 3