办公室里使用AI的人正在迅速增加。
问题在于工具太多了。ChatGPT、Claude、Gemini、Copilot、Perplexity、Grok,光是名字就有六个。每个都有免费版和付费版。有的会画图,有的会写代码,有的能完整读取100页PDF。即便输入同一个问题,不同工具给出的答案也不同。
“不知道该在什么地方用什么工具”也就不足为奇了。工具选错、得到离题答案的经历一旦累积,不信任感就会增强。
本文将AI按类型划分,并整理出适合办公室业务场景的组合。
OpenAI于本月3日(当地时间)发布了GPT-6 Astra。Anthropic于本月1日推出Claude Feyble 5.1。谷歌于2日发布了Gemini 3.8 Flash。继7月21日的3.6、8月13日的3.7之后,这是6周内发布的第三个模型。5月,谷歌还发布了可24小时运行的助手“Gemini Spark”。微软365 Copilot自7月9日起默认使用GPT-5.6。
这三家公司强调的说法相同:不是回答问题的AI,而是代替人干活的AI。OpenAI表示,GPT-6 Astra可以填写在线表单、修改客户关系管理(CRM)记录并安排日程。Anthropic在Claude桌面应用“COWORK”中内置了浏览器,可将网页工作交给AI。谷歌则说明,Gemini Spark会检索Gmail、文档和电子表格,代写草稿。
工具越来越多,名称也不断变化。办公室里又回到了“到底该用什么”的问题。工具选错、得到离题答案的经历一旦积累,不信任感就会增强。
◆ 选择AI的标准变了
一年前,选择AI还分为两类:快速回答的通用模型和花时间逐步思考的推理模型。OpenAI的“o”系列曾是推理模型的代名词。
这种区分正在消失。OpenAI上月26日让o3从ChatGPT中退役。如今,ChatGPT的模型选择栏里出现了GPT-5.6 Sol、GPT-5.5 Instant、GPT-5.4 Thinking这样的名字。同一个GPT体系内,“Instant”会立刻回答,“Thinking”则会先思考再回答。Anthropic也在Claude应用中加入了“努力调节”功能,不必更换模型,只需选择思考多久。
因此,现在将AI分为三层更准确。
▲有聊天层。提问后立即回答。适用于邮件草稿、摘要、翻译、润色表达等。速度快、成本低。
▲有推理层。在同一工具中开启“思考”模式。用于合同条款比较、数字校验、寻找逻辑漏洞等不能出错的工作。较慢、成本较高。
▲有智能代理层。AI会直接打开浏览器、填写表单、移动文件。GPT-6 Astra、Claude COWORK、Gemini Spark都瞄准这一层。适合把重复性工作整套交给AI。不过,因为AI会以你的账户实际执行操作,所以最需要谨慎。
生成式AI之外也有AI。利用过去的销售额预测下个月需求、从数千笔交易中筛选异常交易、自动分类客户咨询等工作,都是预测·分类AI来完成。Excel预测表、Salesforce等CRM中的流失预测分数,都是这种AI。虽然不显眼,但它早已在办公室中使用。
◆ 各工具的强项
ChatGPT的通用性很广。写作、编程、图像生成、文件分析都可以在一个地方完成。OpenAI表示,GPT-6 Astra在计算机操作能力评估中,比前一代模型快了47%。它与Zapier、Make等自动化服务的连接范围也最广。弱点是长文档;上下文一长,就可能遗漏前文。
Claude擅长写作和长文档处理。Anthropic在发布Opus 4.8时表示,模型更能指出不确定内容,也更少提出无根据的主张。Feyble 5.1是顶级模型,因此在Pro套餐中会消耗额外积分。弱点是没有图像生成。
Gemini与Google Workspace融为一体,可以跨越Gmail、Drive、Sheets使用。3.8 Flash自发布首日就能在Google Sheets中使用,谷歌称其在金融、法律专业任务上的表现有所提升。它拥有100万token的上下文窗口,可整本读取数百页文档。Gemini Spark会获得专用电子邮件地址,24小时监看收件箱。不过,Spark目前仅向最高级别的“AI Ultra”订阅用户开放。弱点是离开谷歌生态后能力会减弱。
Microsoft 365 Copilot直接嵌入Word、Excel、PowerPoint和Outlook中。会议纪要总结、邮件草稿、Excel公式生成是它的强项。对于使用Microsoft 365的公司,无需另外打开窗口。弱点是费用高,除了Microsoft 365订阅费外,还要叠加Copilot费用。
Perplexity专注搜索,回答会附上来源。适合市场调查、竞争对手分析等需要核实事实的工作。并不适合长篇写作。
个人订阅费大致相近。ChatGPT Plus、Claude Pro、Gemini AI Pro都在每月20美元左右,折合韩元约2.9万韩元。差别不在价格,而在用途。
◆ 这样组合使用,按工作来搭配
撰写报告。先用Perplexity或Gemini Deep Research做资料调查,收集带来源的事实。把这些资料放入Claude,让它起草初稿。数字和逻辑则重新开启“思考”模式进行审查。图表和表格则由ChatGPT的文件分析功能处理得更快。
邮件。如果使用Microsoft 365,Copilot最快。它能总结收到的邮件、生成回复草稿并安排日程。如果是Google Workspace,Gemini则承担同样的角色。最终,不另外打开窗口,才最容易长期使用。
长文档审查。从数百页的合同或规章中提取条件时,Claude或Gemini更合适。两者都能把长文档读到底。这时必须开启“思考”模式;漏掉一条条款,代价可能很大。
数据分析。把Excel文件上传到ChatGPT,它能制作数据透视表并绘制图表。如果是Google Sheets,则由Gemini编写公式。像预测下个月需求这种数字预判工作,准确的并不是生成式AI,而是Excel预测表或BI工具的预测功能。预测AI负责给出数字,生成式AI再把这些数字转成报告文字,这种分工才正确。
会议。会前议题整理由ChatGPT或Claude完成。会议中录音则交给像Clova Note这样的韩语语音识别工具来区分说话人并记录。会后总结与待办事项再交回生成式AI处理。
重复性工作。每周进入同一个网站取数并整理成表、向十家客户发送同一格式邮件等任务,适合交给代理层。GPT-6 Astra Agent、Claude COWORK、Gemini Spark都是为此而来。不过,最初几次最好有人在旁监督。
◆ 组合的关键在于把工作拆开
善于使用AI的人和不会使用AI的人,差别不在于工具,而在于是否把工作拆成步骤。
如果一口气交代“帮我写报告”,无论哪种AI,结果都很单薄。第一步是“请分析上个月的销售数据”。第二步是“请把分析结果整理成三个原因”。第三步是“请根据这些内容写一份给部长汇报的两页报告”。这样分开后,结果就会不同。如果每一步都搭配合适的工具,就能更进一步。
谷歌韩国上月27日公开的Public First调查也指向同一方向。使用精细提示词的上班族,比使用基础提示词的上班族节省时间的效果高出3倍。即使使用同样的工具,提问方式也会决定结果。
代理AI还有需要特别注意的地方。AI会用你的邮箱和账户实际执行操作。一旦收到错误指令,就可能发出错误邮件。最初最好只给予读取权限,保留发送和支付仍需人工确认的环节,这样更安全。公司机密只应在公司批准的企业套餐中处理。企业套餐不会将输入数据用于训练,但免费版大多不具备这一保障。
直接把AI给出的结果照单全收也有风险。生成式AI会制造看似合理却错误的内容,事实核实仍是人的责任。由AI生成初稿、由人进行验证,这样的分工最安全。
没有万能工具。即使这个月新增了三个模型,这一原则依然不变:提问交给聊天层,审查看给推理层,重复工作交给代理层。答案在于组合。