0

一场两小时的客户拜访,双方说的话加起来上万字。但回到工位,销售能凭记忆敲进CRM的,通常不到三百字。
剩下的去哪了?跟着出租车一起走了。
这样的对话在企业里每天都在发生。会议室里的争论、客户办公室里随口的一句提醒、老师傅肚里的经验,信息密度最高的这些话,几乎都发生在电脑屏幕之外,从来没有进入过任何一套企业系统。
另一边,已经沉淀在文档、群聊和系统里的数据,也常常因为没做结构化,或者体量太大,塞不进上下文窗口,Agent根本调用不了。
9月22日云栖大会,千问办公把两件事放到了一起解决:发布了面向企业级Agent的基础设施“企业上下文”(Enterprise Context),以及Agent硬件QwenNote A2。
简单说,Enterprise Context把散落在群聊、文档、知识库和业务系统里的企业信息压缩、结构化,随业务变化持续更新,变成Agent能随时调用的知识。
难的地方在“给多少”。一家公司积累多年的资料动辄几十万条,但员工开始一项具体任务时,需要的从来不是全部,而是跟眼下这件事最相关的那一小块。
企业上下文要做的就是这件事,每次只把最相关的那一小块递过去,再用内置的专属模型把Token成本压到极低。
而QwenNote A2是一款名片大小的AI硬件,它能把线下说的的话录下来、转成文字喂给Agent去分析,推动后续任务。它补上的,是千问办公的外部上下文来源。
千问办公下的判断是,模型能力已不再是瓶颈,Agent能不能在企业里干活,取决于它有没有拿到这家公司自己的上下文。
过去一年多,模型能力一路狂飙。但一个反直觉的现象是,模型越强,企业越觉得不够用。
道理不复杂。同样一句“帮我写个方案”,问一个刚打开的对话框,得到的是泛泛而谈;但如果Agent手边有过去三个月的群聊、文档、会议记录和客户档案,回答质量能上好几个台阶。
基座模型决定Agent的“下限”,上下文工程决定它的“上限”。没有上下文的Agent,就像一个智商很高却失忆、失明的实习生,干不了任何有价值的活。
去年6月,做企业上下文的Glean完成了1.5亿美元的F轮融资,估值72亿美元;到今年,其ARR已突破3亿美元。
市场愿意给一家“整理上下文”的公司72亿美元估值,说明大家都看明白了,企业Agent缺的不是模型,是企业自己的信息。
企业Agent能拿到的上下文,一直只有线上那部分,会议室、车里、客户办公室里的对话始终缺失。QwenNote A2就是来补这一环的。
QwenNote A2由钉钉2025年推出的录音卡A1升级而来,外形和Plaud这类录音卡产品十分相似。
但两者有本质区别。QwenNote A2打通了千问办公,不单纯是一款录音卡,更是一个Agent入口。长按AI键,使用语音就能直接给千问办公派活,还能实时语音聊天,比解锁手机、打开App更快,也更自然。

QwenNote A2占了一个很独特的硬件生态位。但光占位没用,市场认不认,还得看实际表现。
作为一个Agent的外部上下文来源,要求是“耳聪目明”,不漏关键信息。A2配了6个麦克风,最远8米拾音,转写准确率98%,能自动识别120种语言、41种方言。
这套规格是冲着大会议室去的,距离一拉远、发言人数一多,普通录音设备就会失手,麦克风阵列的价值恰恰在这里。QwenNote A2还内置了4G物联网卡,免插SIM,不连手机也能独立使用。
但作为干问办公的上下文入口,光把声音录下来还不够,录到之后做了什么,才更重要。
这正是A2和录音卡产品最本质的区别,录音硬件的终点是一份转写稿,而QwenNote A2却是一个接活的Agent,话音落地,活已经有人接了。
举个身边的场景。业务负责人面完试,走出会议室,长按AI键说一句“帮我分析一下刚才那位候选人的优缺点,评估他适不适合这个岗位,并同步给HR”。
千问办公会调用刚才的面试转写内容做分析,再把候选人的评估结果推到钉钉上,给协作方发消息、约日程。
再比如开车去见客户,路上才发现没准备资料,也可以长按AI键说一句“帮我准备一份客户背景和产品方案材料,并给出行动建议”。
等你到目的地,资料和建议已经躺在千问办公里了。
市面上大部分产品交给你的只是一份逐字稿,而QwenNote A2想交给你一个办好的结果,差距就在这里。
它还有“长期记忆”,跟着千问办公的云端信息一起进化,越用越懂你的习惯和做事方式。
数据安全上,A2的转写内容只保留文字和纪要,不留原始音频,等于把录音场景里最敏感的那部分风险直接从产品设计里拿掉了。
续航上,A2能连续转写40小时,待机最长18天。
从这些特性看,A2适合三类人,
靠专业吃饭的人,律师、医生、投研分析师、咨询顾问,他们的话本身就是资产;靠协作办事的人,管理者、销售、项目负责人,说完就希望有人去办;还有一类人想把线下沟通内容直接沉淀进工作流,录完的纪要自动进到对应的AI流程里。
千问办公从诞生起就打通了钉钉、飞书、企业微信这些主流IM,国内最大规模的企业客户都在上面,群聊、文档这些业务信息天然沉淀在这里;QwenNote A2又把线下采集这一环补上了。
上下文信息是有了,然后呢?
现实要棘手得多。阿里巴巴集团副总裁、千问办公CEO陈宇森在演讲中给过一组对比,据钉钉统计,一家中大型企业内部注册的数据规模约在150PB量级,而当前最强的上下文窗口只有百万Token级,差了好几个数量级。

这就像家里有一千件东西要搬,行李箱却只能装十件。
所以问题从来不是要不要把数据喂给Agent,而是喂哪一部分、怎么喂。
怎么解这个矛盾?官方给的是三步,连接、理解、复用。
第一步是连接。企业知识散落在各个角落,AI根本够不着,所以先要把它们汇聚到一起,一个项目关联的是谁,走的哪条渠道,汇报线怎么走。
信息连上了,Agent才能看清一件事的来龙去脉、一个任务的状态。不只是文字,过去没被梳理过的图片和视频,现在也能通过多模态模型识别、归类,进入上下文。
第二步是理解,也就是结构化。光连上来还不够,数据量太大。
千问办公用大模型把企业内部知识提炼成可调用的实体,人的属性、项目的进展、流程的规则,分层梳理,上一层概括下一层。
第三步是复用。任务来了按需提取,只加载跟当前任务相关的那部分,不浪费上下文窗口,也不浪费模型的注意力。
业务变了,上下文跟着更新,Agent每次判断都基于企业最新的真实情况。
权限也长在这套体系里。上下文不是对所有人和所有Agent敞开的,它继承企业在IM里的组织、身份和权限体系,谁能看什么、哪个岗位不该看什么,边界在数据进入Agent之前就划好了。
古茗茶饮的例子很典型。这家公司上新频繁,运营标准要及时更新下发到门店,飞书文档、知识库、答疑群、培训日程里的内容被打包成一个“门店运营知识空间”,服务近万名一线员工。
配方、设备巡检、开台打烊这些内容被拆成一个个实体和关系,店长、训练员、大店长各有各的权限。店员问一句海报张贴规范,Agent不会把整套运营手册倒出来,而是只给当前任务需要的那一段。这些东西网上查不到,公司自己门儿清。连上了、归纳好了,AI才能按企业自己的规矩办事。
在这套上下文基础设施之上,人类员工和数字员工可以无缝协作。协作空间把群聊、文档、知识库里散落的信息汇到一处,人和Agent在同一个地方推进任务。
企业还可以把ERP、CRM这类业务系统接进来,Agent看得见你正做到哪一步,结果还能存回原系统。安全中心则给数据访问和操作划边界。
几个产品合在一起,构成企业级Agent的连接底座。接入的业务系统越多、沉淀的上下文越丰富、参与协作的员工和数字员工越多,平台能承载的业务就越复杂,生态价值也越大。
当Agent从单点工具变成连接数字系统、组织关系与真实世界的平台型产品,它就会产生独立AI应用不具备的网络效应。
这里正是“个人助手”和“企业级Agent”的分水岭。豆包、ChatGPT这类个人Agent服务一个人,上下文也只来自这一个人的输入。
而一家公司要的是一个能理解组织、也能被组织管理的系统,一万个各干各的个人助手,拼不出这个系统。
陈宇森说,“Agent要在企业真实场景落地,既要懂业务,也要像人一样在企业和组织内协同,且每一次任务执行要有边界、能追溯。”
AI办公一直有个争论,到底是to B还是to C?
从名字看,Al办公妥妥是to B生意,但眼下用这类产品的主要还是个人用户,企业推广用的也是toC那套,送积分、签到领额度。
反差的原因不难找,这些玩家过去没打通企业内部的上下文,企业用Agent收益不明显,自然不愿意按B端的方式买单。
海外的谷歌和微软虽然是to B打法,但更倾向于基于自家办公套件打造“闭环生态”。
千问办公选的是另一条路,所有更新都面向组织提效,聚焦企业级上下文、业务应用、协作功能和数据安全。
同时它与钉钉生态以及企业原有系统(ERP、CRM)的深度打通,这个优势是其他办公Agent短期内补不齐的。
企业Agent拼到最后,拼的是谁手里本来就有企业的组织关系和数据入口。千问办公背后站着钉钉的8亿用户、2700万企业组织,以及阿里云的500万客户。这就是它最坚固的护城河。
千问办公的这些动作最终都指向同一个目标,做成最好的企业级办公Agent平台,实现这个目标的前提是它足够懂业务、足够开放、足够高频。
企业Agent的竞赛远未到终局,模型能力的比拼已成过去,真实业务场景的落地能力才是决胜关键。
未来的企业Agent长什么样、会怎么演化,现在还没有答案。但从各家大厂已经亮出的动作看,千问办公应该是想得最深的那个。
今天看,QwenNote和Enterprise Context只是一次常规的新品发布。但很多年后回看,企业级Agent这场变革的种子,也许就是在这一天埋下的。雷峰网(公众号:雷峰网)

2026-09-04

2026-09-17

雷峰网原创文章,未经授权禁止转载。详情见转载须知。