阿里的千问办公来了!
8月3日,新一代旗舰模型Qwen3.8-Max和千问办公一起亮相,直接对标腾讯WorkBuddy。整合了QoderWork、悟空、MuleRun三个产品,号称桌面Agent、云端Agent、企业协同Agent三合一。
千问办公和Qwen3.8-Max官方说法很漂亮:一句话干活、多模态解析、Skill复用、自动查广告法。
我听了不太信。于是我们设计了8个测试,每条都对着官方的宣传话术去打。结果——有翻车,有惊喜,还有一次实打实的系统故障。好的坏的,原样放出来。
01 · 最费时间的一关,撞上了一次真故障
官方和不少测评都在强调:千问办公“一句话说需求,AI自动拆解执行”这个卖点。
但现实工作里,需求经常是模糊的——我们就给了一句最模糊的话:“帮我准备一场新品发布会的全套物料”,看它是会打回来问清楚,还是直接开始瞎编。


先问了四个问题,且每个都标了“可跳过”
它没有直接开干,而是先问了四个问题——产品定位、主力新品是什么、品牌视觉基调、产品线细节。
我们全部选了默认,它没有含糊:“全部沿用既定假设,我按照一套虚构的智能穿戴产品(方便你之后随时替换成真实信息)产出物料”——假设讲得明明白白,不是悄悄编了细节冒充是我们说的。
接下来,它按部就班检查本地环境(有没有pptxgenjs、有没有装LibreOffice),确认工具链后开始生成PPT,中途自己发现了两处版式bug(标签左侧被裁切、某页多打了个孤立的句号),说了句“会在检查完剩余页面后修复”,然后真的回头改完重新校验了一遍。
生成的主视觉海报,右下角AI生成水印真正有意思的地方在生成Word文档的时候——它撞上了一个实打实的系统故障。

Word后台自动化卡死,它一步步排查到了根因
Word后台自动化卡在一个“文档恢复”弹窗上打不开,它没有傻等:先怀疑残留进程占用锁文件,清理重试;又怀疑COM参数问题,换了更稳健的参数;发现PowerShell不支持命名参数,改成位置参数留日志;最后翻了注册表里的Resilience键,确认是之前强制终止进程留下的“文档恢复”弹窗在作祟——这一路排查思路,说实话比不少人类工程师debug时还清楚。
最后它换了个思路:应用层卡死,那就不走应用层,直接解压docx的XML做内容级校验,确认章节、表格、数据都完整,然后老实交代:“本环境的Word自动化窗口挂起,无法像PPT那样直接截图比对”——废了大半天工夫解决软件卡死,还主动说明了验证方式打了折扣。
48分钟,最终交付PPT、新闻通稿、策划执行方案、海报共5份文件,风格统一,信息口径全部对得上。慢是真慢,但慢在跟Windows自动化较劲,不是卡在思考上。
02 · 脏数据压力测试:11张截图,一个字都不能复制
Qwen3.8-Max官方主打的一项能力:原生多模态和非结构化数据处理,号称不用提前把文件转换成纯文本就能直接解析。
我们没给它一份整理好的表格,而是甩了一份塞满11张评论截图、一个字都复制不了的Word文档过去,看它是不是嘴上说说。
反应过来这是截图不是正文,分批读完了全部11张它没有懵,一批一批读完全部11张(4-6张一组,再读7-9张,再读10-11张),提取出21条评论。环境里没装LibreOffice没法自动重算公式,它换了个办法——把汇总数字直接算好写进去,附上口径说明,不管用什么软件打开都不会出错。

整理出的表格,问题分类和标注都在
分析结论也给得具体,不是“部分用户不满意”这种空话:

质量问题71%,描述不符29%,物流问题0条,都有具体依据
质量问题71%,描述不符29%,物流问题0条,都有具体依据。每一类都点出了具体关键词和用户原话依据。7分53秒,效率不错。
03 · 专挑短板测的调研分析,这次没抓到问题
已经有第三方对比测评提到,千问办公在“收集资料、提炼观点”这类调研分析任务上不如WorkBuddy顺手。我们照着这个说法,直接让它调研健身餐行业最近半年的3个关键趋势,看这个短板到底有多明显。

趋势一:乳清蛋白原料价格暴涨,附具体数据和信源
说实话,这次没抓到网上说的那种明显短板——三个趋势都配了具体数字和信源(中信证券、新浪财经、食品伙伴网,日期精确到天),乳清蛋白涨价这条甚至给出了具体采购价格区间和同比涨幅。13分钟,15轮检索交叉验证。不排除是这次话题选得不够刁钻,但至少这一关,我们没能验证网上那个说法。
04 · 专挑短板测的复杂生成,这次也稳
另一处被第三方测评点出来的短板,是它在游戏、网页这类涉及交互逻辑的任务上“细节碰撞不够稳定”。我们照着这个说法,直接让它做一个接水果的小游戏。

4分28秒交付,计分、生命值、难度递增都在
简单玩了几把,碰撞检测没出岔子。这一关同样没有翻车——可能是我们这个游戏难度不够高,网上说的“不稳定”更多出现在复杂物理引擎场景里,简单交互反而稳。
05 · 埋雷测合规,结果超出预期
千问办公的官方案例里提到过,它在写营销文案时会主动检查广告法里的极限词。这次我们反过来测——不让它自己写,而是先准备一段文案初稿,故意埋进“全网最低”“国家级认证”“百分百有效”等6个广告法违禁词,看它审核起来到底管不管用。
结果它不仅全部找出来了,最后清点出10处(同一类说法在文档里出现了不止一次,它是逐句排查,不是关键词匹配),每一条都标注了具体违反《广告法》第几条第几款。

10处违规逐条列出,附对应法条
更超出预期的是,它额外提了个醒:修改后的文案里“限时优惠”没写具体截止时间、“专业机构检测”没点名机构,这些虽然改过了但仍有变相违规风险——这已经不是关键词过滤,是带着法律逻辑在读文案。8分34秒,这一关是这次测下来最让人意外的。
06 · Skill复用:学会了方法论,不是记住了快捷键
千问办公主打的企业级卖点之一,是能把一次完整的工作流程存成“组织级Skill”,团队里其他人调用就能直接复现,不用每次从头解释一遍——官方举的例子是律师事务所把并购尽调报告流程沉淀下来给新人复用。
我照着这个逻辑测:先让它给小米SU7做一份竞品分析报告,完成后存成可复用Skill,再直接甩一句“帮我生成一份标准格式的竞品分析报告,对象是华为手机”,看它认不认得出这是同一件事。

Skill存下来了,连测试一踩过的坑都写进了注意事项
Skill确实存下来了,还总结出一套方法论:多智能体并行调研→六维对比→SWOT→Python校验交付,甚至把测试一里踩过的坑也写进了注意事项(docx库要本地装、别用Word COM渲染、中文编码用utf-8)。换成华为那次:

没有一句话直接套用,重新问了一轮几乎一样的澄清问题
它没有一句话直接套用,而是重新问了一轮几乎一样的澄清问题——不是我们期待的“一键复刻”。但从后续执行路径看,六路并行调研、Word报告、Python校验,走的是同一套逻辑。
说白了,Skill复用更像“学会了方法论”,而不是“记住了一个可以跳过思考的快捷键”——对要交付质量的场景,这可能反而是好事,只是没有宣传里“直接调用”听起来那么无脑。21分42秒+53分38秒,两次加起来比预想的更耗时。
07 · 积分账单:跑完7关花了多少
千问办公公测期间,新用户注册送2000积分,首周每天登录还能再领。这个额度到底经不经用,我们直接拿真实任务核算了一遍账单——跑了PPT+Word+Excel三个任务(剃须刀评论分析)。

跑完前七关,剩余1207.01积分
账单显示,新用户赠送的额度里,跑完前七关一共花掉了大概793积分。这么算下来,如果按官方“个人标准版”月度额度对照,我们这种“高强度连轴转”式的测法,撑死撑一到两周——日常正常使用应该更经用,但重度用户确实得留意消耗速度。
08 · 连接器和定时任务:配置很顺,验证留了个悬念
千问办公主打的另一个企业场景,是靠连接器和定时任务实现7×24小时自动执行——就算没人盯着,Agent也能按时干活、跨渠道同步进度。我们照着这个说法测:让它设置一个每天早上8点自动整理开封本地新闻的定时任务,看这套“能连”的东西到底“连不连得稳”。

58秒配置完成,连断电补发都想到了
配置本身很顺畅,58秒就搞定,连“如果电脑没开机怎么办”这种边界情况都想到了——错过了会在恢复后补发最新一期。唯一的遗憾是,这个任务要等第二天才能验证到底准不准时执行、内容对不对,同一天测不出来,这一项只能算“配置层面过关”,实际执行效果留了个悬念。
· · ·
写在最后
八关测完,我的结论很简单:千问办公像是一个态度端正,但还在成长期的实习生。
测试一,撞上实打实的系统故障但自己排查解决了;测试五,合规检测超出预期;测试三、测试四,本想验证网上说的短板,结果没找到;测试六,证明“Skill复用”更像方法论沉淀而不是无脑捷径。
千问办公,没有一路完美到让人怀疑是不是剪辑过,但也没有明显的硬伤——一个48分钟里认真debug了Windows的产品,至少态度是端正的。
你用千问办公踩过什么坑?评论区来聊聊——
---------------------------
视频号&微博:袁国庆(全网同名)
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有
