同一个问题问了8个AI,给我整崩溃了

同一个问题问了8个AI,给我整崩溃了
2026年04月30日 15:30 向小田

前几天有个刚上六年级的小孩拿来一道奥数题问我,说她解了半天没解出来,让我看看。我自己虽然也学过奥数,思考一番,竟然也卡住了。

震惊之余我把题目丢给了AI,心想我解不出来难道AI还不会吗?看着AI推理的过程(跟往常不同,推理耗时还挺久),原本满心指望AI能迅速给出解题思路和答案的我,突然发现,AI的推理越来越懵,有的甚至开始胡说了。

没办法,我又找来其他几个AI,问了同样的问题,他们竟然分别给出了不一样的答案!有的答案一眼看上去都是错的。这下,不仅AI崩溃了,我也给整不会了。

我把这个例子发给朋友吐槽,结果没想到他们纷纷跟我说,类似的情况他们也碰到不止一次了。别说同一个问题问8个AI,给出8个不同答案了,就是同一个问题问同一个AI,不同的时候问竟然答案也不一致。

最近演员刘美含也有个切身体会,说去配音时有句台词是“铸币坊”,她自己认为是铸币fǎng(三声),当时有点不敢确定,先后用百度AI、DeepSeek,元宝、豆包以及通义千问等工具搜索,其中百度AI给出的答案是铸币fáng(二声),DS和元宝则显示为fāng(一声),而她与录音老师分别用豆包查询,竟然得到了不同的读音结果。

随后她又询问通义千问,得到的依然是fāng(一声)。最终,还是经纪人通过《新华词典》,才确定了铸币坊中的坊正确读音为fáng(二声)。

这就不得不让人怀疑AI到底靠不靠谱了。如果答案能够随机,那么那些依赖AI来做决策的人,岂不是要出大麻烦吗?

我们用AI是为了找到准确答案,节省时间,如果AI凭空制造出很多无用甚至矛盾的信息,那再多的AI也没办法提高效率啊。

我思考了下,为什么很多时候AI给的答案不一样,有三点毛病。

第一就是网上信息内容一把抓,什么乱七八糟的内容都吸收进来了。比如说有时候我用来查找一些股票分析,结果它引用的很多都是所谓“小作文”。捕风捉影的内容都拿来了。

第二就是它自己不筛选信息,前面说了,小作文和官方信息,它给的比重是一样的。权威信息和路边八卦,它放到一个地方。

第三就是给了答案后,不检查也不核对,“随口一说”的情况很常见。据说有人利用AI的这个特点,专门给网上内容“投毒”,污染数据来源,从而达到影响AI输出结果的目的。现在这种情况在投资界已经比较常见了,可以想象污染还会逐渐蔓延。

果壳网有一篇文章,叫《左手幻觉,右手投毒,普通人凭什么相信AI?》,我觉得写出了我和很多人的焦虑。这篇文章做了个实验,针对8家主流AI,2000道测试题的双盲测试显示,接入百度百科作为参考信源后,AI综合准确度平均提升38%以上,关键事实偏离率从26.4%下降到了4.1%以内,专家认可度高达91.5%。

这就说明,如果基础信源靠谱,AI的准确度就会大幅提升。现在很多AI在信源上的工作还不够,还没有机制来筛选来源。这方面百度AI做了一点工作,架构上在API上加了两个Agent:一个对不同观点和信息进行筛选总结,一个对用户需求进行颗粒度拆解。这种架构不是完全通过训练数据直出,可信度就大为提高了。

百度在架构上做了创新,在AI治理上也下了些功夫——它加了三道过滤:对来源做准入,可信度高的信源才能进入候选池子;交叉信源验证,对不同的结果要多个维度来论证;实时巡检,内部自动巡检系统实时监测,一旦内容有问题马上介入。这个治理跟纸媒时代权威新闻媒体的要求很类似。做到这一点,我们对AI输出的结果就不会那么多质疑了。

AI本该是我们的工具,而不是制造混乱的麻烦制造者。在多数AI的架构和治理尚未完善的当下,我们一是要慎重选择AI工具,二是不能盲目迷信AI答案。我也真心期待,未来的AI能少一点敷衍,多一点真诚,用靠谱的内容打底,懂得自我核对,对自己说出的每一个答案负责。

财经自媒体联盟更多自媒体作者

新浪首页 语音播报 相关新闻 返回顶部