本次腾讯混元联合清华大学公开了主流AI搜索代理的最新测试结果,核心干货如下:
1. 当前AI搜索的核心问题不是搜索环节出错,而是用户查询存在歧义时,极少主动向用户申请澄清,单个未解决的歧义就会导致整个推理链失效,反复检索不澄清的效果还不如直接猜测。
2. 无歧义提示前提下,所有参与测试的主流大模型AI搜索准确率都不足五成,最高的豆包Seed 2.0 Pro仅为43.1%,表现较弱的模型准确率仅10%以上。仅靠大模型内置知识库根本无法完成这类带歧义的搜索任务,切断搜索权限后准确率会暴跌。
3. 先搜索再追问澄清歧义的模型成功率高达93.4%,远高于不追问直接猜测的56.5%,未来AI搜索一定会增加用户交互澄清环节,使用AI搜索时遇到模糊问题可以主动给模型补充信息提升准确率。
本次测试结果对品牌布局AI搜索流量、适配新搜索环境有重要参考价值,核心干货如下:
1. 当前AI搜索对信息清晰度要求极高,移除查询中的歧义后,各模型准确率可提升26.8至40.2个百分点,说明品牌信息的明确性直接决定AI搜索能否正确输出品牌相关结果,如果品牌产品参数、场景标注模糊,会大幅降低被AI检索推荐的概率。
2. AI搜索高度依赖外部公开搜索信息,切断搜索工具权限后头部模型准确率也会暴跌近一半,说明品牌的公开网络信息布局仍然是AI搜索时代获客的核心,不需要过度依赖大模型内置知识库的训练。
3. 未来AI搜索会新增歧义澄清交互环节,品牌需要提前适配新规则,梳理不同场景下用户对品牌产品的模糊搜索需求,标准化自身公开信息,提前抢占AI搜索的流量先机。
本次测试结果给布局AI搜索流量渠道的卖家明确了风险与机会,核心干货如下:
1. 当前AI搜索处理用户模糊查询的能力极差,单个未解决歧义就会导致整个搜索结果出错,如果卖家的产品信息标注模糊、关键词不统一、参数不明确,会大幅降低被AI搜索正确推荐的概率,这是当前布局AI搜索流量的核心风险。
2. 机会层面,现有AI搜索整体准确率不足五成,只要卖家明确标准化自身产品信息,消除信息层面的歧义,就能让产品被AI检索推荐的准确率提升20到40个百分点,远高于同行,可提前抢占AI搜索的早期流量红利。
3. 目前头部大模型厂商已经开始针对歧义处理短板做优化,未来AI搜索一定会成为新的重要流量渠道,卖家需要跟进技术变化,及时调整自身线上信息的发布规则,适配新的搜索逻辑。
本次测试结论给推进数字化和电商转型的工厂带来多方面启示,核心干货如下:
1. 线上获客层面,AI搜索已经成为新的用户流量入口,当前AI搜索对信息清晰度要求极高,工厂在发布产品信息时,需要明确标注产品参数、适用场景、版本型号等信息,避免因信息模糊导致AI检索错误,降低获客效果。
2. 数字化转型层面,AI搜索技术可帮助工厂提升供应链信息检索、市场需求调研的效率,但目前AI搜索对非标准化信息的处理能力很差,工厂内部推进信息标准化改造,能大幅提升AI工具的使用效率,充分发挥数字化工具的价值。
3. 商业机会层面,当前通用AI搜索在专业生产场景的歧义处理能力极弱,有技术能力的工厂可以探索开发适配自身生产领域的专业AI搜索工具,满足行业内模糊信息检索的需求,打造新的增长曲线。
本次测试明确了AI搜索领域的核心痛点和发展方向,给AI技术服务商指明了研发方向,核心干货如下:
1. 当前行业核心痛点:主流大模型的AI搜索在处理真实场景的歧义查询时能力极差,无歧义提示下平均端到端准确率仅28.6%,即便是头部模型准确率也不到五成,单个未解决歧义就会导致整个结果失效,用户体验极差,市场对成熟的优化方案有强烈需求。
2. 技术研发方向:仅靠提示引导模型识别歧义只能提升歧义识别率,无法有效提升最终检索准确率,未来研发的核心是建立将搜索不确定性转化为有效用户交互的机制,提升模型主动澄清歧义的能力。
3. 目前头部厂商已经探索出可行的优化方向,比如Anthropic提升不确定性标记频率、Perplexity重构搜索工作流,服务商可参考这些方向结合自身优势开发针对性解决方案,抢占市场先机。
本次测试揭露了AI搜索平台当前的核心问题,指明了平台优化运营的方向,核心干货如下:
1. 用户核心需求:真实场景中用户的搜索查询大多带有模糊、歧义甚至错误,现有AI搜索无法满足该核心需求,平台需要把歧义交互能力作为AI搜索的核心优化方向,才能提升用户满意度和留存率。
2. 风险规避:当前所有模型都高度依赖外部搜索工具,仅靠内置知识库无法完成搜索任务,切断搜索权限后头部模型准确率也会暴跌,平台要规避过度依赖内置知识库、放弃外部搜索对接的错误方向。
3. 生态与运营:当前AI搜索的歧义处理技术还不成熟,平台可以引入相关技术服务商共建生态,填补技术短板;在模型测试环节,可以采用本次推出的DiscoBench基准,该基准贴合中文网络搜索的典型特征,能更准确反映模型的真实能力,帮助平台筛选优质模型。
本次研究为AI搜索领域带来了新的研究成果与方向,核心干货如下:
1. 产业新动向:当前AI搜索代理的核心瓶颈不是检索和推理能力,而是歧义处理与用户交互能力,参与测试的所有主流模型端到端准确率最高不足五成,技术成熟度较低,还有很大的研发创新空间。
2. 研究领域新进展:此前业内常用的测试基准都假设用户查询无歧义,不符合真实搜索场景,本次推出的DiscoBench测试基准填补了该领域空白,覆盖11个知识领域,包含211项任务共463个中文歧义点,还将歧义分为四大类,更贴合中文搜索的实际特征。
3. 未来研究方向:研究发现歧义识别能力与追问质量不存在强关联,仅提升歧义识别率无法有效提升最终搜索准确率,未来需要重点研究如何让模型将识别到的不确定性转化为有效的用户澄清交互,这是该领域新的核心研究问题。
返回默认