- 产品
- 产品解决方案
- 行业解决方案
- 案例
- 数据资产入表
- 赋能中心
- 伙伴
- 关于
时间:2026-07-14来源:志明浏览数:1次
近年来,不少地方都在建设政务大模型、政务智能体和智能问答平台。看演示时,AI往往能够快速生成一段内容完整、语言流畅的回答,政策解读、事项咨询、根据具体情形实时生成材料清单等功能似乎都能实现。但一个政务AI平台究竟有没有实用性,仍要放到真实办事场景中检验。
我的测试方法其实很简单,可以尝试问它三个问题:
第一个,我想开一家剧本杀店,要办哪些手续?
第二个,我是本市小学二年级的学生,怎么办理转学手续?
第三个,我想成立一家民营加油站,一共要办理多少道手续,分别如何办理?这三个问题,分别测试了政务AI的三种能力。“开一家剧本杀店”,测试的是AI能否理解群众的日常表达,并将其准确映射到政府管理中的行业分类和具体事项。群众通常不会按照政务服务事项的标准名称提问。如果知识库中只有规范事项名称,或者相关新业态没有被及时纳入,AI即使理解“剧本杀”是什么意思,也未必知道在当地开设这类经营场所究竟涉及哪些手续,更不一定能够识别其中可能涉及的市场监管、消防、文化娱乐等管理要求。“小学二年级学生怎么办理转学”,测试的是AI能否识别地区差异和具体情形。转学政策具有较强的属地性。同一个城市的不同区之间,办理时间、受理部门、申请条件和材料要求都可能存在差异。用户只说“本市”,所提供的信息其实并不充分。一个实用的AI,应进一步追问是区内转学还是跨区转学,学生户籍在哪里,现就读学校和拟转入学校分别位于哪个区,是否涉及随迁子女、户籍迁移等特殊情形。只有把关键条件问清楚,后续回答才可能更加准确。“成立一家民营加油站”,测试的是AI处理复杂事项和跨部门业务的能力。这类项目可能涉及规划、土地、建设、生态环境、安全管理、经营许可等多个环节。项目选址、土地性质、建设规模和具体经营方式不同,所需办理的手续也可能随之变化。此时,简单列出若干事项名称,实际意义有限。AI还需要识别前置条件,梳理事项之间的先后关系,区分哪些手续可以并行办理,并提示哪些内容需要结合项目实际进一步确认。这三个问题,有没有可能全部回答准确?坦率地说,从当前不少政务AI平台的公开应用和实际体验来看,能够持续、稳定地把这三个问题都回答准确的仍然很少。首先,相关知识可能根本没有进入模型或知识库。大模型具备较强的语言理解和内容生成能力,但它无法凭空获得某个地方最新的办事规则,也不会自动知道部门内部尚未公开的业务口径。如果政策文件、办事指南、业务规则和常见问题没有被系统整理并及时纳入知识库,模型再强,也很难给出可靠答案。
其次,政策存在地区差异,也会持续动态调整。同一事项在不同地区的办理条件、申请材料和办理流程未必完全相同。知识更新稍有滞后,原本正确的回答就可能已经过期。政府网站上的政策文件和办事指南也未必覆盖全部业务情形。一些例外情况可能散落在其他制度文件、业务通知或内部操作规范中,部分规则甚至是在实际办理过程中,结合多个政策文件综合判断形成的。单纯抓取公开网页和政策文本,得到的仍可能只是一个不完整的知识体系。更深一层看,很多政务业务还没有被转化为可以直接计算和推理的规则。现实中的审批判断,经常表现为“符合某项条件走流程A,不符合时转流程B”“达到某一规模后增加一个办理环节”“属于特定对象时适用另一套材料要求”。
这些条件如果没有经过系统的业务梳理、规则拆解和结构化处理,AI就容易遗漏边界条件,也很难根据不同用户的实际情况生成准确答案。生成式AI还有一个特点,就是倾向于尽可能给出回答。即使掌握的知识并不完整,它也可能把零散信息组织成一段逻辑顺畅、表达完整的内容。对于普通聊天,这种能力很有价值;但对于政务服务,一段“看起来很对”的错误答案,可能会让群众准备错误材料、跑错部门,甚至错过申报时间。这也是“AI幻觉”在政务服务场景中的一种典型表现。
所以,测试一个政务AI平台,不能只拿几道高频标准问题进行演示,我们还需要关注几个方面:它能否识别信息不足并主动追问,能否说明答案的政策来源、适用地区和有效时间,能否把政策条文转化为可以实际操作的办理步骤,能否在无法确定时提示风险并转人工服务,能否根据政策变化和用户反馈持续更新知识。实际测试时,还可以建立一套分层题库。既测试高频标准事项,也测试属地差异较大的事项;既测试单部门事项,也测试跨部门复杂场景;还可以加入政策调整、特殊对象、材料缺失、条件变化和例外情形,观察AI是否会主动追问、谨慎回答、提示人工核实,或者在缺乏可靠依据时拒绝作出确定判断。评价指标需要更关注回答的准确性、完整性、依据可靠性、情形识别能力和实际可办性。很多人主要通过新闻和宣传材料了解AI,容易觉得它似乎无所不能。真正做过政务业务的人,往往会更加关注智能背后的基础条件。一项看似简单的政务咨询,背后可能涉及法律法规的符合性审查、政策制度的适用判断、数据处理的合规要求,以及业务运行规则的约束。这些内容需要长期梳理、持续更新,也需要业务部门、政务服务部门和技术团队共同参与。从这个角度看,政务AI的能力上限,除了受模型、参数和算力等技术因素影响,也取决于事项是否标准、政策是否清晰、指南是否准确、知识是否及时更新、部门口径是否一致等业务基础。如果基础业务尚未理顺,政策知识不完整,部门规则不统一,模型输出的稳定性和可靠性也会受到影响。总结起来,AI可以提高部分工作的效率,也可以降低群众获取政务信息的成本,但它终究不是阿拉丁神灯,无法凭空补齐缺失的制度、数据和业务规则,所以一个具备实用性的政务AI应当补齐上述内容。
在线咨询
点击进入在线咨询
扫描下方二维码,添加客服
扫码添加好友,获取专业咨询服务