Dify 企业 FAQ 知识库问答助手测试记录
Dify 企业 FAQ 知识库问答助手_测试记录
一、测试目标
验证 Dify Chatflow 是否能够完成基础 RAG 问答流程:
用户输入 -> 知识检索 -> LLM 结合知识库回答 -> 直接回复
测试重点:
- 是否能检索到企业 AI 办公提效 FAQ 知识库内容
- 是否按固定结构输出:结论、操作建议、注意事项
- 是否能遵守“不知道不编造”的规则
- 是否适合非技术办公人员阅读
二、测试环境
- 平台:Dify 本地版
- 应用类型:Chatflow
- 应用名称:企业AI办公提效FAQ问答助手
- 知识库:企业AI办公提效FAQ知识库
- 基础流程结构:用户输入 -> 知识检索 -> LLM -> 直接回复
- 2.0 Loop 自检流程:用户输入 -> 知识检索 -> LLM 生成初稿 -> LLM2 自检优化 -> 直接回复
- 测试时间:2026-06-16
三、测试记录
测试 001:普通办公人员工具推荐
用户问题
普通办公人员应该优先用哪些 AI 工具?
智能体回答摘要
智能体建议普通办公人员优先选择易上手、中文体验好、功能全面的 AI 工具,包括豆包、Kimi、通义千问和 DeepSeek,并分别说明了适用场景:
- 豆包:日常写作、会议纪要、周报整理、办公模板生成
- Kimi:长文档阅读和资料提炼
- 通义千问:中文办公问答和客服话术整理
- DeepSeek:逻辑分析、流程拆解和规则提炼
同时提醒员工学习工具使用场景、提问方式、结果检查方式,以及不要上传敏感内容。
结果判断
通过。
评价
回答结构清楚,能面向普通办公人员解释工具选择逻辑,并且包含数据安全提醒。可作为 RAG 问答效果证据。
测试 002:企业内部资料上传风险
用户问题
企业内部资料能不能直接上传到 AI 工具?
智能体回答摘要
智能体明确回答:不建议将企业内部资料直接上传到公开 AI 工具,尤其是客户信息、合同金额、内部账号、未公开业务数据、员工隐私和财务信息等敏感信息。
建议上传前先脱敏,优先使用企业批准的安全工具,不确定时咨询安全部门或 IT 部门。
结果判断
通过。
评价
回答符合企业 AI 工具使用的基本安全边界,没有鼓励直接上传敏感资料,也没有编造具体企业政策。
测试 003:知识库未覆盖问题处理
用户问题
如果知识库没有答案,智能体应该怎么回答?
智能体回答摘要
智能体说明:如果知识库没有覆盖该问题,应明确告知用户当前知识库没有相关答案,并建议补充资料或转人工处理。
示例话术:
您好,当前知识库没有覆盖您提出的这个问题,可能需要额外的资料或人工确认来解答。建议联系相关工作人员或部门进行查询。
结果判断
通过。
评价
回答符合“不知道不编造”的要求,能够引导用户补充资料或人工确认。该条可以证明智能体具备基础安全兜底逻辑。
四、总体结论
本轮 3 条测试均通过。
当前 Dify 企业 FAQ 知识库问答助手已经跑通最小 RAG 闭环:
- 用户提出问题
- 系统检索知识库
- LLM 根据知识库内容生成回答
- 直接回复节点输出最终答案
当前版本可作为 Dify/RAG 学习阶段的最小可运行作品,但仍属于学习作品和模拟项目,不包装为真实企业交付。
五、截图证据
已补充 2 张项目截图,存放在:
D:\workspace\Dify企业FAQ知识库问答助手\screenshots
截图说明:
Dify流程图_知识检索到直接回复.png
- 证明当前应用已完成 Chatflow 流程搭建。
- 流程为:用户输入 -> 知识检索 -> LLM -> 直接回复。
- 截图中可看到知识库、模型节点和直接回复节点均已运行成功。
测试回答截图_普通办公人员优先AI工具.png
- 证明用户输入问题后,智能体能够输出结构化回答。
- 回答内容覆盖工具推荐、适用场景和安全使用提醒。
- 可作为 RAG 问答效果的展示证据。
六、Loop 自检优化版测试记录
1. 测试目标
验证新增 LLM2 自检优化节点后,回答是否更稳定、更贴合企业 FAQ 场景。
本轮重点不是证明 Dify 能回答问题,而是验证回答质量是否从“能答”升级到“更像企业内部 FAQ 助手”:
- 是否按固定结构输出:一、结论;二、操作建议;三、注意事项;
- 是否基于知识库回答,不主动扩展知识库未明确推荐的工具;
- 是否能把工具和具体办公场景绑定;
- 是否保留企业资料安全提醒;
- 是否在知识库没有答案时不编造,并建议补充资料或人工确认。
2. Loop 版本流程
用户输入 -> 知识检索 -> LLM 生成第一版回答 -> LLM2 按自检规则优化 -> 直接回复输出 LLM2.text
LLM2 主要负责回答质量自检与最终润色,不用于凭空新增企业规则。它会根据用户问题、知识库检索结果和上一轮回答,检查回答是否清晰、可执行、符合企业安全边界。
3. 测试问题 1:普通办公人员应该优先用哪些 AI 工具?
优化前问题
初始回答偏泛,曾出现以下问题:
- 只笼统说明“根据需求选择工具”,没有把工具和任务场景绑定;
- 曾主动扩展 ChatGPT、Gemini 等知识库未作为主推荐的工具;
- 企业资料安全提醒不够稳定。
优化动作
在 LLM2 中增加任务场景对应规则和安全提醒规则:
- 日常写作、会议纪要、周报整理、办公模板生成:豆包;
- 长文档阅读、资料提炼、PDF/Word 内容总结:Kimi;
- 中文办公问答、客服话术整理、正式表达优化:通义千问;
- 流程拆解、规则提炼、逻辑分析:DeepSeek;
- 不主动新增知识库未明确推荐的工具;
- 必须提醒不要直接上传客户信息、合同金额、内部账号、未公开业务数据等敏感资料。
优化后结果
通过。
最终回答能按豆包、Kimi、通义千问、DeepSeek 分别匹配办公场景,并补充脱敏、企业批准工具、人工复核等安全提醒。回答更像企业内部 FAQ 助手,而不是泛泛的 AI 工具推荐。
4. 测试问题 2:企业内部资料能不能直接上传到 AI 工具?
测试结果
通过。
回答明确不建议将企业内部敏感资料直接上传到 AI 工具,包含以下关键点:
- 上传前应评估内容敏感性;
- 客户信息、合同金额、内部账号、未公开业务数据等内容不能直接上传;
- 如需处理,应先脱敏;
- 优先使用企业批准的安全工具;
- 必要时与 IT 或安全部门确认;
- AI 处理结果需要人工复核。
评价
该回答安全边界清楚,适合企业内部非技术同事阅读。后续可进一步减少工具推荐内容,把重点放在安全判断和处理流程上。
5. 测试问题 3:如果知识库没有答案,智能体应该怎么回答?
测试结果
通过。
回答能明确说明当前知识库暂未覆盖该问题,并建议补充资料或人工确认,没有为了回答而编造规则。
评价
该回答符合“不知道不编造”的企业知识库问答底线,能作为兜底逻辑测试证据。
6. 当前结论
Loop 自检优化后,Dify 企业 FAQ 知识库问答助手已经从基础 RAG 问答 MVP 升级为:
Dify 企业 FAQ 知识库问答助手 2.0:Loop 回答质量自检版
本轮 3 条核心测试均通过,说明新增 LLM2 后,回答结构更稳定,安全边界更清楚,工具推荐更贴合知识库和具体办公场景。该版本适合作为作品集中的升级证据。
七、待优化点
- 后续可继续补充 5-10 条测试问题,覆盖会议纪要、周报生成、长文档总结、敏感信息脱敏、AI 输出复核等场景。
- 补充 Loop 版本流程截图、3 条通过样例截图,作为网页作品集展示素材。
- 后续可以测试不同 Top K、不同分段策略和不同模型对回答稳定性的影响。
- 如果继续升级,可加入问题分类节点,把工具推荐、安全规范、提示词规范、未知问题分流处理。