# 数字员工全链路串通与缺口分析报告 > 日期:2026-07-01 > 范围:生产工作流、任务执行、多轮对话、50种过程变化、语义意图、质量评分、连续追问、节点进化、话术进化、销冠语料学习、关键词/敏感词/替换词/语义关键词、行业角色测试、UDD 性能优化。 ## 一、本轮 UDD 性能优化结果 ### 已完成优化 1. **语义拆解缓存** - 位置:[UniversalDeepDialogueService.java](file:///d:/ylrz_saas_new/java/fs-service/src/main/java/com/fs/company/service/workflow/deepdialogue/UniversalDeepDialogueService.java) - 增加 `decompositionCache`,同公司、行业、意图、消息、最近上下文相同的场景复用语义拆解结果。 - TTL:10分钟;最大容量:2048。 2. **压缩 UDD Prompt** - 将原来大段“时间意图、画像维度、重复提问、情感、意图、画像标签”的说明压缩成短字段说明。 - 限制 `recentHistory / memoryContext / knowledgeContext / corpusHint` 长度,降低输入 Token。 3. **减少额外串行 LLM 调用** - `topicProfileCollectionPlanner` 默认关闭:`lobster.udd.topic-plan-enabled=false`。 - 销冠语料提示默认关闭:`lobster.udd.corpus-hint-enabled=false`。 - 画像标签未命中时不再追加独立 LLM 提取。 - 隐性信号只有完全为空时才触发增强。 4. **会话节奏规则快路径** - 位置:[LobsterSessionEngagementService.java](file:///d:/ylrz_saas_new/java/fs-service/src/main/java/com/fs/company/service/workflow/engagement/LobsterSessionEngagementService.java) - 新增忙碌/稍后/拒绝类正则快路径。 - 默认关闭入站节奏 LLM:`lobster.session.inbound-llm-enabled=false`。 - “我现在在开会,晚点再聊”这类消息直接返回,不再进入 LLM。 ### 复测结果 | 场景 | 优化前 | 优化后 | 说明 | |---|---:|---:|---| | 普通 UDD 首次 | 常见 90–180 秒 | 约 39.9 秒 | Prompt 缩短 + 关闭额外串行 LLM 后明显下降 | | 同问题重复请求 | 常见 60–180 秒 | 约 21.1 秒 | 命中语义拆解缓存,但仍有后续组装/渲染耗时 | | 忙碌/稍后类 | 常见 60–180 秒 | 约 11ms | 规则快路径直接返回 | 结论:UDD 已明显变快,但普通复杂消息仍未达到理想的 1–5 秒,瓶颈仍在至少一次 LLM 语义拆解/生成链路。 ## 二、全链路是否“完美串通” 结论:**已基本串通,但还不能说完美。** | 模块 | 当前状态 | 是否串通 | 主要问题 | |---|---|---|---| | 生产工作流 | 健康检查通过,节点能力识别正常 | 是 | 需要更多真实任务压测 | | 工作流任务执行 | 节点执行链路可用 | 是 | 主动节点、响应节点策略还需按租户策略细分 | | 多轮对话 | UDD 能跑通 | 基本串通 | LLM 延迟仍偏高,连续多轮容易累积等待 | | 50种过程变化 | 延期、提前、忙碌、拒绝等可识别 | 部分串通 | 明确场景可规则化,隐式变化仍依赖 LLM | | 语义意图识别 | 84/84 通过 | 是 | 行业深层表达还需继续扩词表 | | 质量评分 | 双策略可用 | 是 | 能拦机械,但不能完全保证“会聊天” | | 连续追问 | 机制存在 | 部分串通 | 容易追问太多/太模板,需要节奏控制 | | 节点进化 | 指标接口通过 | 是 | 需要真实会话长期闭环验证 | | 话术进化 | 机制存在 | 基本串通 | 缺少 A/B 效果回收和自动淘汰弱话术 | | 销冠语料学习进化 | 导入/分析/写库链路存在 | 基本串通 | 实时召回默认关闭以提速,需异步/缓存化再启用 | | 关键词命中 | 关键词链路正常 | 是 | 词表维护成本高 | | 敏感词 | 修复后 130/130 通过 | 是 | 生产链路 LLM 确认仍可能慢,需超时降级 | | 替换词 | 服务链路存在 | 未完整复测 | 验证脚本缺 JDBC 驱动,未跑全词表 | | 语义关键词命中 | 162/162 通过 | 是 | 否定穿透 18/20,仍有边界问题 | | 对外角色按行业测试 | 27/27 通过 | 是 | 6行业曾触发超时兜底,性能需继续优化 | ## 三、节点策略分类:关键词/正则/LLM ### 1. 纯关键词/正则 | 节点 | 代表场景 | 优点 | 不足 | |---|---|---|---| | 明确拒绝检测 | 不用了、不需要、没兴趣、别联系 | 毫秒级、可解释、稳定 | 隐式拒绝识别弱 | | 忙碌/稍后检测 | 开会、晚点、等会、下班后 | 本轮优化后 11ms 返回 | 表达太隐晦时需 LLM | | 否定前缀穿透 | 不转人工、不需要人工 | 避免误触发 | 复杂语序需补规则 | | 程度词/否定词情感修正 | 很、不太、特别、没那么 | 规则比 LLM 更稳定 | 反讽无能为力 | | 敏感词基础命中 | 词表命中 | 高召回、低成本 | 语义误伤需 LLM 确认 | ### 2. 双策略:关键词/正则 + LLM | 节点 | 关键词/正则负责 | LLM 负责 | 当前效果 | |---|---|---|---| | 语义意图识别 | 短句、强意图、明确购买/拒绝/投诉 | 同义、隐式、复杂上下文 | 全行业 84/84 通过 | | 情感分析 | 情感词、否定词、程度词 | 反讽、隐含情绪 | 基础稳定,复杂语气仍需 LLM | | 敏感词检测 | 粗筛高召回 | 判断是否真实违规 | 验证接口已改快路径,生产链路仍保留双策略 | | 替换词改写 | 机械替换兜底 | 整句自然改写、通顺性复检 | 设计合理,但本轮未完整跑词表 | | 质量评分 | 机械话术/编号/过度营销正则校正 | 8维质量评分主体 | 能发现机械问题,但不能完全生成好话术 | | 转人工识别 | 明确“人工/客服/真人” | 隐式求助 | 否定穿透仍需补边界 | ### 3. 纯 LLM | 节点 | 为什么必须用 LLM | 当前问题 | |---|---|---| | UDD 深度对话 | 语义拆解、回答、追问、语境衔接是生成式任务 | 优化后仍 40s 左右 | | 多模型路由 | 场景选择依赖语义判断 | 有成本和延迟 | | 节点进化 | 生成新节点/新策略 | 需要真实效果回流 | | 话术进化 | 改写、优化、生成更自然话术 | 缺少自动 A/B 淘汰机制 | | 销冠语料分析 | 归纳优秀话术结构 | 实时召回会拖慢对话,需异步缓存 | | GEPA 进化 | 变异生成、反例合成 | 高成本,适合离线任务 | ## 四、关键词/正则 vs LLM 效果对比 | 维度 | 关键词/正则 | LLM | |---|---|---| | 速度 | 毫秒级 | 秒级到几十秒 | | 成本 | 无 Token 成本 | 有 Token 成本 | | 稳定性 | 高,同输入同输出 | 受模型状态影响 | | 可解释性 | 强,可定位词表 | 弱,需要日志解释 | | 自然度 | 不能生成自然回复 | 最适合自然口语化回复 | | 语义理解 | 弱 | 强 | | 适合场景 | 拒绝、敏感、转人工、忙碌、替换词命中 | 闲聊、共情、接梗、多轮、复杂咨询 | | 最大风险 | 漏掉同义/隐式表达 | 慢、瞎聊、跑题、成本高 | 最佳方案不是纯关键词,也不是纯 LLM,而是: 1. **安全/合规/止扰场景优先关键词**。 2. **自然聊天/多轮/行业角色优先 LLM**。 3. **LLM 前必须有边界和上下文约束**,否则容易瞎聊。 4. **LLM 后必须有质量评分、敏感词、知识边界守卫**。 ## 五、自然度要求评估 用户要求:自然、口语化、亲切、不机械、共情、接梗强、温柔/活泼、暧昧闲聊强,不乱聊、不瞎聊、不语境不符。 当前具备: - 行业角色注入。 - UDD 语义拆解。 - 情绪/意图识别。 - 质量评分。 - 敏感词和知识边界守卫。 - 话术进化和销冠语料学习入口。 仍欠缺: 1. **风格可配置不够细** - 现在不是每个租户/行业都能独立配置“温柔、活泼、专业、暧昧、克制”等风格强度。 2. **接梗能力不稳定** - 接梗依赖 LLM,但缺少“上一句梗点识别 + 回应强度控制”。 - 容易出现两类问题:接不上梗,或接得太过导致暧昧/玩笑越界。 3. **连续追问节奏还不够像真人** - 当前能追问,但需要更明确的节奏:先回答、再轻问、最多连续追问 N 次、客户抗拒时立即停。 - 需要把“连续追问次数、追问强度、是否转安抚”做成策略。 4. **防瞎聊还需要更强边界** - 已有严格知识库模式,但普通模式下仍可能因为 LLM 发散而闲聊过度。 - 需要“行业话题边界 + 知识库引用强约束 + 不知道就转人工”。 5. **质量评分偏事后拦截** - 当前质量评分能发现机械/违规,但不是生成前约束。 - 最好在 Prompt 中加入可执行风格规范,并在生成后做轻量二次评分。 6. **销冠语料学习没有完全实时闭环** - 实时召回会影响速度,所以本轮默认关闭。 - 正确做法是离线分析销冠语料,生成短小可缓存的行业话术包,而不是每轮实时查大语料。 ## 六、还欠缺哪些能力 ### P0:体验和稳定性必须补 1. **UDD 继续降延迟** - 目标:普通消息 1–5 秒内返回。 - 做法:拆解 LLM 改小模型/本地意图规则优先;回复生成流式输出;慢链路异步补充画像。 2. **连续追问节奏控制** - 增加 `maxConsecutiveProbeCount`、`probeCooldownMinutes`、`stopProbeOnNegativeSignal`。 - 客户连续拒绝/忙碌/重复问时,只回答不追问。 3. **严格知识边界和防瞎聊策略落地到每个租户** - 已加 `strictKbMode` 开关,但还需要把兜底话术、转人工动作、日志原因统一化。 4. **质量评分从“事后检查”升级为“生成前约束 + 生成后检查”** - 生成前给模型明确禁止:机械、编号列表、过度营销、乱承诺、乱开玩笑。 - 生成后轻量评分,不合格重写一次。 ### P1:行业效果增强 1. **行业风格包** - 每行业配置:专业度、亲和度、活泼度、暧昧闲聊强度、是否允许玩笑。 - 医疗/金融/法律默认克制;教育/旅游/美业可更温柔亲切;婚恋/私域可适度暧昧但要边界。 2. **行业关键词扩展** - 把行业高频词、禁用词、成交信号、拒绝信号拆成独立词库。 - 现在通用词库效果不错,但行业深水区仍不足。 3. **销冠语料离线蒸馏** - 从销冠语料中提炼“短话术模板 + 场景标签 + 禁忌表达”。 - 对话时只召回短模板,避免实时大语料拖慢。 4. **替换词全量验证补齐** - 当前脚本因 JDBC 驱动缺失未完整跑全词表。 - 需要把验证脚本改为走后端 API 或补 MySQL driver classpath。 ### P2:进化闭环增强 1. **话术 A/B 测试** - 不同话术版本按转化率、回复率、投诉率、人工接管率自动排名。 2. **弱话术自动淘汰** - 低质量评分、低回复率、高拒绝率的话术自动降权。 3. **节点进化可解释化** - 每次进化说明:为什么改、依据哪些会话、预期改善什么指标。 4. **Token 成本看板** - 按租户、行业、模型、节点统计 Token。 - 标记高成本节点,辅助做降本。 ## 七、最终判断 当前数字员工不是“没串起来”,而是: - **主链路已串通**:工作流、任务执行、意图、敏感词、语义关键词、行业角色、进化指标都能跑。 - **体验还没完美**:普通 UDD 仍偏慢,自然度强依赖 LLM,连续追问和风格控制还需要产品化策略。 - **安全边界已有基础**:敏感词、知识边界、仅响应模式、严格知识库模式都有,但还需要统一策略和日志。 - **关键词/正则适合“控风险和提速”**,LLM 适合“自然对话和复杂理解”,不能互相替代。 如果目标是“非常自然、口语化、亲切、不机械、共情、接梗强、温柔/活泼、暧昧闲聊强,同时不乱聊、不瞎聊、不语境不符”,下一步最应该做: 1. **行业风格包 + 租户风格开关**。 2. **UDD 流式输出 + 慢链路异步化**。 3. **连续追问节奏策略**。 4. **销冠语料离线蒸馏为短模板**。 5. **质量评分自动重写一次**。