digital-employee-end-to-end-gap-analysis-20260701.md 12 KB

数字员工全链路串通与缺口分析报告

日期:2026-07-01
范围:生产工作流、任务执行、多轮对话、50种过程变化、语义意图、质量评分、连续追问、节点进化、话术进化、销冠语料学习、关键词/敏感词/替换词/语义关键词、行业角色测试、UDD 性能优化。

一、本轮 UDD 性能优化结果

已完成优化

  1. 语义拆解缓存

    • 位置:UniversalDeepDialogueService.java
    • 增加 decompositionCache,同公司、行业、意图、消息、最近上下文相同的场景复用语义拆解结果。
    • TTL:10分钟;最大容量:2048。
  2. 压缩 UDD Prompt

    • 将原来大段“时间意图、画像维度、重复提问、情感、意图、画像标签”的说明压缩成短字段说明。
    • 限制 recentHistory / memoryContext / knowledgeContext / corpusHint 长度,降低输入 Token。
  3. 减少额外串行 LLM 调用

    • topicProfileCollectionPlanner 默认关闭:lobster.udd.topic-plan-enabled=false
    • 销冠语料提示默认关闭:lobster.udd.corpus-hint-enabled=false
    • 画像标签未命中时不再追加独立 LLM 提取。
    • 隐性信号只有完全为空时才触发增强。
  4. 会话节奏规则快路径

    • 位置:LobsterSessionEngagementService.java
    • 新增忙碌/稍后/拒绝类正则快路径。
    • 默认关闭入站节奏 LLM:lobster.session.inbound-llm-enabled=false
    • “我现在在开会,晚点再聊”这类消息直接返回,不再进入 LLM。

复测结果

场景 优化前 优化后 说明
普通 UDD 首次 常见 90–180 秒 约 39.9 秒 Prompt 缩短 + 关闭额外串行 LLM 后明显下降
同问题重复请求 常见 60–180 秒 约 21.1 秒 命中语义拆解缓存,但仍有后续组装/渲染耗时
忙碌/稍后类 常见 60–180 秒 约 11ms 规则快路径直接返回

结论:UDD 已明显变快,但普通复杂消息仍未达到理想的 1–5 秒,瓶颈仍在至少一次 LLM 语义拆解/生成链路。

二、全链路是否“完美串通”

结论:已基本串通,但还不能说完美。

模块 当前状态 是否串通 主要问题
生产工作流 健康检查通过,节点能力识别正常 需要更多真实任务压测
工作流任务执行 节点执行链路可用 主动节点、响应节点策略还需按租户策略细分
多轮对话 UDD 能跑通 基本串通 LLM 延迟仍偏高,连续多轮容易累积等待
50种过程变化 延期、提前、忙碌、拒绝等可识别 部分串通 明确场景可规则化,隐式变化仍依赖 LLM
语义意图识别 84/84 通过 行业深层表达还需继续扩词表
质量评分 双策略可用 能拦机械,但不能完全保证“会聊天”
连续追问 机制存在 部分串通 容易追问太多/太模板,需要节奏控制
节点进化 指标接口通过 需要真实会话长期闭环验证
话术进化 机制存在 基本串通 缺少 A/B 效果回收和自动淘汰弱话术
销冠语料学习进化 导入/分析/写库链路存在 基本串通 实时召回默认关闭以提速,需异步/缓存化再启用
关键词命中 关键词链路正常 词表维护成本高
敏感词 修复后 130/130 通过 生产链路 LLM 确认仍可能慢,需超时降级
替换词 服务链路存在 未完整复测 验证脚本缺 JDBC 驱动,未跑全词表
语义关键词命中 162/162 通过 否定穿透 18/20,仍有边界问题
对外角色按行业测试 27/27 通过 6行业曾触发超时兜底,性能需继续优化

三、节点策略分类:关键词/正则/LLM

1. 纯关键词/正则

节点 代表场景 优点 不足
明确拒绝检测 不用了、不需要、没兴趣、别联系 毫秒级、可解释、稳定 隐式拒绝识别弱
忙碌/稍后检测 开会、晚点、等会、下班后 本轮优化后 11ms 返回 表达太隐晦时需 LLM
否定前缀穿透 不转人工、不需要人工 避免误触发 复杂语序需补规则
程度词/否定词情感修正 很、不太、特别、没那么 规则比 LLM 更稳定 反讽无能为力
敏感词基础命中 词表命中 高召回、低成本 语义误伤需 LLM 确认

2. 双策略:关键词/正则 + LLM

节点 关键词/正则负责 LLM 负责 当前效果
语义意图识别 短句、强意图、明确购买/拒绝/投诉 同义、隐式、复杂上下文 全行业 84/84 通过
情感分析 情感词、否定词、程度词 反讽、隐含情绪 基础稳定,复杂语气仍需 LLM
敏感词检测 粗筛高召回 判断是否真实违规 验证接口已改快路径,生产链路仍保留双策略
替换词改写 机械替换兜底 整句自然改写、通顺性复检 设计合理,但本轮未完整跑词表
质量评分 机械话术/编号/过度营销正则校正 8维质量评分主体 能发现机械问题,但不能完全生成好话术
转人工识别 明确“人工/客服/真人” 隐式求助 否定穿透仍需补边界

3. 纯 LLM

节点 为什么必须用 LLM 当前问题
UDD 深度对话 语义拆解、回答、追问、语境衔接是生成式任务 优化后仍 40s 左右
多模型路由 场景选择依赖语义判断 有成本和延迟
节点进化 生成新节点/新策略 需要真实效果回流
话术进化 改写、优化、生成更自然话术 缺少自动 A/B 淘汰机制
销冠语料分析 归纳优秀话术结构 实时召回会拖慢对话,需异步缓存
GEPA 进化 变异生成、反例合成 高成本,适合离线任务

四、关键词/正则 vs LLM 效果对比

维度 关键词/正则 LLM
速度 毫秒级 秒级到几十秒
成本 无 Token 成本 有 Token 成本
稳定性 高,同输入同输出 受模型状态影响
可解释性 强,可定位词表 弱,需要日志解释
自然度 不能生成自然回复 最适合自然口语化回复
语义理解
适合场景 拒绝、敏感、转人工、忙碌、替换词命中 闲聊、共情、接梗、多轮、复杂咨询
最大风险 漏掉同义/隐式表达 慢、瞎聊、跑题、成本高

最佳方案不是纯关键词,也不是纯 LLM,而是:

  1. 安全/合规/止扰场景优先关键词
  2. 自然聊天/多轮/行业角色优先 LLM
  3. LLM 前必须有边界和上下文约束,否则容易瞎聊。
  4. LLM 后必须有质量评分、敏感词、知识边界守卫

五、自然度要求评估

用户要求:自然、口语化、亲切、不机械、共情、接梗强、温柔/活泼、暧昧闲聊强,不乱聊、不瞎聊、不语境不符。

当前具备:

  • 行业角色注入。
  • UDD 语义拆解。
  • 情绪/意图识别。
  • 质量评分。
  • 敏感词和知识边界守卫。
  • 话术进化和销冠语料学习入口。

仍欠缺:

  1. 风格可配置不够细

    • 现在不是每个租户/行业都能独立配置“温柔、活泼、专业、暧昧、克制”等风格强度。
  2. 接梗能力不稳定

    • 接梗依赖 LLM,但缺少“上一句梗点识别 + 回应强度控制”。
    • 容易出现两类问题:接不上梗,或接得太过导致暧昧/玩笑越界。
  3. 连续追问节奏还不够像真人

    • 当前能追问,但需要更明确的节奏:先回答、再轻问、最多连续追问 N 次、客户抗拒时立即停。
    • 需要把“连续追问次数、追问强度、是否转安抚”做成策略。
  4. 防瞎聊还需要更强边界

    • 已有严格知识库模式,但普通模式下仍可能因为 LLM 发散而闲聊过度。
    • 需要“行业话题边界 + 知识库引用强约束 + 不知道就转人工”。
  5. 质量评分偏事后拦截

    • 当前质量评分能发现机械/违规,但不是生成前约束。
    • 最好在 Prompt 中加入可执行风格规范,并在生成后做轻量二次评分。
  6. 销冠语料学习没有完全实时闭环

    • 实时召回会影响速度,所以本轮默认关闭。
    • 正确做法是离线分析销冠语料,生成短小可缓存的行业话术包,而不是每轮实时查大语料。

六、还欠缺哪些能力

P0:体验和稳定性必须补

  1. UDD 继续降延迟

    • 目标:普通消息 1–5 秒内返回。
    • 做法:拆解 LLM 改小模型/本地意图规则优先;回复生成流式输出;慢链路异步补充画像。
  2. 连续追问节奏控制

    • 增加 maxConsecutiveProbeCountprobeCooldownMinutesstopProbeOnNegativeSignal
    • 客户连续拒绝/忙碌/重复问时,只回答不追问。
  3. 严格知识边界和防瞎聊策略落地到每个租户

    • 已加 strictKbMode 开关,但还需要把兜底话术、转人工动作、日志原因统一化。
  4. 质量评分从“事后检查”升级为“生成前约束 + 生成后检查”

    • 生成前给模型明确禁止:机械、编号列表、过度营销、乱承诺、乱开玩笑。
    • 生成后轻量评分,不合格重写一次。

P1:行业效果增强

  1. 行业风格包

    • 每行业配置:专业度、亲和度、活泼度、暧昧闲聊强度、是否允许玩笑。
    • 医疗/金融/法律默认克制;教育/旅游/美业可更温柔亲切;婚恋/私域可适度暧昧但要边界。
  2. 行业关键词扩展

    • 把行业高频词、禁用词、成交信号、拒绝信号拆成独立词库。
    • 现在通用词库效果不错,但行业深水区仍不足。
  3. 销冠语料离线蒸馏

    • 从销冠语料中提炼“短话术模板 + 场景标签 + 禁忌表达”。
    • 对话时只召回短模板,避免实时大语料拖慢。
  4. 替换词全量验证补齐

    • 当前脚本因 JDBC 驱动缺失未完整跑全词表。
    • 需要把验证脚本改为走后端 API 或补 MySQL driver classpath。

P2:进化闭环增强

  1. 话术 A/B 测试

    • 不同话术版本按转化率、回复率、投诉率、人工接管率自动排名。
  2. 弱话术自动淘汰

    • 低质量评分、低回复率、高拒绝率的话术自动降权。
  3. 节点进化可解释化

    • 每次进化说明:为什么改、依据哪些会话、预期改善什么指标。
  4. Token 成本看板

    • 按租户、行业、模型、节点统计 Token。
    • 标记高成本节点,辅助做降本。

七、最终判断

当前数字员工不是“没串起来”,而是:

  • 主链路已串通:工作流、任务执行、意图、敏感词、语义关键词、行业角色、进化指标都能跑。
  • 体验还没完美:普通 UDD 仍偏慢,自然度强依赖 LLM,连续追问和风格控制还需要产品化策略。
  • 安全边界已有基础:敏感词、知识边界、仅响应模式、严格知识库模式都有,但还需要统一策略和日志。
  • 关键词/正则适合“控风险和提速”,LLM 适合“自然对话和复杂理解”,不能互相替代。

如果目标是“非常自然、口语化、亲切、不机械、共情、接梗强、温柔/活泼、暧昧闲聊强,同时不乱聊、不瞎聊、不语境不符”,下一步最应该做:

  1. 行业风格包 + 租户风格开关
  2. UDD 流式输出 + 慢链路异步化
  3. 连续追问节奏策略
  4. 销冠语料离线蒸馏为短模板
  5. 质量评分自动重写一次