日期:2026-07-01
范围:生产工作流、任务执行、多轮对话、50种过程变化、语义意图、质量评分、连续追问、节点进化、话术进化、销冠语料学习、关键词/敏感词/替换词/语义关键词、行业角色测试、UDD 性能优化。
语义拆解缓存
decompositionCache,同公司、行业、意图、消息、最近上下文相同的场景复用语义拆解结果。压缩 UDD Prompt
recentHistory / memoryContext / knowledgeContext / corpusHint 长度,降低输入 Token。减少额外串行 LLM 调用
topicProfileCollectionPlanner 默认关闭:lobster.udd.topic-plan-enabled=false。lobster.udd.corpus-hint-enabled=false。会话节奏规则快路径
lobster.session.inbound-llm-enabled=false。| 场景 | 优化前 | 优化后 | 说明 |
|---|---|---|---|
| 普通 UDD 首次 | 常见 90–180 秒 | 约 39.9 秒 | Prompt 缩短 + 关闭额外串行 LLM 后明显下降 |
| 同问题重复请求 | 常见 60–180 秒 | 约 21.1 秒 | 命中语义拆解缓存,但仍有后续组装/渲染耗时 |
| 忙碌/稍后类 | 常见 60–180 秒 | 约 11ms | 规则快路径直接返回 |
结论:UDD 已明显变快,但普通复杂消息仍未达到理想的 1–5 秒,瓶颈仍在至少一次 LLM 语义拆解/生成链路。
结论:已基本串通,但还不能说完美。
| 模块 | 当前状态 | 是否串通 | 主要问题 |
|---|---|---|---|
| 生产工作流 | 健康检查通过,节点能力识别正常 | 是 | 需要更多真实任务压测 |
| 工作流任务执行 | 节点执行链路可用 | 是 | 主动节点、响应节点策略还需按租户策略细分 |
| 多轮对话 | UDD 能跑通 | 基本串通 | LLM 延迟仍偏高,连续多轮容易累积等待 |
| 50种过程变化 | 延期、提前、忙碌、拒绝等可识别 | 部分串通 | 明确场景可规则化,隐式变化仍依赖 LLM |
| 语义意图识别 | 84/84 通过 | 是 | 行业深层表达还需继续扩词表 |
| 质量评分 | 双策略可用 | 是 | 能拦机械,但不能完全保证“会聊天” |
| 连续追问 | 机制存在 | 部分串通 | 容易追问太多/太模板,需要节奏控制 |
| 节点进化 | 指标接口通过 | 是 | 需要真实会话长期闭环验证 |
| 话术进化 | 机制存在 | 基本串通 | 缺少 A/B 效果回收和自动淘汰弱话术 |
| 销冠语料学习进化 | 导入/分析/写库链路存在 | 基本串通 | 实时召回默认关闭以提速,需异步/缓存化再启用 |
| 关键词命中 | 关键词链路正常 | 是 | 词表维护成本高 |
| 敏感词 | 修复后 130/130 通过 | 是 | 生产链路 LLM 确认仍可能慢,需超时降级 |
| 替换词 | 服务链路存在 | 未完整复测 | 验证脚本缺 JDBC 驱动,未跑全词表 |
| 语义关键词命中 | 162/162 通过 | 是 | 否定穿透 18/20,仍有边界问题 |
| 对外角色按行业测试 | 27/27 通过 | 是 | 6行业曾触发超时兜底,性能需继续优化 |
| 节点 | 代表场景 | 优点 | 不足 |
|---|---|---|---|
| 明确拒绝检测 | 不用了、不需要、没兴趣、别联系 | 毫秒级、可解释、稳定 | 隐式拒绝识别弱 |
| 忙碌/稍后检测 | 开会、晚点、等会、下班后 | 本轮优化后 11ms 返回 | 表达太隐晦时需 LLM |
| 否定前缀穿透 | 不转人工、不需要人工 | 避免误触发 | 复杂语序需补规则 |
| 程度词/否定词情感修正 | 很、不太、特别、没那么 | 规则比 LLM 更稳定 | 反讽无能为力 |
| 敏感词基础命中 | 词表命中 | 高召回、低成本 | 语义误伤需 LLM 确认 |
| 节点 | 关键词/正则负责 | LLM 负责 | 当前效果 |
|---|---|---|---|
| 语义意图识别 | 短句、强意图、明确购买/拒绝/投诉 | 同义、隐式、复杂上下文 | 全行业 84/84 通过 |
| 情感分析 | 情感词、否定词、程度词 | 反讽、隐含情绪 | 基础稳定,复杂语气仍需 LLM |
| 敏感词检测 | 粗筛高召回 | 判断是否真实违规 | 验证接口已改快路径,生产链路仍保留双策略 |
| 替换词改写 | 机械替换兜底 | 整句自然改写、通顺性复检 | 设计合理,但本轮未完整跑词表 |
| 质量评分 | 机械话术/编号/过度营销正则校正 | 8维质量评分主体 | 能发现机械问题,但不能完全生成好话术 |
| 转人工识别 | 明确“人工/客服/真人” | 隐式求助 | 否定穿透仍需补边界 |
| 节点 | 为什么必须用 LLM | 当前问题 |
|---|---|---|
| UDD 深度对话 | 语义拆解、回答、追问、语境衔接是生成式任务 | 优化后仍 40s 左右 |
| 多模型路由 | 场景选择依赖语义判断 | 有成本和延迟 |
| 节点进化 | 生成新节点/新策略 | 需要真实效果回流 |
| 话术进化 | 改写、优化、生成更自然话术 | 缺少自动 A/B 淘汰机制 |
| 销冠语料分析 | 归纳优秀话术结构 | 实时召回会拖慢对话,需异步缓存 |
| GEPA 进化 | 变异生成、反例合成 | 高成本,适合离线任务 |
| 维度 | 关键词/正则 | LLM |
|---|---|---|
| 速度 | 毫秒级 | 秒级到几十秒 |
| 成本 | 无 Token 成本 | 有 Token 成本 |
| 稳定性 | 高,同输入同输出 | 受模型状态影响 |
| 可解释性 | 强,可定位词表 | 弱,需要日志解释 |
| 自然度 | 不能生成自然回复 | 最适合自然口语化回复 |
| 语义理解 | 弱 | 强 |
| 适合场景 | 拒绝、敏感、转人工、忙碌、替换词命中 | 闲聊、共情、接梗、多轮、复杂咨询 |
| 最大风险 | 漏掉同义/隐式表达 | 慢、瞎聊、跑题、成本高 |
最佳方案不是纯关键词,也不是纯 LLM,而是:
用户要求:自然、口语化、亲切、不机械、共情、接梗强、温柔/活泼、暧昧闲聊强,不乱聊、不瞎聊、不语境不符。
当前具备:
仍欠缺:
风格可配置不够细
接梗能力不稳定
连续追问节奏还不够像真人
防瞎聊还需要更强边界
质量评分偏事后拦截
销冠语料学习没有完全实时闭环
UDD 继续降延迟
连续追问节奏控制
maxConsecutiveProbeCount、probeCooldownMinutes、stopProbeOnNegativeSignal。严格知识边界和防瞎聊策略落地到每个租户
strictKbMode 开关,但还需要把兜底话术、转人工动作、日志原因统一化。质量评分从“事后检查”升级为“生成前约束 + 生成后检查”
行业风格包
行业关键词扩展
销冠语料离线蒸馏
替换词全量验证补齐
话术 A/B 测试
弱话术自动淘汰
节点进化可解释化
Token 成本看板
当前数字员工不是“没串起来”,而是:
如果目标是“非常自然、口语化、亲切、不机械、共情、接梗强、温柔/活泼、暧昧闲聊强,同时不乱聊、不瞎聊、不语境不符”,下一步最应该做: