# Phase 5 · Skill Optimizer 8维度结构评估 > 评估对象:`chenxiaoqun-perspective/SKILL.md` > 评估时间:2026-07-18 > 评估视角:auto-skill-optimizer --- ## 一、8维度评分 | # | 维度 | 得分(满分10) | 评价 | |---|------|-------------|------| | 1 | 工作流清晰度 | 7 | 三步流程清晰(分类→研究→回答),问题分类表结构化。但研究步骤缺乏工具调用的具体指引,Step 2 与 Step 3 之间缺少质量验证门。 | | 2 | 边界条件 | 6 | "诚实边界"和每个模型的"局限"段落是亮点,"我自己也没想清楚的"坦诚度高。但未定义拒绝回答的场景(如用户要求具体买卖建议时的合规边界)、未明确信息时效性失效条件。 | | 3 | 检查点设计 | 3 | **弱项**。Step 1→2→3 线性推进,无中间验证节点。缺少:研究结果充分性检查、事实与框架一致性校验、输出质量自审环节。 | | 4 | 指令具体性 | 5 | 部分指令精准("亏超3%无条件止损"、"免责声明仅首次激活时说一次"),部分过于抽象("用此人会有的犹豫方式犹豫"、"先结论后解释"缺少量化标准)。 | | 5 | 示例覆盖度 | 3 | **弱项**。零示例对话。有证据引用但无完整问答示例。未展示:龙头战法问题如何回答、情绪周期判断如何表述、敏感话题如何处理。新 agent 无法从示例中校准输出风格。 | | 6 | 错误处理 | 2 | **最弱维度**。完全缺失:工具调用失败的 fallback、搜索无结果时的处理、信息冲突时的裁决逻辑、用户信息不足时的追问策略。 | | 7 | 退出机制 | 7 | 退出触发词明确("退出""切回正常""不用扮演了"),免责仅首次激活,机制简洁有效。可改进:未定义"自然退出"场景(如对话主题漂移时是否自动降级角色扮演强度)。 | | 8 | 可测试性 | 5 | 心智模型有明确应用规则(可测),决策启发式10条可逐一验证。但表达DNA("短、硬、命令式")缺乏客观判定标准,"幽默"和"节奏"维度难以自动化测试。 | **整体评分:5.4 / 10** --- ## 二、干跑测试 ### 测试1:"群总,你觉得现在A股适合做龙头战法吗?" **分类判定**:混合问题(需要当前市场事实 + 框架分析) **预期工作流**: 1. Step 1 → 混合问题,需先研究 2. Step 2 → 调用 tavily_search 获取:当日涨停板数量、连板高度、市场总龙头状态、赚钱效应 3. Step 3 → 用情绪周期论判断当前处于哪个阶段,结合龙头信仰给出建议 **暴露问题**: - ⚠️ 无错误处理:tavily_search 失败时怎么办?直接跳过研究凭空回答?还是告知用户无法获取实时数据? - ⚠️ 无检查点:研究结果是否"足够"回答问题?如果只搜到3天前的数据,时效性如何判断? - ⚠️ 无追问机制:如果搜索结果不足以判断情绪周期,是否应向用户确认当前市场状态? **结论**:流程可走通但无容错能力。 --- ### 测试2:"我跟了你的席位买了一只股,亏了15%,怎么办?" **分类判定**:混合问题(需知具体股票 + 框架分析) **预期工作流**: 1. Step 1 → 混合问题 2. Step 2 → 用户未提供具体股票名称,无法研究 3. Step 3 → 可直接用启发式9"别跟我席位炒股"回应,但无法给出针对性建议 **暴露问题**: - ⚠️ **无追问策略**:用户未提供股票名,Skill无指引是否追问。直接给通用建议?还是先问"哪只股"? - ⚠️ **敏感场景无预案**:用户表达亏损情绪,需兼顾角色人设("别跟我席位炒股"的训诫)与用户情绪安抚,Skill未提供平衡指引 - ⚠️ **合规边界模糊**:如果用户追问"那我现在该割还是该拿",这是否构成投资建议?Skill未定义拒绝/免责边界 **结论**:信息不足时流程断裂,敏感场景无预案。 --- ### 测试3:"帮我用群总的视角分析一下商业航天板块" **分类判定**:需要事实的问题(板块分析) **预期工作流**: 1. Step 1 → 需要事实 2. Step 2 → 研究维度A/B/C全面适用:板块涨停情况、龙头标的、资金合力状态 3. Step 3 → 用合力论+龙头信仰+情绪周期论综合分析 **暴露问题**: - ⚠️ **敏感话题无指引**:商业航天是2026年1月"塌房风暴"的直接导火索,陈小群在此板块巨亏后被散户反噬。Skill未指导如何处理与角色创伤经历相关的话题——是回避?直面?还是用角色方式情绪化回应? - ⚠️ **历史包袱无处理**:角色时间线明确记录了商业航天事件,但回答工作流中未将"角色敏感话题"纳入分类维度 - ⚠️ **"诚实边界"与角色扮演的冲突**:当用户问的恰好是"我自己也没想清楚的"矛盾点时,应以角色身份承认矛盾,还是以Skill层面提示局限?无指引 **结论**:触及角色核心创伤场景,缺乏敏感话题处理机制。 --- ## 三、最弱2个维度改进建议 ### 🔴 最弱维度1:错误处理(2/10) **现状问题**: - 工具调用失败无 fallback - 搜索无结果无处理逻辑 - 信息冲突无裁决规则 - 用户信息不足无追问策略 **改后文本示例**(建议插入到"回答工作流"章节的 Step 2 之后): ```markdown ### Step 2.5: 容错与追问 #### 工具调用失败 - 若 tavily_search 超时或报错:用已有知识回答,但开头标注「我手头没有最新数据,基于我退网前的经验聊」 - 连续2次工具失败:跳过研究,直接进入Step 3,但在回答中明确说明信息时效性 #### 搜索无结果 - 若搜索返回0条相关结果:向用户确认问题细节(「你说的是哪只股/哪个板块?给我个代码或名字」) - 若搜索结果全部过期(>7天):标注「这个数据可能不是最新的,你自己再核实一下」 #### 信息冲突 - 若龙虎榜数据与市场传言冲突:以龙虎榜数据为准,但提及传言(「市场在传xxx,但龙虎榜显示的是xxx」) - 若多个来源数据不一致:取最新来源,标注「数据打架,我取的是最新的」 #### 用户信息不足 - 缺少具体标的名称:先追问(「你说的是哪只?给个名字或代码」) - 缺少时间范围:默认取最近5个交易日 - 缺少仓位/成本信息:不追问,给出通用框架建议 ``` --- ### 🔴 最弱维度2:检查点设计(3/10) **现状问题**: - Step 1→2→3 线性推进,无中间验证 - 研究结果"足够性"无标准 - 输出前无质量自审 **改后文本示例**(建议插入到"回答工作流"每个 Step 之间): ```markdown ### 检查点设计 #### Checkpoint 1: 分类确认(Step 1 → Step 2 之间) - [ ] 问题类型已明确标注(事实/框架/混合) - [ ] 若为事实类问题,已识别需要查询的具体标的/板块/时间范围 - [ ] 若为混合问题,已拆分"事实部分"和"框架部分" #### Checkpoint 2: 研究充分性(Step 2 → Step 3 之间) - [ ] 至少获取到1条与问题直接相关的实时/近期信息 - [ ] 信息来源≥2个(或单一龙虎榜官方数据) - [ ] 信息时效性≤7天(超过则标注警告) - [ ] 无严重信息冲突(如有冲突,已按裁决规则处理) #### Checkpoint 3: 输出质量(Step 3 输出前) - [ ] 回答以「我」第一人称,无跳出角色的meta表述 - [ ] 包含至少1个核心心智模型的应用 - [ ] 包含至少1条决策启发式的引用 - [ ] 符合表达DNA:短句为主、先结论后解释、有训诫感 - [ ] 无投资建议性表述(如"你应该买/卖xxx"),或已加免责声明 ``` --- ### 补充:示例覆盖度改进(3/10,与检查点并列最弱) **改后文本示例**(建议在"表达DNA"章节后增加): ```markdown ## 示例对话 ### 示例1:框架类问题 **用户**:群总,龙头战法的核心是什么? **回答**:只做主线,只做人气总龙头。龙头多条命,杂毛一条命。 你去看,每次行情起来,能扛到最后的都是龙头。杂毛涨两天就歇了, 龙头能涨到你怀疑人生。 但记住——龙头不是你定义的,是市场选出来的。能带动板块起涨的, 才叫龙头。你自己封一个龙头,那叫自欺欺人。 ### 示例2:需要事实的问题 **用户**:现在市场情绪怎么样? **回答**:[先调用工具获取涨停板数据、连板高度] (假设搜到:今日涨停45家,连板高度5板,跌停12家) 涨停45家,连板打到5板,跌停才12家——这个数据说明情绪还在发酵期。 龙头没被按,行情就没走完。但现在追高要小心,5板再往上就是分歧区了。 你要做就做龙头首阴的反包,别去接高位板。 ### 示例3:敏感/创伤话题 **用户**:商业航天还能做吗? **回答**:[先调用工具获取板块最新数据] (假设搜到:板块近期无明显异动) 商业航天……这个板块我有故事,你知道的。 但情绪归情绪,盘面归盘面。现在板块没异动,就别碰。 等哪天龙头出来了,合力形成了,再说。 我吃过亏的地方,我比谁都谨慎。你也一样,别冲动。 ``` --- ## 四、维度雷达图(文本版) ``` 错误处理 ██░░░░░░░░ 2/10 ← 最弱 检查点设计 ███░░░░░░░ 3/10 ← 次弱 示例覆盖度 ███░░░░░░░ 3/10 ← 并列次弱 指令具体性 █████░░░░░ 5/10 可测试性 █████░░░░░ 5/10 边界条件 ██████░░░░ 6/10 工作流清晰度 ███████░░░ 7/10 退出机制 ███████░░░ 7/10 ← 最强 ``` ## 五、总结 **整体评分:5.4 / 10** **核心优势**: - 6大心智模型+10条决策启发式的内容密度极高 - 角色身份卡和时间线完整,人设立得住 - 表达DNA定义了风格约束,避免角色跑偏 - 诚实边界和矛盾点的坦诚是亮点 **核心短板**: - 错误处理完全缺失——一个容错能力为零的工作流在实际使用中必然频繁卡死 - 检查点缺失——线性流程无验证门,输出质量靠运气 - 示例为零——新 agent 无法通过示例校准输出风格和质量 **优先修复顺序**: 1. 🔴 错误处理(投入产出比最高,解决"卡死"问题) 2. 🔴 检查点设计(解决"质量不稳定"问题) 3. 🟡 示例覆盖度(解决"风格偏移"问题) 4. 🟡 指令具体性(解决"抽象指令无法执行"问题)