# Phase 5 — Auto-Skill-Optimizer 结构评估报告 **评估对象**:`炒股养家-perspective/SKILL.md` **评估时间**:2026-07-18 **评估视角**:auto-skill-optimizer(技能结构工程质量) --- ## 一、8维度结构评估 ### 1. 工作流清晰度 — 8/10 **优势**: - Step 1/2/3 三步工作流结构清晰,有决策表格路由问题类型 - "需要事实 → 先研究再回答" vs "纯框架 → 直接回答" 的分流逻辑明确 - 研究维度A/B/C分类合理,覆盖市场情绪、个股博弈、大盘天气 **不足**: - Step 1 的分类表格边界模糊——"混合问题"是默认兜底还是有明确判断标准? - Step 2 研究维度的选择缺少优先级指引(看板块时先查A还是B?) - "研究输出格式"只说"内部整理事实摘要",但没给摘要模板 ### 2. 边界条件 — 7/10 **优势**: - "诚实边界"列出8条明确局限性(通道优势、盘感、收益保证等) - "角色扮演规则"定义了何时入角色、何时出角色 - description 中列出多种触发词 **不足**: - 缺少"DO NOT USE"清单——用户问非股票问题(情感、健康)时怎么办? - 没有明确"当用户问具体买哪只股票代码"时的拒绝策略 - 触发条件只覆盖"用养家视角"等显式短语,缺少隐式触发场景(如用户连续讨论短线操作时) ### 3. 检查点设计 — 5/10 **优势**: - "免责声明仅首次激活时说一次"是一个明确检查点 - Step 1 问题分类本身就是隐式检查点 **不足**: - 无中期对话检查点——长对话中是否需要定期确认用户仍在角色扮演中? - 给出交易建议前无"确认用户风险承受能力"的检查点 - 研究工具调用失败时无降级检查点 - 用户情绪明显激动时(如"我要全仓梭哈")无安全拦截机制 ### 4. 指令具体性 — 8/10 **优势**: - "赢面决定仓位"有精确百分比(60%/70%/80%/90%) - 表达DNA精确到句式模式(矛盾并置句、禅宗翻转)、禁忌词列表 - 决策启发式10条,每条有引用原文、应用场景、具体含义 - 研究维度列出具体指标(涨停板数量、连板高度、北向资金等) **不足**: - "用养家的方式犹豫"这类指令仍然抽象——犹豫的具体表现是什么?停顿?用"这个嘛"? - "看天气"的隐喻虽然有解释,但AI执行时仍难量化(什么算"天气好"?) ### 5. 示例覆盖度 — 4/10 ⚠️ **优势**: - 大量引用养家原话作为风格参考 - 人物时间线提供完整背景故事 - 表达DNA的词汇列表(高频词/禁忌词)实用 **不足**: - **零个完整对话示例**——没有一条"用户问X → 养家答Y"的端到端演示 - 无研究工作流执行示例(工具调用 → 事实摘要 → 角色回答的全流程) - 无边界情况示例(用户问非股票问题时怎么回答) - 无错误场景示例(研究工具失败时怎么降级) - 表达DNA的规则虽多,但缺乏"正确 vs 错误"对比示例 ### 6. 错误处理 — 5/10 **优势**: - "遇到不确定的问题,用此人会有的犹豫方式犹豫"——优雅的降级策略 - "不跳出角色做meta分析"——防止角色崩塌 - 工具使用有明确要求("必须使用工具获取真实信息,不可跳过") **不足**: - 研究工具返回空结果或错误时无处理策略 - 用户连续追问超出养家认知范围(如量子计算)时无应对方案 - 用户给出矛盾信息("我满仓了但又怕亏")时无处理指引 - 用户可能将角色建议当真操作时无风险提示机制(除首次免责声明外) ### 7. 退出机制 — 9/10 **优势**: - 三个明确退出词:「退出」「切回正常」「不用扮演了」 - "除非用户明确要求退出角色"防止意外退出 - 位置显眼,在角色扮演规则部分 **不足**: - 缺少隐式退出场景(如用户突然问"今天天气怎么样"——是否自动退出?) - 无"部分退出"机制(如"先别扮演了,帮我查个资料再切回来") ### 8. 可测试性 — 3/10 ⚠️ **优势**: - SKILL.md 内容详尽,理论上可作为测试基准 - 角色定义足够具体,可验证输出是否符合 **不足**: - **无测试用例**——没有一组标准问答对用于验证 - **无预期输出**——不知道"正确"的回答长什么样 - **无成功标准**——怎么判断Skill"工作正常"? - **无回归测试**——更新SKILL.md后无法验证是否破坏了原有行为 - 无法自动验证角色一致性(是否用了禁忌词?是否跳出角色?) --- ## 二、干跑测试(Dry Run) ### Test 1: "养家,你觉得现在A股适合做短线吗?" **工作流路由**:Step 1 → 需要事实的问题 → Step 2 研究维度A(市场情绪)+ 维度C(大盘天气)→ Step 3 角色回答 **预期行为**: 1. 触发 tavily_search 查询当日涨停板数量、连板高度、跌停板数量 2. 查询大盘成交量、北向资金 3. 用情绪周期论判断当前处于哪个阶段 4. 以养家口吻回答,用"看天气"隐喻 **评估**:✅ 工作流清晰覆盖此类问题。Step 1 分类明确指向研究路径。 **潜在问题**:如果tavily_search返回过时数据或无数据,无降级策略。 --- ### Test 2: "我刚亏了20%,要不要割肉?" **工作流路由**:Step 1 → 混合问题(个人情境 + 交易决策)→ 需要先了解具体持仓情况,再用框架分析 **预期行为**: 1. 不直接说"割"或"不割"——应用启发式3(永不止损,只有出局)和启发式9(用假设情境排除情绪) 2. 追问:什么股票?为什么买?现在预期变了吗? 3. 用养家口吻说:"你先问自己一个问题——如果你现在空仓,你还会买它吗?" 4. 不用"止损"这个词,用"出局" **评估**:✅ 决策启发式直接覆盖此场景。表达DNA的禁忌词规则(止损→出局)会生效。 **潜在问题**:用户可能期望直接的"是/否"建议,但养家风格是启发式引导。如果用户情绪激动反复追问,无明确应对策略。 --- ### Test 3: "帮我用养家的视角分析一下新能源板块" **工作流路由**:Step 1 → 需要事实的问题 → Step 2 研究维度A + 维度B(板块情绪周期、赚钱效应/亏钱效应、龙头表现)→ Step 3 **预期行为**: 1. 触发 tavily_search 查询新能源板块近期表现、龙头股走势、涨停/跌停情况 2. 用模型2(情绪周期论)判断板块处于哪个阶段 3. 用模型3(赚钱效应/亏钱效应)判断资金流向 4. 用模型4(大局观)放在更大格局中理解 5. 以养家口吻输出分析 **评估**:✅ 多个心智模型可组合使用。研究维度覆盖全面。 **潜在问题**:板块分析可能涉及多只个股,研究量大。是否需要限制分析深度?无指引。 --- ## 三、最弱2个维度的改进建议 ### 🔴 最弱维度1:可测试性(3/10) **问题**:无测试用例、无预期输出、无成功标准。 **改后文本示例**——在SKILL.md末尾添加: ```markdown ## 自测用例(Skill激活后应通过以下测试) ### 测试1:角色一致性 - 输入:「养家,你怎么看止损?」 - ✅ 正确:用「出局」替代「止损」,引用"在我的操作模式里面,从来没有'止损'这两个字" - ❌ 错误:使用「止损」一词;跳出角色说「养家认为...」 ### 测试2:研究驱动 - 输入:「养家,今天A股怎么样?」 - ✅ 正确:先调用 tavily_search 获取当日数据,再以角色口吻回答 - ❌ 错误:直接凭训练数据编造当日行情 ### 测试3:边界处理 - 输入:「养家,帮我看看这只股票明天涨不涨?」 - ✅ 正确:不预测具体涨跌,用概率思维回答("赢面大概..."),引导用户关注情绪而非点位 - ❌ 错误:给出明确的「会涨/会跌」判断 ### 测试4:表达DNA - 输入:任意交易问题 - 验证清单: - [ ] 是否用了「我」而非「养家会认为」? - [ ] 是否有禁忌词(止损、庄家)? - [ ] 是否先结论后解释? - [ ] 语气是否偏严肃、教授型? ``` --- ### 🔴 最弱维度2:示例覆盖度(4/10) **问题**:零个端到端对话示例,AI只能靠规则推断,无法参考"正确答案"。 **改后文本示例**——在"回答工作流"之后添加: ```markdown ## 完整对话示例 ### 示例1:市场情绪类(需要事实) **用户**:养家,最近短线好做吗? **内部流程**: 1. Step 1 → 需要事实的问题 2. Step 2 → 调用 tavily_search("A股 涨停板 连板 2026年7月"),获取数据 3. 事实摘要:当日涨停42家,连板高度5板,跌停3家,赚钱效应尚可 4. Step 3 → 用情绪周期论判断处于"启动期偏暖" **养家回答**: > 最近天气还行,涨停板40多家,连板能到5板,说明场外的钱还愿意进来。 > 但是你别贪玩,这种天气说变就变。赢面算下来大概六七成,小仓位做做可以, > 重仓就算了。记住,空仓也是操作。 ### 示例2:亏损心理类(混合问题) **用户**:我买的XX股亏了15%,要不要卖? **内部流程**: 1. Step 1 → 混合问题 2. 不需要研究具体股票(除非用户追问具体分析) 3. 直接用启发式3(永不止损)+ 启发式9(假设情境排除情绪) **养家回答**: > 你先别想亏了多少。我问你一个问题——如果你现在是空仓, > 你还会买它吗?如果答案是不会,那就出局。如果答案是还会, > 那就拿着。跟亏了多少没关系,跟你对它的预期有关系。 > 我从来不说止损,看好就进,不看好就出,就这么简单。 ### 示例3:超出范围类(边界测试) **用户**:养家,你觉得比特币怎么样? **养家回答**: > 这个嘛……我做了十几年A股短线,币圈的事我说不好。 > 我只懂A股的情绪博弈,别的市场我不敢乱说。 > 你要是问A股的事,我倒可以跟你聊聊。 ``` --- ## 四、整体评分 | 维度 | 得分 | |------|------| | 1. 工作流清晰度 | 8/10 | | 2. 边界条件 | 7/10 | | 3. 检查点设计 | 5/10 | | 4. 指令具体性 | 8/10 | | 5. 示例覆盖度 | 4/10 | | 6. 错误处理 | 5/10 | | 7. 退出机制 | 9/10 | | 8. 可测试性 | 3/10 | ### **整体评分:7.0 / 10** **加权说明**:示例覆盖度和可测试性对实际使用效果影响最大(AI没有参考答案就容易偏离),因此拉低了整体分数。 **总结**: - **强项**:角色定义扎实(身份卡+表达DNA+价值观),工作流结构清晰,退出机制简洁 - **弱项**:零示例导致AI只能"猜"正确输出,无测试用例导致无法验证效果 - **优先改进**:添加2-3个端到端对话示例 + 自测用例清单,预计可提升至 **8.0/10**