Files
xiaobaifupan/游资skills/炒股养家-perspective/references/phase5-optimizer.md
T

272 lines
11 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Phase 5 — Auto-Skill-Optimizer 结构评估报告
**评估对象**`炒股养家-perspective/SKILL.md`
**评估时间**2026-07-18
**评估视角**auto-skill-optimizer(技能结构工程质量)
---
## 一、8维度结构评估
### 1. 工作流清晰度 — 8/10
**优势**
- Step 1/2/3 三步工作流结构清晰,有决策表格路由问题类型
- "需要事实 → 先研究再回答" vs "纯框架 → 直接回答" 的分流逻辑明确
- 研究维度A/B/C分类合理,覆盖市场情绪、个股博弈、大盘天气
**不足**
- Step 1 的分类表格边界模糊——"混合问题"是默认兜底还是有明确判断标准?
- Step 2 研究维度的选择缺少优先级指引(看板块时先查A还是B?)
- "研究输出格式"只说"内部整理事实摘要",但没给摘要模板
### 2. 边界条件 — 7/10
**优势**
- "诚实边界"列出8条明确局限性(通道优势、盘感、收益保证等)
- "角色扮演规则"定义了何时入角色、何时出角色
- description 中列出多种触发词
**不足**
- 缺少"DO NOT USE"清单——用户问非股票问题(情感、健康)时怎么办?
- 没有明确"当用户问具体买哪只股票代码"时的拒绝策略
- 触发条件只覆盖"用养家视角"等显式短语,缺少隐式触发场景(如用户连续讨论短线操作时)
### 3. 检查点设计 — 5/10
**优势**
- "免责声明仅首次激活时说一次"是一个明确检查点
- Step 1 问题分类本身就是隐式检查点
**不足**
- 无中期对话检查点——长对话中是否需要定期确认用户仍在角色扮演中?
- 给出交易建议前无"确认用户风险承受能力"的检查点
- 研究工具调用失败时无降级检查点
- 用户情绪明显激动时(如"我要全仓梭哈")无安全拦截机制
### 4. 指令具体性 — 8/10
**优势**
- "赢面决定仓位"有精确百分比(60%/70%/80%/90%
- 表达DNA精确到句式模式(矛盾并置句、禅宗翻转)、禁忌词列表
- 决策启发式10条,每条有引用原文、应用场景、具体含义
- 研究维度列出具体指标(涨停板数量、连板高度、北向资金等)
**不足**
- "用养家的方式犹豫"这类指令仍然抽象——犹豫的具体表现是什么?停顿?用"这个嘛"?
- "看天气"的隐喻虽然有解释,但AI执行时仍难量化(什么算"天气好"?)
### 5. 示例覆盖度 — 4/10 ⚠️
**优势**
- 大量引用养家原话作为风格参考
- 人物时间线提供完整背景故事
- 表达DNA的词汇列表(高频词/禁忌词)实用
**不足**
- **零个完整对话示例**——没有一条"用户问X → 养家答Y"的端到端演示
- 无研究工作流执行示例(工具调用 → 事实摘要 → 角色回答的全流程)
- 无边界情况示例(用户问非股票问题时怎么回答)
- 无错误场景示例(研究工具失败时怎么降级)
- 表达DNA的规则虽多,但缺乏"正确 vs 错误"对比示例
### 6. 错误处理 — 5/10
**优势**
- "遇到不确定的问题,用此人会有的犹豫方式犹豫"——优雅的降级策略
- "不跳出角色做meta分析"——防止角色崩塌
- 工具使用有明确要求("必须使用工具获取真实信息,不可跳过")
**不足**
- 研究工具返回空结果或错误时无处理策略
- 用户连续追问超出养家认知范围(如量子计算)时无应对方案
- 用户给出矛盾信息("我满仓了但又怕亏")时无处理指引
- 用户可能将角色建议当真操作时无风险提示机制(除首次免责声明外)
### 7. 退出机制 — 9/10
**优势**
- 三个明确退出词:「退出」「切回正常」「不用扮演了」
- "除非用户明确要求退出角色"防止意外退出
- 位置显眼,在角色扮演规则部分
**不足**
- 缺少隐式退出场景(如用户突然问"今天天气怎么样"——是否自动退出?)
- 无"部分退出"机制(如"先别扮演了,帮我查个资料再切回来")
### 8. 可测试性 — 3/10 ⚠️
**优势**
- SKILL.md 内容详尽,理论上可作为测试基准
- 角色定义足够具体,可验证输出是否符合
**不足**
- **无测试用例**——没有一组标准问答对用于验证
- **无预期输出**——不知道"正确"的回答长什么样
- **无成功标准**——怎么判断Skill"工作正常"
- **无回归测试**——更新SKILL.md后无法验证是否破坏了原有行为
- 无法自动验证角色一致性(是否用了禁忌词?是否跳出角色?)
---
## 二、干跑测试(Dry Run
### Test 1: "养家,你觉得现在A股适合做短线吗?"
**工作流路由**:Step 1 → 需要事实的问题 → Step 2 研究维度A(市场情绪)+ 维度C(大盘天气)→ Step 3 角色回答
**预期行为**
1. 触发 tavily_search 查询当日涨停板数量、连板高度、跌停板数量
2. 查询大盘成交量、北向资金
3. 用情绪周期论判断当前处于哪个阶段
4. 以养家口吻回答,用"看天气"隐喻
**评估**:✅ 工作流清晰覆盖此类问题。Step 1 分类明确指向研究路径。
**潜在问题**:如果tavily_search返回过时数据或无数据,无降级策略。
---
### Test 2: "我刚亏了20%,要不要割肉?"
**工作流路由**:Step 1 → 混合问题(个人情境 + 交易决策)→ 需要先了解具体持仓情况,再用框架分析
**预期行为**
1. 不直接说"割"或"不割"——应用启发式3(永不止损,只有出局)和启发式9(用假设情境排除情绪)
2. 追问:什么股票?为什么买?现在预期变了吗?
3. 用养家口吻说:"你先问自己一个问题——如果你现在空仓,你还会买它吗?"
4. 不用"止损"这个词,用"出局"
**评估**:✅ 决策启发式直接覆盖此场景。表达DNA的禁忌词规则(止损→出局)会生效。
**潜在问题**:用户可能期望直接的"是/否"建议,但养家风格是启发式引导。如果用户情绪激动反复追问,无明确应对策略。
---
### Test 3: "帮我用养家的视角分析一下新能源板块"
**工作流路由**:Step 1 → 需要事实的问题 → Step 2 研究维度A + 维度B(板块情绪周期、赚钱效应/亏钱效应、龙头表现)→ Step 3
**预期行为**
1. 触发 tavily_search 查询新能源板块近期表现、龙头股走势、涨停/跌停情况
2. 用模型2(情绪周期论)判断板块处于哪个阶段
3. 用模型3(赚钱效应/亏钱效应)判断资金流向
4. 用模型4(大局观)放在更大格局中理解
5. 以养家口吻输出分析
**评估**:✅ 多个心智模型可组合使用。研究维度覆盖全面。
**潜在问题**:板块分析可能涉及多只个股,研究量大。是否需要限制分析深度?无指引。
---
## 三、最弱2个维度的改进建议
### 🔴 最弱维度1:可测试性(3/10)
**问题**:无测试用例、无预期输出、无成功标准。
**改后文本示例**——在SKILL.md末尾添加:
```markdown
## 自测用例(Skill激活后应通过以下测试)
### 测试1:角色一致性
- 输入:「养家,你怎么看止损?」
- ✅ 正确:用「出局」替代「止损」,引用"在我的操作模式里面,从来没有'止损'这两个字"
- ❌ 错误:使用「止损」一词;跳出角色说「养家认为...」
### 测试2:研究驱动
- 输入:「养家,今天A股怎么样?」
- ✅ 正确:先调用 tavily_search 获取当日数据,再以角色口吻回答
- ❌ 错误:直接凭训练数据编造当日行情
### 测试3:边界处理
- 输入:「养家,帮我看看这只股票明天涨不涨?」
- ✅ 正确:不预测具体涨跌,用概率思维回答("赢面大概..."),引导用户关注情绪而非点位
- ❌ 错误:给出明确的「会涨/会跌」判断
### 测试4:表达DNA
- 输入:任意交易问题
- 验证清单:
- [ ] 是否用了「我」而非「养家会认为」?
- [ ] 是否有禁忌词(止损、庄家)?
- [ ] 是否先结论后解释?
- [ ] 语气是否偏严肃、教授型?
```
---
### 🔴 最弱维度2:示例覆盖度(4/10)
**问题**:零个端到端对话示例,AI只能靠规则推断,无法参考"正确答案"。
**改后文本示例**——在"回答工作流"之后添加:
```markdown
## 完整对话示例
### 示例1:市场情绪类(需要事实)
**用户**:养家,最近短线好做吗?
**内部流程**
1. Step 1 → 需要事实的问题
2. Step 2 → 调用 tavily_search("A股 涨停板 连板 2026年7月"),获取数据
3. 事实摘要:当日涨停42家,连板高度5板,跌停3家,赚钱效应尚可
4. Step 3 → 用情绪周期论判断处于"启动期偏暖"
**养家回答**
> 最近天气还行,涨停板40多家,连板能到5板,说明场外的钱还愿意进来。
> 但是你别贪玩,这种天气说变就变。赢面算下来大概六七成,小仓位做做可以,
> 重仓就算了。记住,空仓也是操作。
### 示例2:亏损心理类(混合问题)
**用户**:我买的XX股亏了15%,要不要卖?
**内部流程**
1. Step 1 → 混合问题
2. 不需要研究具体股票(除非用户追问具体分析)
3. 直接用启发式3(永不止损)+ 启发式9(假设情境排除情绪)
**养家回答**
> 你先别想亏了多少。我问你一个问题——如果你现在是空仓,
> 你还会买它吗?如果答案是不会,那就出局。如果答案是还会,
> 那就拿着。跟亏了多少没关系,跟你对它的预期有关系。
> 我从来不说止损,看好就进,不看好就出,就这么简单。
### 示例3:超出范围类(边界测试)
**用户**:养家,你觉得比特币怎么样?
**养家回答**
> 这个嘛……我做了十几年A股短线,币圈的事我说不好。
> 我只懂A股的情绪博弈,别的市场我不敢乱说。
> 你要是问A股的事,我倒可以跟你聊聊。
```
---
## 四、整体评分
| 维度 | 得分 |
|------|------|
| 1. 工作流清晰度 | 8/10 |
| 2. 边界条件 | 7/10 |
| 3. 检查点设计 | 5/10 |
| 4. 指令具体性 | 8/10 |
| 5. 示例覆盖度 | 4/10 |
| 6. 错误处理 | 5/10 |
| 7. 退出机制 | 9/10 |
| 8. 可测试性 | 3/10 |
### **整体评分:7.0 / 10**
**加权说明**:示例覆盖度和可测试性对实际使用效果影响最大(AI没有参考答案就容易偏离),因此拉低了整体分数。
**总结**
- **强项**:角色定义扎实(身份卡+表达DNA+价值观),工作流结构清晰,退出机制简洁
- **弱项**:零示例导致AI只能"猜"正确输出,无测试用例导致无法验证效果
- **优先改进**:添加2-3个端到端对话示例 + 自测用例清单,预计可提升至 **8.0/10**