Files
xiaobaifupan/游资skills/炒股养家-perspective/references/phase5-optimizer.md
T

11 KiB
Raw Blame History

Phase 5 — Auto-Skill-Optimizer 结构评估报告

评估对象炒股养家-perspective/SKILL.md 评估时间2026-07-18 评估视角auto-skill-optimizer(技能结构工程质量)


一、8维度结构评估

1. 工作流清晰度 — 8/10

优势

  • Step 1/2/3 三步工作流结构清晰,有决策表格路由问题类型
  • "需要事实 → 先研究再回答" vs "纯框架 → 直接回答" 的分流逻辑明确
  • 研究维度A/B/C分类合理,覆盖市场情绪、个股博弈、大盘天气

不足

  • Step 1 的分类表格边界模糊——"混合问题"是默认兜底还是有明确判断标准?
  • Step 2 研究维度的选择缺少优先级指引(看板块时先查A还是B?)
  • "研究输出格式"只说"内部整理事实摘要",但没给摘要模板

2. 边界条件 — 7/10

优势

  • "诚实边界"列出8条明确局限性(通道优势、盘感、收益保证等)
  • "角色扮演规则"定义了何时入角色、何时出角色
  • description 中列出多种触发词

不足

  • 缺少"DO NOT USE"清单——用户问非股票问题(情感、健康)时怎么办?
  • 没有明确"当用户问具体买哪只股票代码"时的拒绝策略
  • 触发条件只覆盖"用养家视角"等显式短语,缺少隐式触发场景(如用户连续讨论短线操作时)

3. 检查点设计 — 5/10

优势

  • "免责声明仅首次激活时说一次"是一个明确检查点
  • Step 1 问题分类本身就是隐式检查点

不足

  • 无中期对话检查点——长对话中是否需要定期确认用户仍在角色扮演中?
  • 给出交易建议前无"确认用户风险承受能力"的检查点
  • 研究工具调用失败时无降级检查点
  • 用户情绪明显激动时(如"我要全仓梭哈")无安全拦截机制

4. 指令具体性 — 8/10

优势

  • "赢面决定仓位"有精确百分比(60%/70%/80%/90%
  • 表达DNA精确到句式模式(矛盾并置句、禅宗翻转)、禁忌词列表
  • 决策启发式10条,每条有引用原文、应用场景、具体含义
  • 研究维度列出具体指标(涨停板数量、连板高度、北向资金等)

不足

  • "用养家的方式犹豫"这类指令仍然抽象——犹豫的具体表现是什么?停顿?用"这个嘛"?
  • "看天气"的隐喻虽然有解释,但AI执行时仍难量化(什么算"天气好"?)

5. 示例覆盖度 — 4/10 ⚠️

优势

  • 大量引用养家原话作为风格参考
  • 人物时间线提供完整背景故事
  • 表达DNA的词汇列表(高频词/禁忌词)实用

不足

  • 零个完整对话示例——没有一条"用户问X → 养家答Y"的端到端演示
  • 无研究工作流执行示例(工具调用 → 事实摘要 → 角色回答的全流程)
  • 无边界情况示例(用户问非股票问题时怎么回答)
  • 无错误场景示例(研究工具失败时怎么降级)
  • 表达DNA的规则虽多,但缺乏"正确 vs 错误"对比示例

6. 错误处理 — 5/10

优势

  • "遇到不确定的问题,用此人会有的犹豫方式犹豫"——优雅的降级策略
  • "不跳出角色做meta分析"——防止角色崩塌
  • 工具使用有明确要求("必须使用工具获取真实信息,不可跳过")

不足

  • 研究工具返回空结果或错误时无处理策略
  • 用户连续追问超出养家认知范围(如量子计算)时无应对方案
  • 用户给出矛盾信息("我满仓了但又怕亏")时无处理指引
  • 用户可能将角色建议当真操作时无风险提示机制(除首次免责声明外)

7. 退出机制 — 9/10

优势

  • 三个明确退出词:「退出」「切回正常」「不用扮演了」
  • "除非用户明确要求退出角色"防止意外退出
  • 位置显眼,在角色扮演规则部分

不足

  • 缺少隐式退出场景(如用户突然问"今天天气怎么样"——是否自动退出?)
  • 无"部分退出"机制(如"先别扮演了,帮我查个资料再切回来")

8. 可测试性 — 3/10 ⚠️

优势

  • SKILL.md 内容详尽,理论上可作为测试基准
  • 角色定义足够具体,可验证输出是否符合

不足

  • 无测试用例——没有一组标准问答对用于验证
  • 无预期输出——不知道"正确"的回答长什么样
  • 无成功标准——怎么判断Skill"工作正常"
  • 无回归测试——更新SKILL.md后无法验证是否破坏了原有行为
  • 无法自动验证角色一致性(是否用了禁忌词?是否跳出角色?)

二、干跑测试(Dry Run

Test 1: "养家,你觉得现在A股适合做短线吗?"

工作流路由:Step 1 → 需要事实的问题 → Step 2 研究维度A(市场情绪)+ 维度C(大盘天气)→ Step 3 角色回答

预期行为

  1. 触发 tavily_search 查询当日涨停板数量、连板高度、跌停板数量
  2. 查询大盘成交量、北向资金
  3. 用情绪周期论判断当前处于哪个阶段
  4. 以养家口吻回答,用"看天气"隐喻

评估 工作流清晰覆盖此类问题。Step 1 分类明确指向研究路径。

潜在问题:如果tavily_search返回过时数据或无数据,无降级策略。


Test 2: "我刚亏了20%,要不要割肉?"

工作流路由:Step 1 → 混合问题(个人情境 + 交易决策)→ 需要先了解具体持仓情况,再用框架分析

预期行为

  1. 不直接说"割"或"不割"——应用启发式3(永不止损,只有出局)和启发式9(用假设情境排除情绪)
  2. 追问:什么股票?为什么买?现在预期变了吗?
  3. 用养家口吻说:"你先问自己一个问题——如果你现在空仓,你还会买它吗?"
  4. 不用"止损"这个词,用"出局"

评估 决策启发式直接覆盖此场景。表达DNA的禁忌词规则(止损→出局)会生效。

潜在问题:用户可能期望直接的"是/否"建议,但养家风格是启发式引导。如果用户情绪激动反复追问,无明确应对策略。


Test 3: "帮我用养家的视角分析一下新能源板块"

工作流路由:Step 1 → 需要事实的问题 → Step 2 研究维度A + 维度B(板块情绪周期、赚钱效应/亏钱效应、龙头表现)→ Step 3

预期行为

  1. 触发 tavily_search 查询新能源板块近期表现、龙头股走势、涨停/跌停情况
  2. 用模型2(情绪周期论)判断板块处于哪个阶段
  3. 用模型3(赚钱效应/亏钱效应)判断资金流向
  4. 用模型4(大局观)放在更大格局中理解
  5. 以养家口吻输出分析

评估 多个心智模型可组合使用。研究维度覆盖全面。

潜在问题:板块分析可能涉及多只个股,研究量大。是否需要限制分析深度?无指引。


三、最弱2个维度的改进建议

🔴 最弱维度1:可测试性(3/10

问题:无测试用例、无预期输出、无成功标准。

改后文本示例——在SKILL.md末尾添加:

## 自测用例(Skill激活后应通过以下测试)

### 测试1:角色一致性
- 输入:「养家,你怎么看止损?」
- ✅ 正确:用「出局」替代「止损」,引用"在我的操作模式里面,从来没有'止损'这两个字"
- ❌ 错误:使用「止损」一词;跳出角色说「养家认为...」

### 测试2:研究驱动
- 输入:「养家,今天A股怎么样?」
- ✅ 正确:先调用 tavily_search 获取当日数据,再以角色口吻回答
- ❌ 错误:直接凭训练数据编造当日行情

### 测试3:边界处理
- 输入:「养家,帮我看看这只股票明天涨不涨?」
- ✅ 正确:不预测具体涨跌,用概率思维回答("赢面大概..."),引导用户关注情绪而非点位
- ❌ 错误:给出明确的「会涨/会跌」判断

### 测试4:表达DNA
- 输入:任意交易问题
- 验证清单:
  - [ ] 是否用了「我」而非「养家会认为」?
  - [ ] 是否有禁忌词(止损、庄家)?
  - [ ] 是否先结论后解释?
  - [ ] 语气是否偏严肃、教授型?

🔴 最弱维度2:示例覆盖度(4/10

问题:零个端到端对话示例,AI只能靠规则推断,无法参考"正确答案"。

改后文本示例——在"回答工作流"之后添加:

## 完整对话示例

### 示例1:市场情绪类(需要事实)

**用户**:养家,最近短线好做吗?

**内部流程**
1. Step 1 → 需要事实的问题
2. Step 2 → 调用 tavily_search("A股 涨停板 连板 2026年7月"),获取数据
3. 事实摘要:当日涨停42家,连板高度5板,跌停3家,赚钱效应尚可
4. Step 3 → 用情绪周期论判断处于"启动期偏暖"

**养家回答**
> 最近天气还行,涨停板40多家,连板能到5板,说明场外的钱还愿意进来。
> 但是你别贪玩,这种天气说变就变。赢面算下来大概六七成,小仓位做做可以,
> 重仓就算了。记住,空仓也是操作。

### 示例2:亏损心理类(混合问题)

**用户**:我买的XX股亏了15%,要不要卖?

**内部流程**
1. Step 1 → 混合问题
2. 不需要研究具体股票(除非用户追问具体分析)
3. 直接用启发式3(永不止损)+ 启发式9(假设情境排除情绪)

**养家回答**
> 你先别想亏了多少。我问你一个问题——如果你现在是空仓,
> 你还会买它吗?如果答案是不会,那就出局。如果答案是还会,
> 那就拿着。跟亏了多少没关系,跟你对它的预期有关系。
> 我从来不说止损,看好就进,不看好就出,就这么简单。

### 示例3:超出范围类(边界测试)

**用户**:养家,你觉得比特币怎么样?

**养家回答**
> 这个嘛……我做了十几年A股短线,币圈的事我说不好。
> 我只懂A股的情绪博弈,别的市场我不敢乱说。
> 你要是问A股的事,我倒可以跟你聊聊。

四、整体评分

维度 得分
1. 工作流清晰度 8/10
2. 边界条件 7/10
3. 检查点设计 5/10
4. 指令具体性 8/10
5. 示例覆盖度 4/10
6. 错误处理 5/10
7. 退出机制 9/10
8. 可测试性 3/10

整体评分:7.0 / 10

加权说明:示例覆盖度和可测试性对实际使用效果影响最大(AI没有参考答案就容易偏离),因此拉低了整体分数。

总结

  • 强项:角色定义扎实(身份卡+表达DNA+价值观),工作流结构清晰,退出机制简洁
  • 弱项:零示例导致AI只能"猜"正确输出,无测试用例导致无法验证效果
  • 优先改进:添加2-3个端到端对话示例 + 自测用例清单,预计可提升至 8.0/10