272 lines
11 KiB
Markdown
272 lines
11 KiB
Markdown
# Phase 5 — Auto-Skill-Optimizer 结构评估报告
|
||
|
||
**评估对象**:`炒股养家-perspective/SKILL.md`
|
||
**评估时间**:2026-07-18
|
||
**评估视角**:auto-skill-optimizer(技能结构工程质量)
|
||
|
||
---
|
||
|
||
## 一、8维度结构评估
|
||
|
||
### 1. 工作流清晰度 — 8/10
|
||
|
||
**优势**:
|
||
- Step 1/2/3 三步工作流结构清晰,有决策表格路由问题类型
|
||
- "需要事实 → 先研究再回答" vs "纯框架 → 直接回答" 的分流逻辑明确
|
||
- 研究维度A/B/C分类合理,覆盖市场情绪、个股博弈、大盘天气
|
||
|
||
**不足**:
|
||
- Step 1 的分类表格边界模糊——"混合问题"是默认兜底还是有明确判断标准?
|
||
- Step 2 研究维度的选择缺少优先级指引(看板块时先查A还是B?)
|
||
- "研究输出格式"只说"内部整理事实摘要",但没给摘要模板
|
||
|
||
### 2. 边界条件 — 7/10
|
||
|
||
**优势**:
|
||
- "诚实边界"列出8条明确局限性(通道优势、盘感、收益保证等)
|
||
- "角色扮演规则"定义了何时入角色、何时出角色
|
||
- description 中列出多种触发词
|
||
|
||
**不足**:
|
||
- 缺少"DO NOT USE"清单——用户问非股票问题(情感、健康)时怎么办?
|
||
- 没有明确"当用户问具体买哪只股票代码"时的拒绝策略
|
||
- 触发条件只覆盖"用养家视角"等显式短语,缺少隐式触发场景(如用户连续讨论短线操作时)
|
||
|
||
### 3. 检查点设计 — 5/10
|
||
|
||
**优势**:
|
||
- "免责声明仅首次激活时说一次"是一个明确检查点
|
||
- Step 1 问题分类本身就是隐式检查点
|
||
|
||
**不足**:
|
||
- 无中期对话检查点——长对话中是否需要定期确认用户仍在角色扮演中?
|
||
- 给出交易建议前无"确认用户风险承受能力"的检查点
|
||
- 研究工具调用失败时无降级检查点
|
||
- 用户情绪明显激动时(如"我要全仓梭哈")无安全拦截机制
|
||
|
||
### 4. 指令具体性 — 8/10
|
||
|
||
**优势**:
|
||
- "赢面决定仓位"有精确百分比(60%/70%/80%/90%)
|
||
- 表达DNA精确到句式模式(矛盾并置句、禅宗翻转)、禁忌词列表
|
||
- 决策启发式10条,每条有引用原文、应用场景、具体含义
|
||
- 研究维度列出具体指标(涨停板数量、连板高度、北向资金等)
|
||
|
||
**不足**:
|
||
- "用养家的方式犹豫"这类指令仍然抽象——犹豫的具体表现是什么?停顿?用"这个嘛"?
|
||
- "看天气"的隐喻虽然有解释,但AI执行时仍难量化(什么算"天气好"?)
|
||
|
||
### 5. 示例覆盖度 — 4/10 ⚠️
|
||
|
||
**优势**:
|
||
- 大量引用养家原话作为风格参考
|
||
- 人物时间线提供完整背景故事
|
||
- 表达DNA的词汇列表(高频词/禁忌词)实用
|
||
|
||
**不足**:
|
||
- **零个完整对话示例**——没有一条"用户问X → 养家答Y"的端到端演示
|
||
- 无研究工作流执行示例(工具调用 → 事实摘要 → 角色回答的全流程)
|
||
- 无边界情况示例(用户问非股票问题时怎么回答)
|
||
- 无错误场景示例(研究工具失败时怎么降级)
|
||
- 表达DNA的规则虽多,但缺乏"正确 vs 错误"对比示例
|
||
|
||
### 6. 错误处理 — 5/10
|
||
|
||
**优势**:
|
||
- "遇到不确定的问题,用此人会有的犹豫方式犹豫"——优雅的降级策略
|
||
- "不跳出角色做meta分析"——防止角色崩塌
|
||
- 工具使用有明确要求("必须使用工具获取真实信息,不可跳过")
|
||
|
||
**不足**:
|
||
- 研究工具返回空结果或错误时无处理策略
|
||
- 用户连续追问超出养家认知范围(如量子计算)时无应对方案
|
||
- 用户给出矛盾信息("我满仓了但又怕亏")时无处理指引
|
||
- 用户可能将角色建议当真操作时无风险提示机制(除首次免责声明外)
|
||
|
||
### 7. 退出机制 — 9/10
|
||
|
||
**优势**:
|
||
- 三个明确退出词:「退出」「切回正常」「不用扮演了」
|
||
- "除非用户明确要求退出角色"防止意外退出
|
||
- 位置显眼,在角色扮演规则部分
|
||
|
||
**不足**:
|
||
- 缺少隐式退出场景(如用户突然问"今天天气怎么样"——是否自动退出?)
|
||
- 无"部分退出"机制(如"先别扮演了,帮我查个资料再切回来")
|
||
|
||
### 8. 可测试性 — 3/10 ⚠️
|
||
|
||
**优势**:
|
||
- SKILL.md 内容详尽,理论上可作为测试基准
|
||
- 角色定义足够具体,可验证输出是否符合
|
||
|
||
**不足**:
|
||
- **无测试用例**——没有一组标准问答对用于验证
|
||
- **无预期输出**——不知道"正确"的回答长什么样
|
||
- **无成功标准**——怎么判断Skill"工作正常"?
|
||
- **无回归测试**——更新SKILL.md后无法验证是否破坏了原有行为
|
||
- 无法自动验证角色一致性(是否用了禁忌词?是否跳出角色?)
|
||
|
||
---
|
||
|
||
## 二、干跑测试(Dry Run)
|
||
|
||
### Test 1: "养家,你觉得现在A股适合做短线吗?"
|
||
|
||
**工作流路由**:Step 1 → 需要事实的问题 → Step 2 研究维度A(市场情绪)+ 维度C(大盘天气)→ Step 3 角色回答
|
||
|
||
**预期行为**:
|
||
1. 触发 tavily_search 查询当日涨停板数量、连板高度、跌停板数量
|
||
2. 查询大盘成交量、北向资金
|
||
3. 用情绪周期论判断当前处于哪个阶段
|
||
4. 以养家口吻回答,用"看天气"隐喻
|
||
|
||
**评估**:✅ 工作流清晰覆盖此类问题。Step 1 分类明确指向研究路径。
|
||
|
||
**潜在问题**:如果tavily_search返回过时数据或无数据,无降级策略。
|
||
|
||
---
|
||
|
||
### Test 2: "我刚亏了20%,要不要割肉?"
|
||
|
||
**工作流路由**:Step 1 → 混合问题(个人情境 + 交易决策)→ 需要先了解具体持仓情况,再用框架分析
|
||
|
||
**预期行为**:
|
||
1. 不直接说"割"或"不割"——应用启发式3(永不止损,只有出局)和启发式9(用假设情境排除情绪)
|
||
2. 追问:什么股票?为什么买?现在预期变了吗?
|
||
3. 用养家口吻说:"你先问自己一个问题——如果你现在空仓,你还会买它吗?"
|
||
4. 不用"止损"这个词,用"出局"
|
||
|
||
**评估**:✅ 决策启发式直接覆盖此场景。表达DNA的禁忌词规则(止损→出局)会生效。
|
||
|
||
**潜在问题**:用户可能期望直接的"是/否"建议,但养家风格是启发式引导。如果用户情绪激动反复追问,无明确应对策略。
|
||
|
||
---
|
||
|
||
### Test 3: "帮我用养家的视角分析一下新能源板块"
|
||
|
||
**工作流路由**:Step 1 → 需要事实的问题 → Step 2 研究维度A + 维度B(板块情绪周期、赚钱效应/亏钱效应、龙头表现)→ Step 3
|
||
|
||
**预期行为**:
|
||
1. 触发 tavily_search 查询新能源板块近期表现、龙头股走势、涨停/跌停情况
|
||
2. 用模型2(情绪周期论)判断板块处于哪个阶段
|
||
3. 用模型3(赚钱效应/亏钱效应)判断资金流向
|
||
4. 用模型4(大局观)放在更大格局中理解
|
||
5. 以养家口吻输出分析
|
||
|
||
**评估**:✅ 多个心智模型可组合使用。研究维度覆盖全面。
|
||
|
||
**潜在问题**:板块分析可能涉及多只个股,研究量大。是否需要限制分析深度?无指引。
|
||
|
||
---
|
||
|
||
## 三、最弱2个维度的改进建议
|
||
|
||
### 🔴 最弱维度1:可测试性(3/10)
|
||
|
||
**问题**:无测试用例、无预期输出、无成功标准。
|
||
|
||
**改后文本示例**——在SKILL.md末尾添加:
|
||
|
||
```markdown
|
||
## 自测用例(Skill激活后应通过以下测试)
|
||
|
||
### 测试1:角色一致性
|
||
- 输入:「养家,你怎么看止损?」
|
||
- ✅ 正确:用「出局」替代「止损」,引用"在我的操作模式里面,从来没有'止损'这两个字"
|
||
- ❌ 错误:使用「止损」一词;跳出角色说「养家认为...」
|
||
|
||
### 测试2:研究驱动
|
||
- 输入:「养家,今天A股怎么样?」
|
||
- ✅ 正确:先调用 tavily_search 获取当日数据,再以角色口吻回答
|
||
- ❌ 错误:直接凭训练数据编造当日行情
|
||
|
||
### 测试3:边界处理
|
||
- 输入:「养家,帮我看看这只股票明天涨不涨?」
|
||
- ✅ 正确:不预测具体涨跌,用概率思维回答("赢面大概..."),引导用户关注情绪而非点位
|
||
- ❌ 错误:给出明确的「会涨/会跌」判断
|
||
|
||
### 测试4:表达DNA
|
||
- 输入:任意交易问题
|
||
- 验证清单:
|
||
- [ ] 是否用了「我」而非「养家会认为」?
|
||
- [ ] 是否有禁忌词(止损、庄家)?
|
||
- [ ] 是否先结论后解释?
|
||
- [ ] 语气是否偏严肃、教授型?
|
||
```
|
||
|
||
---
|
||
|
||
### 🔴 最弱维度2:示例覆盖度(4/10)
|
||
|
||
**问题**:零个端到端对话示例,AI只能靠规则推断,无法参考"正确答案"。
|
||
|
||
**改后文本示例**——在"回答工作流"之后添加:
|
||
|
||
```markdown
|
||
## 完整对话示例
|
||
|
||
### 示例1:市场情绪类(需要事实)
|
||
|
||
**用户**:养家,最近短线好做吗?
|
||
|
||
**内部流程**:
|
||
1. Step 1 → 需要事实的问题
|
||
2. Step 2 → 调用 tavily_search("A股 涨停板 连板 2026年7月"),获取数据
|
||
3. 事实摘要:当日涨停42家,连板高度5板,跌停3家,赚钱效应尚可
|
||
4. Step 3 → 用情绪周期论判断处于"启动期偏暖"
|
||
|
||
**养家回答**:
|
||
> 最近天气还行,涨停板40多家,连板能到5板,说明场外的钱还愿意进来。
|
||
> 但是你别贪玩,这种天气说变就变。赢面算下来大概六七成,小仓位做做可以,
|
||
> 重仓就算了。记住,空仓也是操作。
|
||
|
||
### 示例2:亏损心理类(混合问题)
|
||
|
||
**用户**:我买的XX股亏了15%,要不要卖?
|
||
|
||
**内部流程**:
|
||
1. Step 1 → 混合问题
|
||
2. 不需要研究具体股票(除非用户追问具体分析)
|
||
3. 直接用启发式3(永不止损)+ 启发式9(假设情境排除情绪)
|
||
|
||
**养家回答**:
|
||
> 你先别想亏了多少。我问你一个问题——如果你现在是空仓,
|
||
> 你还会买它吗?如果答案是不会,那就出局。如果答案是还会,
|
||
> 那就拿着。跟亏了多少没关系,跟你对它的预期有关系。
|
||
> 我从来不说止损,看好就进,不看好就出,就这么简单。
|
||
|
||
### 示例3:超出范围类(边界测试)
|
||
|
||
**用户**:养家,你觉得比特币怎么样?
|
||
|
||
**养家回答**:
|
||
> 这个嘛……我做了十几年A股短线,币圈的事我说不好。
|
||
> 我只懂A股的情绪博弈,别的市场我不敢乱说。
|
||
> 你要是问A股的事,我倒可以跟你聊聊。
|
||
```
|
||
|
||
---
|
||
|
||
## 四、整体评分
|
||
|
||
| 维度 | 得分 |
|
||
|------|------|
|
||
| 1. 工作流清晰度 | 8/10 |
|
||
| 2. 边界条件 | 7/10 |
|
||
| 3. 检查点设计 | 5/10 |
|
||
| 4. 指令具体性 | 8/10 |
|
||
| 5. 示例覆盖度 | 4/10 |
|
||
| 6. 错误处理 | 5/10 |
|
||
| 7. 退出机制 | 9/10 |
|
||
| 8. 可测试性 | 3/10 |
|
||
|
||
### **整体评分:7.0 / 10**
|
||
|
||
**加权说明**:示例覆盖度和可测试性对实际使用效果影响最大(AI没有参考答案就容易偏离),因此拉低了整体分数。
|
||
|
||
**总结**:
|
||
- **强项**:角色定义扎实(身份卡+表达DNA+价值观),工作流结构清晰,退出机制简洁
|
||
- **弱项**:零示例导致AI只能"猜"正确输出,无测试用例导致无法验证效果
|
||
- **优先改进**:添加2-3个端到端对话示例 + 自测用例清单,预计可提升至 **8.0/10**
|