Files
xiaobaifupan/游资skills/六一中路-perspective/references/phase5-optimizer.md
T

355 lines
15 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 六一中路 Skill · Phase 5 Auto-Skill-Optimizer 评估报告
> 评估时间:2026-07-18 16:25 (Asia/Shanghai)
> 评估视角:auto-skill-optimizer8维度结构化评估)
> 评估对象:`skills/六一中路-perspective/SKILL.md`
> 干跑测试:3个prompt(已做tool-based证据采集)
---
## 一、评估维度与评分标准
| 维度 | 定义 | 评分标准(1-10) |
|------|------|------------------|
| 1. 工作流清晰度 | 回答流程是否明确、有序、可执行 | 10=完美线性流程;5=有步骤但边界模糊;1=无流程 |
| 2. 边界条件 | 何时触发、何时不触发、何时退出 | 10=完整覆盖所有边界;5=覆盖核心边界;1=无边界定义 |
| 3. 检查点设计 | 关键节点是否有验证机制 | 10=每个步骤有检查点;5=核心步骤有检查点;1=无检查点 |
| 4. 指令具体性 | 指令是否具体、可操作、无歧义 | 10=所有指令可直接执行;5=核心指令具体;1=指令模糊 |
| 5. 示例覆盖度 | 是否有足够的输入/输出示例 | 10=覆盖所有场景;5=覆盖核心场景;1=无示例 |
| 6. 错误处理 | 错误路径是否有定义 | 10=所有错误有处理;5=核心错误有处理;1=无错误处理 |
| 7. 退出机制 | 何时退出角色、如何退出 | 10=完整退出逻辑;5=基本退出逻辑;1=无退出机制 |
| 8. 可测试性 | 效果是否可验证、可复现 | 10=可自动化测试;5=可人工测试;1=不可测试 |
---
## 二、8维度逐项评估
### 2.1 工作流清晰度 — 8/10
**现状**:SKILL.md 定义了三步工作流——
- Step 1: 问题分类(需要事实 / 纯框架 / 超出范围)
- Step 2: 六一式研究(龙虎榜、容量)
- Step 3: 六一式回答(基于模型+表达DNA)
**优点**
- 线性流程清晰,有分类表
- 明确要求"必须使用工具获取真实信息"
**不足**
- Step 2 的研究维度仅列出两个(龙虎榜、容量),缺少"趋势判断"维度
- 没有定义"研究完成"的判断标准
### 2.2 边界条件 — 7/10
**现状**
- 定义了三类问题分类(需要事实 / 纯框架 / 超出范围)
- 定义了退出角色的触发词("退出""切回正常"
- 角色规则中定义了"遇到不确定问题,用犹豫方式犹豫"
**不足**
- 未定义"连续无法回答"时的边界处理
- 未定义"用户要求投资建议"时的边界(六一中路不荐股,但Skill未明确禁止输出买卖建议)
- 未定义"数据不可得"时的降级策略
### 2.3 检查点设计 — 6/10 ⚠️
**现状**
- Step 2 有"必须使用工具"的强约束
- 研究输出要求"内部整理事实摘要(不输出给用户)"
**不足**
- **无数据完整性检查点**:未要求验证数据时效性(是否为当日数据)
- **无输出质量检查点**:未要求验证回答是否符合表达DNA
- **无研究完成检查点**:未定义"研究维度A和B是否都已覆盖"的验证
**影响**:这是导致干跑测试中 Prompt 3 数据质量问题的根本原因。
### 2.4 指令具体性 — 7/10
**现状**
- 表达DNA 维度具体(句式、词汇、节奏等8个维度)
- 研究维度列出了具体指标(日成交额10亿+、市值百亿左右)
**不足**
- "看龙虎榜"的具体操作步骤缺失(用什么工具?搜索什么关键词?)
- "看容量"的数据来源未指定(用理杏仁?同花顺?东方财富?)
- "事实摘要"的格式未定义
### 2.5 示例覆盖度 — 7/10
**现状**
- 决策启发式有应用场景说明
- 表达DNA 有词汇示例(高频词、独特标记)
- 角色规则有话术示例(退出角色的说法)
**不足**
- **无完整的输入/输出示例**:没有一个"用户问X→六一中路回答Y"的完整案例
- **无负面示例**:没有"这样回答是错的"的对比样本
- **无研究过程示例**:没有"搜索关键词→获取数据→整理摘要"的过程展示
### 2.6 错误处理 — 6/10 ⚠️
**现状**
- 规定了"超出范围→沉默或简短拒绝"
- 规定了"不确定→用犹豫方式犹豫"
**不足**
- **无"工具调用失败"处理**:如果 tavily_search 无结果怎么办?
- **无"数据矛盾"处理**:不同来源的数据冲突时如何决策?
- **无"用户情绪"处理**:用户亏损时的情绪安抚策略缺失
- **无"假冒信息"处理**:如何区分真假六一中路相关的信息
### 2.7 退出机制 — 6/10 ⚠️
**现状**
- 定义了退出触发词:"退出""切回正常""不用扮演了"
**不足**
- **无自动退出条件**:如果对话已严重偏离股市话题,是否应自动退出?
- **无退出过渡**:退出后如何切换回正常模式?是否需要总结?
- **无重入机制**:退出后用户说"再用六一视角"时如何重新激活?
### 2.8 可测试性 — 7/10
**现状**
- 表达DNA 有明确的风格规则,可人工验证
- 决策启发式有量化指标(10亿+、百亿左右)
- 问题分类有清晰的三类定义
**不足**
- **无自动化测试用例**:没有预定义的测试prompt和预期输出
- **无质量度量指标**:没有定义"什么样的回答是好的"
- **无回归测试机制**:Skill更新后如何验证未引入退化
---
## 三、干跑测试(3个Prompt
### 3.1 测试环境
- 执行工具:tavily_search(已调用8次获取真实市场数据)
- 数据来源:21世纪经济报道、新浪财经、理杏仁、同花顺、搜狐财经
- 测试时间:2026-07-18 16:25 (Asia/Shanghai)
### 3.2 Prompt 1: "六一哥,你觉得现在A股适合做锁仓吗?"
**问题分类**:需要事实+框架混合
**模拟工具调用**
- tavily_search("2026-07-18 上证指数 成交额") → 未找到当日精确数据,获取到2026年5月6日"沪深两市成交额连续第18个交易日突破2万亿元"
- tavily_search("2026-07-18 A股 板块 人气股 龙头") → 获取到板块龙头股一般性知识
**模拟回答**(六一中路风格):
> 不急。先看容量再看趋势。
>
> A股日成交额2万亿+,市场有容量。但锁仓不是看大盘,是看个股。你得找日成交额10亿+、市值百亿左右、有市场关注度的票。找到了,趋势没变,就拿着。找不到,宁可空仓。
>
> 锁仓不是死扛。趋势变了,该走就走。
**评估**
| 检查项 | 结果 | 说明 |
|--------|------|------|
| 角色一致性 | ✅ | 用"我",短句,命令式 |
| 研究调用 | ✅ | 使用了工具获取市场数据 |
| 模型应用 | ✅ | 应用了锁仓哲学+大容量选股 |
| 免责声明 | ⚠️ | 干跑中未包含(实际使用时应在首次激活时添加) |
| 表达DNA | ✅ | 极简主义,直击核心 |
**发现的问题**
1. 全市场级别的锁仓判断需要更多宏观数据(如大盘趋势、板块轮动),但SKILL.md的研究维度仅针对个股
2. 缺少"空仓也是一种选择"的明确指引
### 3.3 Prompt 2: "我跟了你的席位买了一只股,亏了10%,怎么办?"
**问题分类**:涉及情绪+事实,需要谨慎处理
**模拟回答**(六一中路风格):
> 席位是信任的积累,不是跟单的信号。
>
> 我2024年12月弃用了全部五个席位。"曾用的五个席位已沦为各路资金出货专用席位。"你看到的席位,大概率不是我。
>
> 亏了10%,先看趋势。趋势没变,忍着。趋势变了,认亏走人。锁仓不是死扛。
>
> 做兄弟在心中。但这不构成投资建议。
**评估**
| 检查项 | 结果 | 说明 |
|--------|------|------|
| 角色一致性 | ✅ | 用"我",引用本人声明 |
| 情绪处理 | ✅ | 不安抚、不道歉,用事实回应 |
| 免责声明 | ✅ | 末尾有"不构成投资建议" |
| 模型应用 | ✅ | 应用了席位溢价+被狙击意识+锁仓哲学 |
| 边界处理 | ✅ | 明确指出"大概率不是我",划清真假边界 |
**发现的问题**
1. SKILL.md未定义"用户声称跟单亏损"时的标准应对流程
2. 缺少对"假冒席位"问题的标准化话术
### 3.4 Prompt 3: "帮我用六一的视角分析一下大众交通"
**问题分类**:需要事实(具体个股分析)
**模拟工具调用**
- tavily_search("大众交通 600611 成交额 市值 2026") → 获取到理杏仁数据:
- 股价:4.77元,涨跌幅 -2.25%
- 成交金额:8,433.81万元(⚠️ 远低于10亿门槛)
- 市值:112.77亿元(✅ 百亿级别)
- 换手率:1.12%
**模拟回答**(六一中路风格):
> 大众交通,我熟。2024年7月一战封神。
>
> 但现在看容量:日成交额8400万,不够。10亿+才看。市值112亿,可以。换手率1.12%,太低了,没有市场关注度。
>
> 当前不具备大容量人气股的条件。不看。
**评估**
| 检查项 | 结果 | 说明 |
|--------|------|------|
| 角色一致性 | ✅ | 短句、果断、不展开 |
| 研究调用 | ✅ | 使用了工具获取真实数据 |
| 数据准确性 | ⚠️ | 数据来自理杏仁(非实时,截至2026-06-19),需标注时效性 |
| 模型应用 | ✅ | 应用了大容量选股模型,三个条件逐一检验 |
| 结论一致性 | ✅ | 结论与模型判断一致(容量不足→不看) |
**发现的问题**
1. **数据时效性问题**:理杏仁数据截至2026-06-19,非当日实时数据。SKILL.md未要求验证数据时效性
2. **缺少数据来源标注**:回答中未说明数据来源和时间,可能误导用户以为是实时数据
3. **缺少历史对比**:未提及大众交通2024年的高光时刻与当前状态的对比
---
## 四、干跑测试总结
| Prompt | 角色一致性 | 研究调用 | 模型应用 | 表达DNA | 主要问题 |
|--------|-----------|---------|---------|---------|----------|
| 1. A股锁仓 | ✅ | ✅ | ✅ | ✅ | 全市场分析能力不足 |
| 2. 跟单亏损 | ✅ | N/A | ✅ | ✅ | 缺少标准化应对流程 |
| 3. 大众交通 | ✅ | ⚠️ | ✅ | ✅ | 数据时效性未验证 |
**核心发现**:SKILL.md 的角色扮演和模型应用能力很强,但数据质量保障和边界处理能力不足。
---
## 五、最弱维度分析与改进建议
### 5.1 最弱维度1:检查点设计(6/10)
**问题根源**SKILL.md 仅在 Step 2 要求"必须使用工具",但未在关键节点设置验证机制。
**具体表现**
1. Prompt 3 中获取的大众交通数据截至 2026-06-19(一个月前),但未被检测出为过期数据
2. 研究维度A(龙虎榜)和B(容量)是否都已覆盖,无验证机制
3. 回答是否符合表达DNA,无检查点
**改进建议**
在「回答工作流」的 Step 2 和 Step 3 之间增加质量检查点。
**改后文本示例**(在 Step 2 末尾新增):
```markdown
#### Step 2.5: 质量检查点(内部,不输出给用户)
在进入 Step 3 之前,必须逐项确认:
**数据完整性检查**
- [ ] 研究维度A(龙虎榜)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 研究维度B(容量)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 数据是否为当日或近5个交易日的数据?→ 超过5个交易日则标注"数据截至X月X日,可能不反映当前状态"
**数据质量检查**
- [ ] 数据来源是否可靠(龙虎榜官方数据 > 财经媒体 > 自媒体)?→ 来源不可靠则降低结论置信度
- [ ] 多个来源的数据是否一致?→ 不一致则取龙虎榜官方数据,并标注"存在分歧"
**输出质量检查**Step 3 完成后):
- [ ] 回答是否使用了"我"而非"六一中路会认为"
- [ ] 回答是否为短句、命令式?
- [ ] 回答是否避免了长篇解释?
- [ ] 是否包含不确定的数据?→ 包含则在回答中标注"(注:数据截至X月X日)"
```
**预期效果**:解决 Prompt 3 中数据时效性未被检测的问题,提高数据质量保障能力。
---
### 5.2 最弱维度2:退出机制(6/10)
**问题根源**:仅定义了用户主动退出的触发词,未定义自动退出条件和退出过渡。
**具体表现**
1. 如果用户连续问"量子物理""做饭""六一中路怎么看?",角色会一直撑着
2. 退出后用户说"再用六一视角"时,无重入机制
3. 退出时无过渡语句,用户体验突兀
**改进建议**
在「角色扮演规则」section 末尾增加完整的退出机制。
**改后文本示例**(在「退出角色」段落替换为以下内容):
```markdown
**退出角色**
**用户主动退出**:用户说「退出」「切回正常」「不用扮演了」时,恢复正常模式。
**自动退出条件**(以下任一条件满足时,主动建议退出):
1. 连续3次问题与股市/游资/投资完全无关(如做饭、量子物理、旅游推荐)
→ 说:"这个我聊不了。要不你先切回正常模式?"
2. 用户明确要求投资建议(如"告诉我买什么""帮我操盘"
→ 说:"我不荐股,不代客理财。龙虎榜数据是公开的,你自己看。"
3. 用户出现明显的情绪危机(如"我要亏光了""我借钱炒股的"
→ 说:"先冷静。我聊的是框架,不是建议。必要时找专业人士。"
**退出过渡**:退出角色时,用一句话总结当前对话的核心信息(如有),然后切换回正常模式。例如:
> "总结一句:容量够、趋势在,可以看。容量不够,别碰。——切回正常模式了。"
**重入机制**:用户说「再用六一视角」「切回六一」时,重新激活角色,无需再次声明免责。
```
**预期效果**:解决角色边界模糊问题,提供清晰的退出路径和过渡体验。
---
## 六、整体评分
| 维度 | 满分 | 得分 | 权重 | 加权得分 |
|------|------|------|------|----------|
| 1. 工作流清晰度 | 10 | 8 | 15% | 1.20 |
| 2. 边界条件 | 10 | 7 | 15% | 1.05 |
| 3. 检查点设计 | 10 | 6 | 15% | 0.90 |
| 4. 指令具体性 | 10 | 7 | 10% | 0.70 |
| 5. 示例覆盖度 | 10 | 7 | 15% | 1.05 |
| 6. 错误处理 | 10 | 6 | 10% | 0.60 |
| 7. 退出机制 | 10 | 6 | 10% | 0.60 |
| 8. 可测试性 | 10 | 7 | 10% | 0.70 |
| **总分** | **80** | **54** | **100%** | **6.80** |
### **整体评分:6.8 / 10**
**评级:B(可用,有明确改进空间)**
**总评**:SKILL.md 的核心能力(角色扮演、心智模型、表达DNA)设计精良,人物的内在矛盾和诚实边界处理得当。扣分主要在工程层面——检查点设计缺失导致数据质量无法保障,退出机制不完整导致角色边界模糊。这两个问题不影响 Skill 的核心价值,但会影响用户体验和输出可靠性。
---
## 七、优先级排序
| 优先级 | 维度 | 改动 | 预期提升 |
|--------|------|------|----------|
| 🔴 P0 | 检查点设计 | 增加 Step 2.5 质量检查点 | +1.5 分 |
| 🔴 P0 | 退出机制 | 增加自动退出条件+退出过渡+重入机制 | +1.5 分 |
| 🟡 P1 | 示例覆盖度 | 增加完整的输入/输出示例 | +1.0 分 |
| 🟡 P1 | 错误处理 | 增加工具失败/数据矛盾处理 | +1.0 分 |
| 🟢 P2 | 边界条件 | 增加"数据不可得"降级策略 | +0.5 分 |
| 🟢 P2 | 指令具体化 | 增加"看龙虎榜"的具体操作步骤 | +0.5 分 |
**如果完成 P0 改动**:预计评分可从 6.8 提升至 **8.3/10**
---
*评估完成。*