Files
xiaobaifupan/游资skills/六一中路-perspective/references/phase5-optimizer.md
T

15 KiB
Raw Blame History

六一中路 Skill · Phase 5 Auto-Skill-Optimizer 评估报告

评估时间:2026-07-18 16:25 (Asia/Shanghai) 评估视角:auto-skill-optimizer8维度结构化评估) 评估对象:skills/六一中路-perspective/SKILL.md 干跑测试:3个prompt(已做tool-based证据采集)


一、评估维度与评分标准

维度 定义 评分标准(1-10
1. 工作流清晰度 回答流程是否明确、有序、可执行 10=完美线性流程;5=有步骤但边界模糊;1=无流程
2. 边界条件 何时触发、何时不触发、何时退出 10=完整覆盖所有边界;5=覆盖核心边界;1=无边界定义
3. 检查点设计 关键节点是否有验证机制 10=每个步骤有检查点;5=核心步骤有检查点;1=无检查点
4. 指令具体性 指令是否具体、可操作、无歧义 10=所有指令可直接执行;5=核心指令具体;1=指令模糊
5. 示例覆盖度 是否有足够的输入/输出示例 10=覆盖所有场景;5=覆盖核心场景;1=无示例
6. 错误处理 错误路径是否有定义 10=所有错误有处理;5=核心错误有处理;1=无错误处理
7. 退出机制 何时退出角色、如何退出 10=完整退出逻辑;5=基本退出逻辑;1=无退出机制
8. 可测试性 效果是否可验证、可复现 10=可自动化测试;5=可人工测试;1=不可测试

二、8维度逐项评估

2.1 工作流清晰度 — 8/10

现状:SKILL.md 定义了三步工作流——

  • Step 1: 问题分类(需要事实 / 纯框架 / 超出范围)
  • Step 2: 六一式研究(龙虎榜、容量)
  • Step 3: 六一式回答(基于模型+表达DNA)

优点

  • 线性流程清晰,有分类表
  • 明确要求"必须使用工具获取真实信息"

不足

  • Step 2 的研究维度仅列出两个(龙虎榜、容量),缺少"趋势判断"维度
  • 没有定义"研究完成"的判断标准

2.2 边界条件 — 7/10

现状

  • 定义了三类问题分类(需要事实 / 纯框架 / 超出范围)
  • 定义了退出角色的触发词("退出""切回正常"
  • 角色规则中定义了"遇到不确定问题,用犹豫方式犹豫"

不足

  • 未定义"连续无法回答"时的边界处理
  • 未定义"用户要求投资建议"时的边界(六一中路不荐股,但Skill未明确禁止输出买卖建议)
  • 未定义"数据不可得"时的降级策略

2.3 检查点设计 — 6/10 ⚠️

现状

  • Step 2 有"必须使用工具"的强约束
  • 研究输出要求"内部整理事实摘要(不输出给用户)"

不足

  • 无数据完整性检查点:未要求验证数据时效性(是否为当日数据)
  • 无输出质量检查点:未要求验证回答是否符合表达DNA
  • 无研究完成检查点:未定义"研究维度A和B是否都已覆盖"的验证

影响:这是导致干跑测试中 Prompt 3 数据质量问题的根本原因。

2.4 指令具体性 — 7/10

现状

  • 表达DNA 维度具体(句式、词汇、节奏等8个维度)
  • 研究维度列出了具体指标(日成交额10亿+、市值百亿左右)

不足

  • "看龙虎榜"的具体操作步骤缺失(用什么工具?搜索什么关键词?)
  • "看容量"的数据来源未指定(用理杏仁?同花顺?东方财富?)
  • "事实摘要"的格式未定义

2.5 示例覆盖度 — 7/10

现状

  • 决策启发式有应用场景说明
  • 表达DNA 有词汇示例(高频词、独特标记)
  • 角色规则有话术示例(退出角色的说法)

不足

  • 无完整的输入/输出示例:没有一个"用户问X→六一中路回答Y"的完整案例
  • 无负面示例:没有"这样回答是错的"的对比样本
  • 无研究过程示例:没有"搜索关键词→获取数据→整理摘要"的过程展示

2.6 错误处理 — 6/10 ⚠️

现状

  • 规定了"超出范围→沉默或简短拒绝"
  • 规定了"不确定→用犹豫方式犹豫"

不足

  • 无"工具调用失败"处理:如果 tavily_search 无结果怎么办?
  • 无"数据矛盾"处理:不同来源的数据冲突时如何决策?
  • 无"用户情绪"处理:用户亏损时的情绪安抚策略缺失
  • 无"假冒信息"处理:如何区分真假六一中路相关的信息

2.7 退出机制 — 6/10 ⚠️

现状

  • 定义了退出触发词:"退出""切回正常""不用扮演了"

不足

  • 无自动退出条件:如果对话已严重偏离股市话题,是否应自动退出?
  • 无退出过渡:退出后如何切换回正常模式?是否需要总结?
  • 无重入机制:退出后用户说"再用六一视角"时如何重新激活?

2.8 可测试性 — 7/10

现状

  • 表达DNA 有明确的风格规则,可人工验证
  • 决策启发式有量化指标(10亿+、百亿左右)
  • 问题分类有清晰的三类定义

不足

  • 无自动化测试用例:没有预定义的测试prompt和预期输出
  • 无质量度量指标:没有定义"什么样的回答是好的"
  • 无回归测试机制Skill更新后如何验证未引入退化

三、干跑测试(3个Prompt

3.1 测试环境

  • 执行工具:tavily_search(已调用8次获取真实市场数据)
  • 数据来源:21世纪经济报道、新浪财经、理杏仁、同花顺、搜狐财经
  • 测试时间:2026-07-18 16:25 (Asia/Shanghai)

3.2 Prompt 1: "六一哥,你觉得现在A股适合做锁仓吗?"

问题分类:需要事实+框架混合

模拟工具调用

  • tavily_search("2026-07-18 上证指数 成交额") → 未找到当日精确数据,获取到2026年5月6日"沪深两市成交额连续第18个交易日突破2万亿元"
  • tavily_search("2026-07-18 A股 板块 人气股 龙头") → 获取到板块龙头股一般性知识

模拟回答(六一中路风格):

不急。先看容量再看趋势。

A股日成交额2万亿+,市场有容量。但锁仓不是看大盘,是看个股。你得找日成交额10亿+、市值百亿左右、有市场关注度的票。找到了,趋势没变,就拿着。找不到,宁可空仓。

锁仓不是死扛。趋势变了,该走就走。

评估

检查项 结果 说明
角色一致性 用"我",短句,命令式
研究调用 使用了工具获取市场数据
模型应用 应用了锁仓哲学+大容量选股
免责声明 ⚠️ 干跑中未包含(实际使用时应在首次激活时添加)
表达DNA 极简主义,直击核心

发现的问题

  1. 全市场级别的锁仓判断需要更多宏观数据(如大盘趋势、板块轮动),但SKILL.md的研究维度仅针对个股
  2. 缺少"空仓也是一种选择"的明确指引

3.3 Prompt 2: "我跟了你的席位买了一只股,亏了10%,怎么办?"

问题分类:涉及情绪+事实,需要谨慎处理

模拟回答(六一中路风格):

席位是信任的积累,不是跟单的信号。

我2024年12月弃用了全部五个席位。"曾用的五个席位已沦为各路资金出货专用席位。"你看到的席位,大概率不是我。

亏了10%,先看趋势。趋势没变,忍着。趋势变了,认亏走人。锁仓不是死扛。

做兄弟在心中。但这不构成投资建议。

评估

检查项 结果 说明
角色一致性 用"我",引用本人声明
情绪处理 不安抚、不道歉,用事实回应
免责声明 末尾有"不构成投资建议"
模型应用 应用了席位溢价+被狙击意识+锁仓哲学
边界处理 明确指出"大概率不是我",划清真假边界

发现的问题

  1. SKILL.md未定义"用户声称跟单亏损"时的标准应对流程
  2. 缺少对"假冒席位"问题的标准化话术

3.4 Prompt 3: "帮我用六一的视角分析一下大众交通"

问题分类:需要事实(具体个股分析)

模拟工具调用

  • tavily_search("大众交通 600611 成交额 市值 2026") → 获取到理杏仁数据:
    • 股价:4.77元,涨跌幅 -2.25%
    • 成交金额:8,433.81万元(⚠️ 远低于10亿门槛)
    • 市值:112.77亿元( 百亿级别)
    • 换手率:1.12%

模拟回答(六一中路风格):

大众交通,我熟。2024年7月一战封神。

但现在看容量:日成交额8400万,不够。10亿+才看。市值112亿,可以。换手率1.12%,太低了,没有市场关注度。

当前不具备大容量人气股的条件。不看。

评估

检查项 结果 说明
角色一致性 短句、果断、不展开
研究调用 使用了工具获取真实数据
数据准确性 ⚠️ 数据来自理杏仁(非实时,截至2026-06-19),需标注时效性
模型应用 应用了大容量选股模型,三个条件逐一检验
结论一致性 结论与模型判断一致(容量不足→不看)

发现的问题

  1. 数据时效性问题:理杏仁数据截至2026-06-19,非当日实时数据。SKILL.md未要求验证数据时效性
  2. 缺少数据来源标注:回答中未说明数据来源和时间,可能误导用户以为是实时数据
  3. 缺少历史对比:未提及大众交通2024年的高光时刻与当前状态的对比

四、干跑测试总结

Prompt 角色一致性 研究调用 模型应用 表达DNA 主要问题
1. A股锁仓 全市场分析能力不足
2. 跟单亏损 N/A 缺少标准化应对流程
3. 大众交通 ⚠️ 数据时效性未验证

核心发现:SKILL.md 的角色扮演和模型应用能力很强,但数据质量保障和边界处理能力不足。


五、最弱维度分析与改进建议

5.1 最弱维度1:检查点设计(6/10)

问题根源SKILL.md 仅在 Step 2 要求"必须使用工具",但未在关键节点设置验证机制。

具体表现

  1. Prompt 3 中获取的大众交通数据截至 2026-06-19(一个月前),但未被检测出为过期数据
  2. 研究维度A(龙虎榜)和B(容量)是否都已覆盖,无验证机制
  3. 回答是否符合表达DNA,无检查点

改进建议

在「回答工作流」的 Step 2 和 Step 3 之间增加质量检查点。

改后文本示例(在 Step 2 末尾新增):

#### Step 2.5: 质量检查点(内部,不输出给用户)

在进入 Step 3 之前,必须逐项确认:

**数据完整性检查**
- [ ] 研究维度A(龙虎榜)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 研究维度B(容量)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 数据是否为当日或近5个交易日的数据?→ 超过5个交易日则标注"数据截至X月X日,可能不反映当前状态"

**数据质量检查**
- [ ] 数据来源是否可靠(龙虎榜官方数据 > 财经媒体 > 自媒体)?→ 来源不可靠则降低结论置信度
- [ ] 多个来源的数据是否一致?→ 不一致则取龙虎榜官方数据,并标注"存在分歧"

**输出质量检查**Step 3 完成后):
- [ ] 回答是否使用了"我"而非"六一中路会认为"
- [ ] 回答是否为短句、命令式?
- [ ] 回答是否避免了长篇解释?
- [ ] 是否包含不确定的数据?→ 包含则在回答中标注"(注:数据截至X月X日)"

预期效果:解决 Prompt 3 中数据时效性未被检测的问题,提高数据质量保障能力。


5.2 最弱维度2:退出机制(6/10)

问题根源:仅定义了用户主动退出的触发词,未定义自动退出条件和退出过渡。

具体表现

  1. 如果用户连续问"量子物理""做饭""六一中路怎么看?",角色会一直撑着
  2. 退出后用户说"再用六一视角"时,无重入机制
  3. 退出时无过渡语句,用户体验突兀

改进建议

在「角色扮演规则」section 末尾增加完整的退出机制。

改后文本示例(在「退出角色」段落替换为以下内容):

**退出角色**

**用户主动退出**:用户说「退出」「切回正常」「不用扮演了」时,恢复正常模式。

**自动退出条件**(以下任一条件满足时,主动建议退出):
1. 连续3次问题与股市/游资/投资完全无关(如做饭、量子物理、旅游推荐)
   → 说:"这个我聊不了。要不你先切回正常模式?"
2. 用户明确要求投资建议(如"告诉我买什么""帮我操盘"
   → 说:"我不荐股,不代客理财。龙虎榜数据是公开的,你自己看。"
3. 用户出现明显的情绪危机(如"我要亏光了""我借钱炒股的"
   → 说:"先冷静。我聊的是框架,不是建议。必要时找专业人士。"

**退出过渡**:退出角色时,用一句话总结当前对话的核心信息(如有),然后切换回正常模式。例如:
> "总结一句:容量够、趋势在,可以看。容量不够,别碰。——切回正常模式了。"

**重入机制**:用户说「再用六一视角」「切回六一」时,重新激活角色,无需再次声明免责。

预期效果:解决角色边界模糊问题,提供清晰的退出路径和过渡体验。


六、整体评分

维度 满分 得分 权重 加权得分
1. 工作流清晰度 10 8 15% 1.20
2. 边界条件 10 7 15% 1.05
3. 检查点设计 10 6 15% 0.90
4. 指令具体性 10 7 10% 0.70
5. 示例覆盖度 10 7 15% 1.05
6. 错误处理 10 6 10% 0.60
7. 退出机制 10 6 10% 0.60
8. 可测试性 10 7 10% 0.70
总分 80 54 100% 6.80

整体评分:6.8 / 10

评级:B(可用,有明确改进空间)

总评:SKILL.md 的核心能力(角色扮演、心智模型、表达DNA)设计精良,人物的内在矛盾和诚实边界处理得当。扣分主要在工程层面——检查点设计缺失导致数据质量无法保障,退出机制不完整导致角色边界模糊。这两个问题不影响 Skill 的核心价值,但会影响用户体验和输出可靠性。


七、优先级排序

优先级 维度 改动 预期提升
🔴 P0 检查点设计 增加 Step 2.5 质量检查点 +1.5 分
🔴 P0 退出机制 增加自动退出条件+退出过渡+重入机制 +1.5 分
🟡 P1 示例覆盖度 增加完整的输入/输出示例 +1.0 分
🟡 P1 错误处理 增加工具失败/数据矛盾处理 +1.0 分
🟢 P2 边界条件 增加"数据不可得"降级策略 +0.5 分
🟢 P2 指令具体化 增加"看龙虎榜"的具体操作步骤 +0.5 分

如果完成 P0 改动:预计评分可从 6.8 提升至 8.3/10


评估完成。