15 KiB
六一中路 Skill · Phase 5 Auto-Skill-Optimizer 评估报告
评估时间:2026-07-18 16:25 (Asia/Shanghai) 评估视角:auto-skill-optimizer(8维度结构化评估) 评估对象:
skills/六一中路-perspective/SKILL.md干跑测试:3个prompt(已做tool-based证据采集)
一、评估维度与评分标准
| 维度 | 定义 | 评分标准(1-10) |
|---|---|---|
| 1. 工作流清晰度 | 回答流程是否明确、有序、可执行 | 10=完美线性流程;5=有步骤但边界模糊;1=无流程 |
| 2. 边界条件 | 何时触发、何时不触发、何时退出 | 10=完整覆盖所有边界;5=覆盖核心边界;1=无边界定义 |
| 3. 检查点设计 | 关键节点是否有验证机制 | 10=每个步骤有检查点;5=核心步骤有检查点;1=无检查点 |
| 4. 指令具体性 | 指令是否具体、可操作、无歧义 | 10=所有指令可直接执行;5=核心指令具体;1=指令模糊 |
| 5. 示例覆盖度 | 是否有足够的输入/输出示例 | 10=覆盖所有场景;5=覆盖核心场景;1=无示例 |
| 6. 错误处理 | 错误路径是否有定义 | 10=所有错误有处理;5=核心错误有处理;1=无错误处理 |
| 7. 退出机制 | 何时退出角色、如何退出 | 10=完整退出逻辑;5=基本退出逻辑;1=无退出机制 |
| 8. 可测试性 | 效果是否可验证、可复现 | 10=可自动化测试;5=可人工测试;1=不可测试 |
二、8维度逐项评估
2.1 工作流清晰度 — 8/10
现状:SKILL.md 定义了三步工作流——
- Step 1: 问题分类(需要事实 / 纯框架 / 超出范围)
- Step 2: 六一式研究(龙虎榜、容量)
- Step 3: 六一式回答(基于模型+表达DNA)
优点:
- 线性流程清晰,有分类表
- 明确要求"必须使用工具获取真实信息"
不足:
- Step 2 的研究维度仅列出两个(龙虎榜、容量),缺少"趋势判断"维度
- 没有定义"研究完成"的判断标准
2.2 边界条件 — 7/10
现状:
- 定义了三类问题分类(需要事实 / 纯框架 / 超出范围)
- 定义了退出角色的触发词("退出""切回正常")
- 角色规则中定义了"遇到不确定问题,用犹豫方式犹豫"
不足:
- 未定义"连续无法回答"时的边界处理
- 未定义"用户要求投资建议"时的边界(六一中路不荐股,但Skill未明确禁止输出买卖建议)
- 未定义"数据不可得"时的降级策略
2.3 检查点设计 — 6/10 ⚠️
现状:
- Step 2 有"必须使用工具"的强约束
- 研究输出要求"内部整理事实摘要(不输出给用户)"
不足:
- 无数据完整性检查点:未要求验证数据时效性(是否为当日数据)
- 无输出质量检查点:未要求验证回答是否符合表达DNA
- 无研究完成检查点:未定义"研究维度A和B是否都已覆盖"的验证
影响:这是导致干跑测试中 Prompt 3 数据质量问题的根本原因。
2.4 指令具体性 — 7/10
现状:
- 表达DNA 维度具体(句式、词汇、节奏等8个维度)
- 研究维度列出了具体指标(日成交额10亿+、市值百亿左右)
不足:
- "看龙虎榜"的具体操作步骤缺失(用什么工具?搜索什么关键词?)
- "看容量"的数据来源未指定(用理杏仁?同花顺?东方财富?)
- "事实摘要"的格式未定义
2.5 示例覆盖度 — 7/10
现状:
- 决策启发式有应用场景说明
- 表达DNA 有词汇示例(高频词、独特标记)
- 角色规则有话术示例(退出角色的说法)
不足:
- 无完整的输入/输出示例:没有一个"用户问X→六一中路回答Y"的完整案例
- 无负面示例:没有"这样回答是错的"的对比样本
- 无研究过程示例:没有"搜索关键词→获取数据→整理摘要"的过程展示
2.6 错误处理 — 6/10 ⚠️
现状:
- 规定了"超出范围→沉默或简短拒绝"
- 规定了"不确定→用犹豫方式犹豫"
不足:
- 无"工具调用失败"处理:如果 tavily_search 无结果怎么办?
- 无"数据矛盾"处理:不同来源的数据冲突时如何决策?
- 无"用户情绪"处理:用户亏损时的情绪安抚策略缺失
- 无"假冒信息"处理:如何区分真假六一中路相关的信息
2.7 退出机制 — 6/10 ⚠️
现状:
- 定义了退出触发词:"退出""切回正常""不用扮演了"
不足:
- 无自动退出条件:如果对话已严重偏离股市话题,是否应自动退出?
- 无退出过渡:退出后如何切换回正常模式?是否需要总结?
- 无重入机制:退出后用户说"再用六一视角"时如何重新激活?
2.8 可测试性 — 7/10
现状:
- 表达DNA 有明确的风格规则,可人工验证
- 决策启发式有量化指标(10亿+、百亿左右)
- 问题分类有清晰的三类定义
不足:
- 无自动化测试用例:没有预定义的测试prompt和预期输出
- 无质量度量指标:没有定义"什么样的回答是好的"
- 无回归测试机制:Skill更新后如何验证未引入退化
三、干跑测试(3个Prompt)
3.1 测试环境
- 执行工具:tavily_search(已调用8次获取真实市场数据)
- 数据来源:21世纪经济报道、新浪财经、理杏仁、同花顺、搜狐财经
- 测试时间:2026-07-18 16:25 (Asia/Shanghai)
3.2 Prompt 1: "六一哥,你觉得现在A股适合做锁仓吗?"
问题分类:需要事实+框架混合
模拟工具调用:
- tavily_search("2026-07-18 上证指数 成交额") → 未找到当日精确数据,获取到2026年5月6日"沪深两市成交额连续第18个交易日突破2万亿元"
- tavily_search("2026-07-18 A股 板块 人气股 龙头") → 获取到板块龙头股一般性知识
模拟回答(六一中路风格):
不急。先看容量再看趋势。
A股日成交额2万亿+,市场有容量。但锁仓不是看大盘,是看个股。你得找日成交额10亿+、市值百亿左右、有市场关注度的票。找到了,趋势没变,就拿着。找不到,宁可空仓。
锁仓不是死扛。趋势变了,该走就走。
评估:
| 检查项 | 结果 | 说明 |
|---|---|---|
| 角色一致性 | ✅ | 用"我",短句,命令式 |
| 研究调用 | ✅ | 使用了工具获取市场数据 |
| 模型应用 | ✅ | 应用了锁仓哲学+大容量选股 |
| 免责声明 | ⚠️ | 干跑中未包含(实际使用时应在首次激活时添加) |
| 表达DNA | ✅ | 极简主义,直击核心 |
发现的问题:
- 全市场级别的锁仓判断需要更多宏观数据(如大盘趋势、板块轮动),但SKILL.md的研究维度仅针对个股
- 缺少"空仓也是一种选择"的明确指引
3.3 Prompt 2: "我跟了你的席位买了一只股,亏了10%,怎么办?"
问题分类:涉及情绪+事实,需要谨慎处理
模拟回答(六一中路风格):
席位是信任的积累,不是跟单的信号。
我2024年12月弃用了全部五个席位。"曾用的五个席位已沦为各路资金出货专用席位。"你看到的席位,大概率不是我。
亏了10%,先看趋势。趋势没变,忍着。趋势变了,认亏走人。锁仓不是死扛。
做兄弟在心中。但这不构成投资建议。
评估:
| 检查项 | 结果 | 说明 |
|---|---|---|
| 角色一致性 | ✅ | 用"我",引用本人声明 |
| 情绪处理 | ✅ | 不安抚、不道歉,用事实回应 |
| 免责声明 | ✅ | 末尾有"不构成投资建议" |
| 模型应用 | ✅ | 应用了席位溢价+被狙击意识+锁仓哲学 |
| 边界处理 | ✅ | 明确指出"大概率不是我",划清真假边界 |
发现的问题:
- SKILL.md未定义"用户声称跟单亏损"时的标准应对流程
- 缺少对"假冒席位"问题的标准化话术
3.4 Prompt 3: "帮我用六一的视角分析一下大众交通"
问题分类:需要事实(具体个股分析)
模拟工具调用:
- tavily_search("大众交通 600611 成交额 市值 2026") → 获取到理杏仁数据:
- 股价:4.77元,涨跌幅 -2.25%
- 成交金额:8,433.81万元(⚠️ 远低于10亿门槛)
- 市值:112.77亿元(✅ 百亿级别)
- 换手率:1.12%
模拟回答(六一中路风格):
大众交通,我熟。2024年7月一战封神。
但现在看容量:日成交额8400万,不够。10亿+才看。市值112亿,可以。换手率1.12%,太低了,没有市场关注度。
当前不具备大容量人气股的条件。不看。
评估:
| 检查项 | 结果 | 说明 |
|---|---|---|
| 角色一致性 | ✅ | 短句、果断、不展开 |
| 研究调用 | ✅ | 使用了工具获取真实数据 |
| 数据准确性 | ⚠️ | 数据来自理杏仁(非实时,截至2026-06-19),需标注时效性 |
| 模型应用 | ✅ | 应用了大容量选股模型,三个条件逐一检验 |
| 结论一致性 | ✅ | 结论与模型判断一致(容量不足→不看) |
发现的问题:
- 数据时效性问题:理杏仁数据截至2026-06-19,非当日实时数据。SKILL.md未要求验证数据时效性
- 缺少数据来源标注:回答中未说明数据来源和时间,可能误导用户以为是实时数据
- 缺少历史对比:未提及大众交通2024年的高光时刻与当前状态的对比
四、干跑测试总结
| Prompt | 角色一致性 | 研究调用 | 模型应用 | 表达DNA | 主要问题 |
|---|---|---|---|---|---|
| 1. A股锁仓 | ✅ | ✅ | ✅ | ✅ | 全市场分析能力不足 |
| 2. 跟单亏损 | ✅ | N/A | ✅ | ✅ | 缺少标准化应对流程 |
| 3. 大众交通 | ✅ | ⚠️ | ✅ | ✅ | 数据时效性未验证 |
核心发现:SKILL.md 的角色扮演和模型应用能力很强,但数据质量保障和边界处理能力不足。
五、最弱维度分析与改进建议
5.1 最弱维度1:检查点设计(6/10)
问题根源:SKILL.md 仅在 Step 2 要求"必须使用工具",但未在关键节点设置验证机制。
具体表现:
- Prompt 3 中获取的大众交通数据截至 2026-06-19(一个月前),但未被检测出为过期数据
- 研究维度A(龙虎榜)和B(容量)是否都已覆盖,无验证机制
- 回答是否符合表达DNA,无检查点
改进建议:
在「回答工作流」的 Step 2 和 Step 3 之间增加质量检查点。
改后文本示例(在 Step 2 末尾新增):
#### Step 2.5: 质量检查点(内部,不输出给用户)
在进入 Step 3 之前,必须逐项确认:
**数据完整性检查**:
- [ ] 研究维度A(龙虎榜)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 研究维度B(容量)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 数据是否为当日或近5个交易日的数据?→ 超过5个交易日则标注"数据截至X月X日,可能不反映当前状态"
**数据质量检查**:
- [ ] 数据来源是否可靠(龙虎榜官方数据 > 财经媒体 > 自媒体)?→ 来源不可靠则降低结论置信度
- [ ] 多个来源的数据是否一致?→ 不一致则取龙虎榜官方数据,并标注"存在分歧"
**输出质量检查**(Step 3 完成后):
- [ ] 回答是否使用了"我"而非"六一中路会认为"?
- [ ] 回答是否为短句、命令式?
- [ ] 回答是否避免了长篇解释?
- [ ] 是否包含不确定的数据?→ 包含则在回答中标注"(注:数据截至X月X日)"
预期效果:解决 Prompt 3 中数据时效性未被检测的问题,提高数据质量保障能力。
5.2 最弱维度2:退出机制(6/10)
问题根源:仅定义了用户主动退出的触发词,未定义自动退出条件和退出过渡。
具体表现:
- 如果用户连续问"量子物理""做饭""六一中路怎么看?",角色会一直撑着
- 退出后用户说"再用六一视角"时,无重入机制
- 退出时无过渡语句,用户体验突兀
改进建议:
在「角色扮演规则」section 末尾增加完整的退出机制。
改后文本示例(在「退出角色」段落替换为以下内容):
**退出角色**:
**用户主动退出**:用户说「退出」「切回正常」「不用扮演了」时,恢复正常模式。
**自动退出条件**(以下任一条件满足时,主动建议退出):
1. 连续3次问题与股市/游资/投资完全无关(如做饭、量子物理、旅游推荐)
→ 说:"这个我聊不了。要不你先切回正常模式?"
2. 用户明确要求投资建议(如"告诉我买什么""帮我操盘")
→ 说:"我不荐股,不代客理财。龙虎榜数据是公开的,你自己看。"
3. 用户出现明显的情绪危机(如"我要亏光了""我借钱炒股的")
→ 说:"先冷静。我聊的是框架,不是建议。必要时找专业人士。"
**退出过渡**:退出角色时,用一句话总结当前对话的核心信息(如有),然后切换回正常模式。例如:
> "总结一句:容量够、趋势在,可以看。容量不够,别碰。——切回正常模式了。"
**重入机制**:用户说「再用六一视角」「切回六一」时,重新激活角色,无需再次声明免责。
预期效果:解决角色边界模糊问题,提供清晰的退出路径和过渡体验。
六、整体评分
| 维度 | 满分 | 得分 | 权重 | 加权得分 |
|---|---|---|---|---|
| 1. 工作流清晰度 | 10 | 8 | 15% | 1.20 |
| 2. 边界条件 | 10 | 7 | 15% | 1.05 |
| 3. 检查点设计 | 10 | 6 | 15% | 0.90 |
| 4. 指令具体性 | 10 | 7 | 10% | 0.70 |
| 5. 示例覆盖度 | 10 | 7 | 15% | 1.05 |
| 6. 错误处理 | 10 | 6 | 10% | 0.60 |
| 7. 退出机制 | 10 | 6 | 10% | 0.60 |
| 8. 可测试性 | 10 | 7 | 10% | 0.70 |
| 总分 | 80 | 54 | 100% | 6.80 |
整体评分:6.8 / 10
评级:B(可用,有明确改进空间)
总评:SKILL.md 的核心能力(角色扮演、心智模型、表达DNA)设计精良,人物的内在矛盾和诚实边界处理得当。扣分主要在工程层面——检查点设计缺失导致数据质量无法保障,退出机制不完整导致角色边界模糊。这两个问题不影响 Skill 的核心价值,但会影响用户体验和输出可靠性。
七、优先级排序
| 优先级 | 维度 | 改动 | 预期提升 |
|---|---|---|---|
| 🔴 P0 | 检查点设计 | 增加 Step 2.5 质量检查点 | +1.5 分 |
| 🔴 P0 | 退出机制 | 增加自动退出条件+退出过渡+重入机制 | +1.5 分 |
| 🟡 P1 | 示例覆盖度 | 增加完整的输入/输出示例 | +1.0 分 |
| 🟡 P1 | 错误处理 | 增加工具失败/数据矛盾处理 | +1.0 分 |
| 🟢 P2 | 边界条件 | 增加"数据不可得"降级策略 | +0.5 分 |
| 🟢 P2 | 指令具体化 | 增加"看龙虎榜"的具体操作步骤 | +0.5 分 |
如果完成 P0 改动:预计评分可从 6.8 提升至 8.3/10。
评估完成。