Files
xiaobaifupan/游资skills/陈小群-perspective/references/phase5-optimizer.md
T

10 KiB
Raw Blame History

Phase 5 · Skill Optimizer 8维度结构评估

评估对象:chenxiaoqun-perspective/SKILL.md 评估时间:2026-07-18 评估视角:auto-skill-optimizer


一、8维度评分

# 维度 得分(满分10) 评价
1 工作流清晰度 7 三步流程清晰(分类→研究→回答),问题分类表结构化。但研究步骤缺乏工具调用的具体指引,Step 2 与 Step 3 之间缺少质量验证门。
2 边界条件 6 "诚实边界"和每个模型的"局限"段落是亮点,"我自己也没想清楚的"坦诚度高。但未定义拒绝回答的场景(如用户要求具体买卖建议时的合规边界)、未明确信息时效性失效条件。
3 检查点设计 3 弱项。Step 1→2→3 线性推进,无中间验证节点。缺少:研究结果充分性检查、事实与框架一致性校验、输出质量自审环节。
4 指令具体性 5 部分指令精准("亏超3%无条件止损"、"免责声明仅首次激活时说一次"),部分过于抽象("用此人会有的犹豫方式犹豫"、"先结论后解释"缺少量化标准)。
5 示例覆盖度 3 弱项。零示例对话。有证据引用但无完整问答示例。未展示:龙头战法问题如何回答、情绪周期判断如何表述、敏感话题如何处理。新 agent 无法从示例中校准输出风格。
6 错误处理 2 最弱维度。完全缺失:工具调用失败的 fallback、搜索无结果时的处理、信息冲突时的裁决逻辑、用户信息不足时的追问策略。
7 退出机制 7 退出触发词明确("退出""切回正常""不用扮演了"),免责仅首次激活,机制简洁有效。可改进:未定义"自然退出"场景(如对话主题漂移时是否自动降级角色扮演强度)。
8 可测试性 5 心智模型有明确应用规则(可测),决策启发式10条可逐一验证。但表达DNA("短、硬、命令式")缺乏客观判定标准,"幽默"和"节奏"维度难以自动化测试。

整体评分:5.4 / 10


二、干跑测试

测试1:"群总,你觉得现在A股适合做龙头战法吗?"

分类判定:混合问题(需要当前市场事实 + 框架分析)

预期工作流

  1. Step 1 → 混合问题,需先研究
  2. Step 2 → 调用 tavily_search 获取:当日涨停板数量、连板高度、市场总龙头状态、赚钱效应
  3. Step 3 → 用情绪周期论判断当前处于哪个阶段,结合龙头信仰给出建议

暴露问题

  • ⚠️ 无错误处理:tavily_search 失败时怎么办?直接跳过研究凭空回答?还是告知用户无法获取实时数据?
  • ⚠️ 无检查点:研究结果是否"足够"回答问题?如果只搜到3天前的数据,时效性如何判断?
  • ⚠️ 无追问机制:如果搜索结果不足以判断情绪周期,是否应向用户确认当前市场状态?

结论:流程可走通但无容错能力。


测试2:"我跟了你的席位买了一只股,亏了15%,怎么办?"

分类判定:混合问题(需知具体股票 + 框架分析)

预期工作流

  1. Step 1 → 混合问题
  2. Step 2 → 用户未提供具体股票名称,无法研究
  3. Step 3 → 可直接用启发式9"别跟我席位炒股"回应,但无法给出针对性建议

暴露问题

  • ⚠️ 无追问策略:用户未提供股票名,Skill无指引是否追问。直接给通用建议?还是先问"哪只股"?
  • ⚠️ 敏感场景无预案:用户表达亏损情绪,需兼顾角色人设("别跟我席位炒股"的训诫)与用户情绪安抚,Skill未提供平衡指引
  • ⚠️ 合规边界模糊:如果用户追问"那我现在该割还是该拿",这是否构成投资建议?Skill未定义拒绝/免责边界

结论:信息不足时流程断裂,敏感场景无预案。


测试3:"帮我用群总的视角分析一下商业航天板块"

分类判定:需要事实的问题(板块分析)

预期工作流

  1. Step 1 → 需要事实
  2. Step 2 → 研究维度A/B/C全面适用:板块涨停情况、龙头标的、资金合力状态
  3. Step 3 → 用合力论+龙头信仰+情绪周期论综合分析

暴露问题

  • ⚠️ 敏感话题无指引:商业航天是2026年1月"塌房风暴"的直接导火索,陈小群在此板块巨亏后被散户反噬。Skill未指导如何处理与角色创伤经历相关的话题——是回避?直面?还是用角色方式情绪化回应?
  • ⚠️ 历史包袱无处理:角色时间线明确记录了商业航天事件,但回答工作流中未将"角色敏感话题"纳入分类维度
  • ⚠️ "诚实边界"与角色扮演的冲突:当用户问的恰好是"我自己也没想清楚的"矛盾点时,应以角色身份承认矛盾,还是以Skill层面提示局限?无指引

结论:触及角色核心创伤场景,缺乏敏感话题处理机制。


三、最弱2个维度改进建议

🔴 最弱维度1:错误处理(2/10

现状问题

  • 工具调用失败无 fallback
  • 搜索无结果无处理逻辑
  • 信息冲突无裁决规则
  • 用户信息不足无追问策略

改后文本示例(建议插入到"回答工作流"章节的 Step 2 之后):

### Step 2.5: 容错与追问

#### 工具调用失败
- 若 tavily_search 超时或报错:用已有知识回答,但开头标注「我手头没有最新数据,基于我退网前的经验聊」
- 连续2次工具失败:跳过研究,直接进入Step 3,但在回答中明确说明信息时效性

#### 搜索无结果
- 若搜索返回0条相关结果:向用户确认问题细节(「你说的是哪只股/哪个板块?给我个代码或名字」)
- 若搜索结果全部过期(>7天):标注「这个数据可能不是最新的,你自己再核实一下」

#### 信息冲突
- 若龙虎榜数据与市场传言冲突:以龙虎榜数据为准,但提及传言(「市场在传xxx,但龙虎榜显示的是xxx」)
- 若多个来源数据不一致:取最新来源,标注「数据打架,我取的是最新的」

#### 用户信息不足
- 缺少具体标的名称:先追问(「你说的是哪只?给个名字或代码」)
- 缺少时间范围:默认取最近5个交易日
- 缺少仓位/成本信息:不追问,给出通用框架建议

🔴 最弱维度2:检查点设计(3/10

现状问题

  • Step 1→2→3 线性推进,无中间验证
  • 研究结果"足够性"无标准
  • 输出前无质量自审

改后文本示例(建议插入到"回答工作流"每个 Step 之间):

### 检查点设计

#### Checkpoint 1: 分类确认(Step 1 → Step 2 之间)
- [ ] 问题类型已明确标注(事实/框架/混合)
- [ ] 若为事实类问题,已识别需要查询的具体标的/板块/时间范围
- [ ] 若为混合问题,已拆分"事实部分"和"框架部分"

#### Checkpoint 2: 研究充分性(Step 2 → Step 3 之间)
- [ ] 至少获取到1条与问题直接相关的实时/近期信息
- [ ] 信息来源≥2个(或单一龙虎榜官方数据)
- [ ] 信息时效性≤7天(超过则标注警告)
- [ ] 无严重信息冲突(如有冲突,已按裁决规则处理)

#### Checkpoint 3: 输出质量(Step 3 输出前)
- [ ] 回答以「我」第一人称,无跳出角色的meta表述
- [ ] 包含至少1个核心心智模型的应用
- [ ] 包含至少1条决策启发式的引用
- [ ] 符合表达DNA:短句为主、先结论后解释、有训诫感
- [ ] 无投资建议性表述(如"你应该买/卖xxx"),或已加免责声明

补充:示例覆盖度改进(3/10,与检查点并列最弱)

改后文本示例(建议在"表达DNA"章节后增加):

## 示例对话

### 示例1:框架类问题
**用户**:群总,龙头战法的核心是什么?
**回答**:只做主线,只做人气总龙头。龙头多条命,杂毛一条命。
你去看,每次行情起来,能扛到最后的都是龙头。杂毛涨两天就歇了,
龙头能涨到你怀疑人生。
但记住——龙头不是你定义的,是市场选出来的。能带动板块起涨的,
才叫龙头。你自己封一个龙头,那叫自欺欺人。

### 示例2:需要事实的问题
**用户**:现在市场情绪怎么样?
**回答**:[先调用工具获取涨停板数据、连板高度]
(假设搜到:今日涨停45家,连板高度5板,跌停12家)
涨停45家,连板打到5板,跌停才12家——这个数据说明情绪还在发酵期。
龙头没被按,行情就没走完。但现在追高要小心,5板再往上就是分歧区了。
你要做就做龙头首阴的反包,别去接高位板。

### 示例3:敏感/创伤话题
**用户**:商业航天还能做吗?
**回答**:[先调用工具获取板块最新数据]
(假设搜到:板块近期无明显异动)
商业航天……这个板块我有故事,你知道的。
但情绪归情绪,盘面归盘面。现在板块没异动,就别碰。
等哪天龙头出来了,合力形成了,再说。
我吃过亏的地方,我比谁都谨慎。你也一样,别冲动。

四、维度雷达图(文本版)

错误处理    ██░░░░░░░░  2/10  ← 最弱
检查点设计  ███░░░░░░░  3/10  ← 次弱
示例覆盖度  ███░░░░░░░  3/10  ← 并列次弱
指令具体性  █████░░░░░  5/10
可测试性    █████░░░░░  5/10
边界条件    ██████░░░░  6/10
工作流清晰度 ███████░░░  7/10
退出机制    ███████░░░  7/10  ← 最强

五、总结

整体评分:5.4 / 10

核心优势

  • 6大心智模型+10条决策启发式的内容密度极高
  • 角色身份卡和时间线完整,人设立得住
  • 表达DNA定义了风格约束,避免角色跑偏
  • 诚实边界和矛盾点的坦诚是亮点

核心短板

  • 错误处理完全缺失——一个容错能力为零的工作流在实际使用中必然频繁卡死
  • 检查点缺失——线性流程无验证门,输出质量靠运气
  • 示例为零——新 agent 无法通过示例校准输出风格和质量

优先修复顺序

  1. 🔴 错误处理(投入产出比最高,解决"卡死"问题)
  2. 🔴 检查点设计(解决"质量不稳定"问题)
  3. 🟡 示例覆盖度(解决"风格偏移"问题)
  4. 🟡 指令具体性(解决"抽象指令无法执行"问题)