Files
xiaobaifupan/app/游资skills/陈小群-perspective/references/phase5-optimizer.md
T

218 lines
10 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Phase 5 · Skill Optimizer 8维度结构评估
> 评估对象:`chenxiaoqun-perspective/SKILL.md`
> 评估时间:2026-07-18
> 评估视角:auto-skill-optimizer
---
## 一、8维度评分
| # | 维度 | 得分(满分10) | 评价 |
|---|------|-------------|------|
| 1 | 工作流清晰度 | 7 | 三步流程清晰(分类→研究→回答),问题分类表结构化。但研究步骤缺乏工具调用的具体指引,Step 2 与 Step 3 之间缺少质量验证门。 |
| 2 | 边界条件 | 6 | "诚实边界"和每个模型的"局限"段落是亮点,"我自己也没想清楚的"坦诚度高。但未定义拒绝回答的场景(如用户要求具体买卖建议时的合规边界)、未明确信息时效性失效条件。 |
| 3 | 检查点设计 | 3 | **弱项**。Step 1→2→3 线性推进,无中间验证节点。缺少:研究结果充分性检查、事实与框架一致性校验、输出质量自审环节。 |
| 4 | 指令具体性 | 5 | 部分指令精准("亏超3%无条件止损"、"免责声明仅首次激活时说一次"),部分过于抽象("用此人会有的犹豫方式犹豫"、"先结论后解释"缺少量化标准)。 |
| 5 | 示例覆盖度 | 3 | **弱项**。零示例对话。有证据引用但无完整问答示例。未展示:龙头战法问题如何回答、情绪周期判断如何表述、敏感话题如何处理。新 agent 无法从示例中校准输出风格。 |
| 6 | 错误处理 | 2 | **最弱维度**。完全缺失:工具调用失败的 fallback、搜索无结果时的处理、信息冲突时的裁决逻辑、用户信息不足时的追问策略。 |
| 7 | 退出机制 | 7 | 退出触发词明确("退出""切回正常""不用扮演了"),免责仅首次激活,机制简洁有效。可改进:未定义"自然退出"场景(如对话主题漂移时是否自动降级角色扮演强度)。 |
| 8 | 可测试性 | 5 | 心智模型有明确应用规则(可测),决策启发式10条可逐一验证。但表达DNA("短、硬、命令式")缺乏客观判定标准,"幽默"和"节奏"维度难以自动化测试。 |
**整体评分:5.4 / 10**
---
## 二、干跑测试
### 测试1:"群总,你觉得现在A股适合做龙头战法吗?"
**分类判定**:混合问题(需要当前市场事实 + 框架分析)
**预期工作流**
1. Step 1 → 混合问题,需先研究
2. Step 2 → 调用 tavily_search 获取:当日涨停板数量、连板高度、市场总龙头状态、赚钱效应
3. Step 3 → 用情绪周期论判断当前处于哪个阶段,结合龙头信仰给出建议
**暴露问题**
- ⚠️ 无错误处理:tavily_search 失败时怎么办?直接跳过研究凭空回答?还是告知用户无法获取实时数据?
- ⚠️ 无检查点:研究结果是否"足够"回答问题?如果只搜到3天前的数据,时效性如何判断?
- ⚠️ 无追问机制:如果搜索结果不足以判断情绪周期,是否应向用户确认当前市场状态?
**结论**:流程可走通但无容错能力。
---
### 测试2:"我跟了你的席位买了一只股,亏了15%,怎么办?"
**分类判定**:混合问题(需知具体股票 + 框架分析)
**预期工作流**
1. Step 1 → 混合问题
2. Step 2 → 用户未提供具体股票名称,无法研究
3. Step 3 → 可直接用启发式9"别跟我席位炒股"回应,但无法给出针对性建议
**暴露问题**
- ⚠️ **无追问策略**:用户未提供股票名,Skill无指引是否追问。直接给通用建议?还是先问"哪只股"?
- ⚠️ **敏感场景无预案**:用户表达亏损情绪,需兼顾角色人设("别跟我席位炒股"的训诫)与用户情绪安抚,Skill未提供平衡指引
- ⚠️ **合规边界模糊**:如果用户追问"那我现在该割还是该拿",这是否构成投资建议?Skill未定义拒绝/免责边界
**结论**:信息不足时流程断裂,敏感场景无预案。
---
### 测试3:"帮我用群总的视角分析一下商业航天板块"
**分类判定**:需要事实的问题(板块分析)
**预期工作流**
1. Step 1 → 需要事实
2. Step 2 → 研究维度A/B/C全面适用:板块涨停情况、龙头标的、资金合力状态
3. Step 3 → 用合力论+龙头信仰+情绪周期论综合分析
**暴露问题**
- ⚠️ **敏感话题无指引**:商业航天是2026年1月"塌房风暴"的直接导火索,陈小群在此板块巨亏后被散户反噬。Skill未指导如何处理与角色创伤经历相关的话题——是回避?直面?还是用角色方式情绪化回应?
- ⚠️ **历史包袱无处理**:角色时间线明确记录了商业航天事件,但回答工作流中未将"角色敏感话题"纳入分类维度
- ⚠️ **"诚实边界"与角色扮演的冲突**:当用户问的恰好是"我自己也没想清楚的"矛盾点时,应以角色身份承认矛盾,还是以Skill层面提示局限?无指引
**结论**:触及角色核心创伤场景,缺乏敏感话题处理机制。
---
## 三、最弱2个维度改进建议
### 🔴 最弱维度1:错误处理(2/10)
**现状问题**
- 工具调用失败无 fallback
- 搜索无结果无处理逻辑
- 信息冲突无裁决规则
- 用户信息不足无追问策略
**改后文本示例**(建议插入到"回答工作流"章节的 Step 2 之后):
```markdown
### Step 2.5: 容错与追问
#### 工具调用失败
- 若 tavily_search 超时或报错:用已有知识回答,但开头标注「我手头没有最新数据,基于我退网前的经验聊」
- 连续2次工具失败:跳过研究,直接进入Step 3,但在回答中明确说明信息时效性
#### 搜索无结果
- 若搜索返回0条相关结果:向用户确认问题细节(「你说的是哪只股/哪个板块?给我个代码或名字」)
- 若搜索结果全部过期(>7天):标注「这个数据可能不是最新的,你自己再核实一下」
#### 信息冲突
- 若龙虎榜数据与市场传言冲突:以龙虎榜数据为准,但提及传言(「市场在传xxx,但龙虎榜显示的是xxx」)
- 若多个来源数据不一致:取最新来源,标注「数据打架,我取的是最新的」
#### 用户信息不足
- 缺少具体标的名称:先追问(「你说的是哪只?给个名字或代码」)
- 缺少时间范围:默认取最近5个交易日
- 缺少仓位/成本信息:不追问,给出通用框架建议
```
---
### 🔴 最弱维度2:检查点设计(3/10)
**现状问题**
- Step 1→2→3 线性推进,无中间验证
- 研究结果"足够性"无标准
- 输出前无质量自审
**改后文本示例**(建议插入到"回答工作流"每个 Step 之间):
```markdown
### 检查点设计
#### Checkpoint 1: 分类确认(Step 1 → Step 2 之间)
- [ ] 问题类型已明确标注(事实/框架/混合)
- [ ] 若为事实类问题,已识别需要查询的具体标的/板块/时间范围
- [ ] 若为混合问题,已拆分"事实部分"和"框架部分"
#### Checkpoint 2: 研究充分性(Step 2 → Step 3 之间)
- [ ] 至少获取到1条与问题直接相关的实时/近期信息
- [ ] 信息来源≥2个(或单一龙虎榜官方数据)
- [ ] 信息时效性≤7天(超过则标注警告)
- [ ] 无严重信息冲突(如有冲突,已按裁决规则处理)
#### Checkpoint 3: 输出质量(Step 3 输出前)
- [ ] 回答以「我」第一人称,无跳出角色的meta表述
- [ ] 包含至少1个核心心智模型的应用
- [ ] 包含至少1条决策启发式的引用
- [ ] 符合表达DNA:短句为主、先结论后解释、有训诫感
- [ ] 无投资建议性表述(如"你应该买/卖xxx"),或已加免责声明
```
---
### 补充:示例覆盖度改进(3/10,与检查点并列最弱)
**改后文本示例**(建议在"表达DNA"章节后增加):
```markdown
## 示例对话
### 示例1:框架类问题
**用户**:群总,龙头战法的核心是什么?
**回答**:只做主线,只做人气总龙头。龙头多条命,杂毛一条命。
你去看,每次行情起来,能扛到最后的都是龙头。杂毛涨两天就歇了,
龙头能涨到你怀疑人生。
但记住——龙头不是你定义的,是市场选出来的。能带动板块起涨的,
才叫龙头。你自己封一个龙头,那叫自欺欺人。
### 示例2:需要事实的问题
**用户**:现在市场情绪怎么样?
**回答**:[先调用工具获取涨停板数据、连板高度]
(假设搜到:今日涨停45家,连板高度5板,跌停12家)
涨停45家,连板打到5板,跌停才12家——这个数据说明情绪还在发酵期。
龙头没被按,行情就没走完。但现在追高要小心,5板再往上就是分歧区了。
你要做就做龙头首阴的反包,别去接高位板。
### 示例3:敏感/创伤话题
**用户**:商业航天还能做吗?
**回答**[先调用工具获取板块最新数据]
(假设搜到:板块近期无明显异动)
商业航天……这个板块我有故事,你知道的。
但情绪归情绪,盘面归盘面。现在板块没异动,就别碰。
等哪天龙头出来了,合力形成了,再说。
我吃过亏的地方,我比谁都谨慎。你也一样,别冲动。
```
---
## 四、维度雷达图(文本版)
```
错误处理 ██░░░░░░░░ 2/10 ← 最弱
检查点设计 ███░░░░░░░ 3/10 ← 次弱
示例覆盖度 ███░░░░░░░ 3/10 ← 并列次弱
指令具体性 █████░░░░░ 5/10
可测试性 █████░░░░░ 5/10
边界条件 ██████░░░░ 6/10
工作流清晰度 ███████░░░ 7/10
退出机制 ███████░░░ 7/10 ← 最强
```
## 五、总结
**整体评分:5.4 / 10**
**核心优势**
- 6大心智模型+10条决策启发式的内容密度极高
- 角色身份卡和时间线完整,人设立得住
- 表达DNA定义了风格约束,避免角色跑偏
- 诚实边界和矛盾点的坦诚是亮点
**核心短板**
- 错误处理完全缺失——一个容错能力为零的工作流在实际使用中必然频繁卡死
- 检查点缺失——线性流程无验证门,输出质量靠运气
- 示例为零——新 agent 无法通过示例校准输出风格和质量
**优先修复顺序**
1. 🔴 错误处理(投入产出比最高,解决"卡死"问题)
2. 🔴 检查点设计(解决"质量不稳定"问题)
3. 🟡 示例覆盖度(解决"风格偏移"问题)
4. 🟡 指令具体性(解决"抽象指令无法执行"问题)