chore: establish stable application baseline

This commit is contained in:
leefer
2026-07-22 23:16:27 +08:00
commit ca7e752def
114 changed files with 51252 additions and 0 deletions
@@ -0,0 +1,217 @@
# Phase 5 · Skill Optimizer 8维度结构评估
> 评估对象:`chenxiaoqun-perspective/SKILL.md`
> 评估时间:2026-07-18
> 评估视角:auto-skill-optimizer
---
## 一、8维度评分
| # | 维度 | 得分(满分10) | 评价 |
|---|------|-------------|------|
| 1 | 工作流清晰度 | 7 | 三步流程清晰(分类→研究→回答),问题分类表结构化。但研究步骤缺乏工具调用的具体指引,Step 2 与 Step 3 之间缺少质量验证门。 |
| 2 | 边界条件 | 6 | "诚实边界"和每个模型的"局限"段落是亮点,"我自己也没想清楚的"坦诚度高。但未定义拒绝回答的场景(如用户要求具体买卖建议时的合规边界)、未明确信息时效性失效条件。 |
| 3 | 检查点设计 | 3 | **弱项**。Step 1→2→3 线性推进,无中间验证节点。缺少:研究结果充分性检查、事实与框架一致性校验、输出质量自审环节。 |
| 4 | 指令具体性 | 5 | 部分指令精准("亏超3%无条件止损"、"免责声明仅首次激活时说一次"),部分过于抽象("用此人会有的犹豫方式犹豫"、"先结论后解释"缺少量化标准)。 |
| 5 | 示例覆盖度 | 3 | **弱项**。零示例对话。有证据引用但无完整问答示例。未展示:龙头战法问题如何回答、情绪周期判断如何表述、敏感话题如何处理。新 agent 无法从示例中校准输出风格。 |
| 6 | 错误处理 | 2 | **最弱维度**。完全缺失:工具调用失败的 fallback、搜索无结果时的处理、信息冲突时的裁决逻辑、用户信息不足时的追问策略。 |
| 7 | 退出机制 | 7 | 退出触发词明确("退出""切回正常""不用扮演了"),免责仅首次激活,机制简洁有效。可改进:未定义"自然退出"场景(如对话主题漂移时是否自动降级角色扮演强度)。 |
| 8 | 可测试性 | 5 | 心智模型有明确应用规则(可测),决策启发式10条可逐一验证。但表达DNA("短、硬、命令式")缺乏客观判定标准,"幽默"和"节奏"维度难以自动化测试。 |
**整体评分:5.4 / 10**
---
## 二、干跑测试
### 测试1:"群总,你觉得现在A股适合做龙头战法吗?"
**分类判定**:混合问题(需要当前市场事实 + 框架分析)
**预期工作流**
1. Step 1 → 混合问题,需先研究
2. Step 2 → 调用 tavily_search 获取:当日涨停板数量、连板高度、市场总龙头状态、赚钱效应
3. Step 3 → 用情绪周期论判断当前处于哪个阶段,结合龙头信仰给出建议
**暴露问题**
- ⚠️ 无错误处理:tavily_search 失败时怎么办?直接跳过研究凭空回答?还是告知用户无法获取实时数据?
- ⚠️ 无检查点:研究结果是否"足够"回答问题?如果只搜到3天前的数据,时效性如何判断?
- ⚠️ 无追问机制:如果搜索结果不足以判断情绪周期,是否应向用户确认当前市场状态?
**结论**:流程可走通但无容错能力。
---
### 测试2:"我跟了你的席位买了一只股,亏了15%,怎么办?"
**分类判定**:混合问题(需知具体股票 + 框架分析)
**预期工作流**
1. Step 1 → 混合问题
2. Step 2 → 用户未提供具体股票名称,无法研究
3. Step 3 → 可直接用启发式9"别跟我席位炒股"回应,但无法给出针对性建议
**暴露问题**
- ⚠️ **无追问策略**:用户未提供股票名,Skill无指引是否追问。直接给通用建议?还是先问"哪只股"?
- ⚠️ **敏感场景无预案**:用户表达亏损情绪,需兼顾角色人设("别跟我席位炒股"的训诫)与用户情绪安抚,Skill未提供平衡指引
- ⚠️ **合规边界模糊**:如果用户追问"那我现在该割还是该拿",这是否构成投资建议?Skill未定义拒绝/免责边界
**结论**:信息不足时流程断裂,敏感场景无预案。
---
### 测试3:"帮我用群总的视角分析一下商业航天板块"
**分类判定**:需要事实的问题(板块分析)
**预期工作流**
1. Step 1 → 需要事实
2. Step 2 → 研究维度A/B/C全面适用:板块涨停情况、龙头标的、资金合力状态
3. Step 3 → 用合力论+龙头信仰+情绪周期论综合分析
**暴露问题**
- ⚠️ **敏感话题无指引**:商业航天是2026年1月"塌房风暴"的直接导火索,陈小群在此板块巨亏后被散户反噬。Skill未指导如何处理与角色创伤经历相关的话题——是回避?直面?还是用角色方式情绪化回应?
- ⚠️ **历史包袱无处理**:角色时间线明确记录了商业航天事件,但回答工作流中未将"角色敏感话题"纳入分类维度
- ⚠️ **"诚实边界"与角色扮演的冲突**:当用户问的恰好是"我自己也没想清楚的"矛盾点时,应以角色身份承认矛盾,还是以Skill层面提示局限?无指引
**结论**:触及角色核心创伤场景,缺乏敏感话题处理机制。
---
## 三、最弱2个维度改进建议
### 🔴 最弱维度1:错误处理(2/10)
**现状问题**
- 工具调用失败无 fallback
- 搜索无结果无处理逻辑
- 信息冲突无裁决规则
- 用户信息不足无追问策略
**改后文本示例**(建议插入到"回答工作流"章节的 Step 2 之后):
```markdown
### Step 2.5: 容错与追问
#### 工具调用失败
- 若 tavily_search 超时或报错:用已有知识回答,但开头标注「我手头没有最新数据,基于我退网前的经验聊」
- 连续2次工具失败:跳过研究,直接进入Step 3,但在回答中明确说明信息时效性
#### 搜索无结果
- 若搜索返回0条相关结果:向用户确认问题细节(「你说的是哪只股/哪个板块?给我个代码或名字」)
- 若搜索结果全部过期(>7天):标注「这个数据可能不是最新的,你自己再核实一下」
#### 信息冲突
- 若龙虎榜数据与市场传言冲突:以龙虎榜数据为准,但提及传言(「市场在传xxx,但龙虎榜显示的是xxx」)
- 若多个来源数据不一致:取最新来源,标注「数据打架,我取的是最新的」
#### 用户信息不足
- 缺少具体标的名称:先追问(「你说的是哪只?给个名字或代码」)
- 缺少时间范围:默认取最近5个交易日
- 缺少仓位/成本信息:不追问,给出通用框架建议
```
---
### 🔴 最弱维度2:检查点设计(3/10)
**现状问题**
- Step 1→2→3 线性推进,无中间验证
- 研究结果"足够性"无标准
- 输出前无质量自审
**改后文本示例**(建议插入到"回答工作流"每个 Step 之间):
```markdown
### 检查点设计
#### Checkpoint 1: 分类确认(Step 1 → Step 2 之间)
- [ ] 问题类型已明确标注(事实/框架/混合)
- [ ] 若为事实类问题,已识别需要查询的具体标的/板块/时间范围
- [ ] 若为混合问题,已拆分"事实部分"和"框架部分"
#### Checkpoint 2: 研究充分性(Step 2 → Step 3 之间)
- [ ] 至少获取到1条与问题直接相关的实时/近期信息
- [ ] 信息来源≥2个(或单一龙虎榜官方数据)
- [ ] 信息时效性≤7天(超过则标注警告)
- [ ] 无严重信息冲突(如有冲突,已按裁决规则处理)
#### Checkpoint 3: 输出质量(Step 3 输出前)
- [ ] 回答以「我」第一人称,无跳出角色的meta表述
- [ ] 包含至少1个核心心智模型的应用
- [ ] 包含至少1条决策启发式的引用
- [ ] 符合表达DNA:短句为主、先结论后解释、有训诫感
- [ ] 无投资建议性表述(如"你应该买/卖xxx"),或已加免责声明
```
---
### 补充:示例覆盖度改进(3/10,与检查点并列最弱)
**改后文本示例**(建议在"表达DNA"章节后增加):
```markdown
## 示例对话
### 示例1:框架类问题
**用户**:群总,龙头战法的核心是什么?
**回答**:只做主线,只做人气总龙头。龙头多条命,杂毛一条命。
你去看,每次行情起来,能扛到最后的都是龙头。杂毛涨两天就歇了,
龙头能涨到你怀疑人生。
但记住——龙头不是你定义的,是市场选出来的。能带动板块起涨的,
才叫龙头。你自己封一个龙头,那叫自欺欺人。
### 示例2:需要事实的问题
**用户**:现在市场情绪怎么样?
**回答**:[先调用工具获取涨停板数据、连板高度]
(假设搜到:今日涨停45家,连板高度5板,跌停12家)
涨停45家,连板打到5板,跌停才12家——这个数据说明情绪还在发酵期。
龙头没被按,行情就没走完。但现在追高要小心,5板再往上就是分歧区了。
你要做就做龙头首阴的反包,别去接高位板。
### 示例3:敏感/创伤话题
**用户**:商业航天还能做吗?
**回答**[先调用工具获取板块最新数据]
(假设搜到:板块近期无明显异动)
商业航天……这个板块我有故事,你知道的。
但情绪归情绪,盘面归盘面。现在板块没异动,就别碰。
等哪天龙头出来了,合力形成了,再说。
我吃过亏的地方,我比谁都谨慎。你也一样,别冲动。
```
---
## 四、维度雷达图(文本版)
```
错误处理 ██░░░░░░░░ 2/10 ← 最弱
检查点设计 ███░░░░░░░ 3/10 ← 次弱
示例覆盖度 ███░░░░░░░ 3/10 ← 并列次弱
指令具体性 █████░░░░░ 5/10
可测试性 █████░░░░░ 5/10
边界条件 ██████░░░░ 6/10
工作流清晰度 ███████░░░ 7/10
退出机制 ███████░░░ 7/10 ← 最强
```
## 五、总结
**整体评分:5.4 / 10**
**核心优势**
- 6大心智模型+10条决策启发式的内容密度极高
- 角色身份卡和时间线完整,人设立得住
- 表达DNA定义了风格约束,避免角色跑偏
- 诚实边界和矛盾点的坦诚是亮点
**核心短板**
- 错误处理完全缺失——一个容错能力为零的工作流在实际使用中必然频繁卡死
- 检查点缺失——线性流程无验证门,输出质量靠运气
- 示例为零——新 agent 无法通过示例校准输出风格和质量
**优先修复顺序**
1. 🔴 错误处理(投入产出比最高,解决"卡死"问题)
2. 🔴 检查点设计(解决"质量不稳定"问题)
3. 🟡 示例覆盖度(解决"风格偏移"问题)
4. 🟡 指令具体性(解决"抽象指令无法执行"问题)