migration: establish exact preserved app baseline

This commit is contained in:
leefer
2026-07-30 23:51:48 +08:00
parent 41329943c4
commit 4083dceba3
399 changed files with 129967 additions and 23 deletions
@@ -0,0 +1,354 @@
# 六一中路 Skill · Phase 5 Auto-Skill-Optimizer 评估报告
> 评估时间:2026-07-18 16:25 (Asia/Shanghai)
> 评估视角:auto-skill-optimizer8维度结构化评估)
> 评估对象:`skills/六一中路-perspective/SKILL.md`
> 干跑测试:3个prompt(已做tool-based证据采集)
---
## 一、评估维度与评分标准
| 维度 | 定义 | 评分标准(1-10) |
|------|------|------------------|
| 1. 工作流清晰度 | 回答流程是否明确、有序、可执行 | 10=完美线性流程;5=有步骤但边界模糊;1=无流程 |
| 2. 边界条件 | 何时触发、何时不触发、何时退出 | 10=完整覆盖所有边界;5=覆盖核心边界;1=无边界定义 |
| 3. 检查点设计 | 关键节点是否有验证机制 | 10=每个步骤有检查点;5=核心步骤有检查点;1=无检查点 |
| 4. 指令具体性 | 指令是否具体、可操作、无歧义 | 10=所有指令可直接执行;5=核心指令具体;1=指令模糊 |
| 5. 示例覆盖度 | 是否有足够的输入/输出示例 | 10=覆盖所有场景;5=覆盖核心场景;1=无示例 |
| 6. 错误处理 | 错误路径是否有定义 | 10=所有错误有处理;5=核心错误有处理;1=无错误处理 |
| 7. 退出机制 | 何时退出角色、如何退出 | 10=完整退出逻辑;5=基本退出逻辑;1=无退出机制 |
| 8. 可测试性 | 效果是否可验证、可复现 | 10=可自动化测试;5=可人工测试;1=不可测试 |
---
## 二、8维度逐项评估
### 2.1 工作流清晰度 — 8/10
**现状**:SKILL.md 定义了三步工作流——
- Step 1: 问题分类(需要事实 / 纯框架 / 超出范围)
- Step 2: 六一式研究(龙虎榜、容量)
- Step 3: 六一式回答(基于模型+表达DNA)
**优点**
- 线性流程清晰,有分类表
- 明确要求"必须使用工具获取真实信息"
**不足**
- Step 2 的研究维度仅列出两个(龙虎榜、容量),缺少"趋势判断"维度
- 没有定义"研究完成"的判断标准
### 2.2 边界条件 — 7/10
**现状**
- 定义了三类问题分类(需要事实 / 纯框架 / 超出范围)
- 定义了退出角色的触发词("退出""切回正常"
- 角色规则中定义了"遇到不确定问题,用犹豫方式犹豫"
**不足**
- 未定义"连续无法回答"时的边界处理
- 未定义"用户要求投资建议"时的边界(六一中路不荐股,但Skill未明确禁止输出买卖建议)
- 未定义"数据不可得"时的降级策略
### 2.3 检查点设计 — 6/10 ⚠️
**现状**
- Step 2 有"必须使用工具"的强约束
- 研究输出要求"内部整理事实摘要(不输出给用户)"
**不足**
- **无数据完整性检查点**:未要求验证数据时效性(是否为当日数据)
- **无输出质量检查点**:未要求验证回答是否符合表达DNA
- **无研究完成检查点**:未定义"研究维度A和B是否都已覆盖"的验证
**影响**:这是导致干跑测试中 Prompt 3 数据质量问题的根本原因。
### 2.4 指令具体性 — 7/10
**现状**
- 表达DNA 维度具体(句式、词汇、节奏等8个维度)
- 研究维度列出了具体指标(日成交额10亿+、市值百亿左右)
**不足**
- "看龙虎榜"的具体操作步骤缺失(用什么工具?搜索什么关键词?)
- "看容量"的数据来源未指定(用理杏仁?同花顺?东方财富?)
- "事实摘要"的格式未定义
### 2.5 示例覆盖度 — 7/10
**现状**
- 决策启发式有应用场景说明
- 表达DNA 有词汇示例(高频词、独特标记)
- 角色规则有话术示例(退出角色的说法)
**不足**
- **无完整的输入/输出示例**:没有一个"用户问X→六一中路回答Y"的完整案例
- **无负面示例**:没有"这样回答是错的"的对比样本
- **无研究过程示例**:没有"搜索关键词→获取数据→整理摘要"的过程展示
### 2.6 错误处理 — 6/10 ⚠️
**现状**
- 规定了"超出范围→沉默或简短拒绝"
- 规定了"不确定→用犹豫方式犹豫"
**不足**
- **无"工具调用失败"处理**:如果 tavily_search 无结果怎么办?
- **无"数据矛盾"处理**:不同来源的数据冲突时如何决策?
- **无"用户情绪"处理**:用户亏损时的情绪安抚策略缺失
- **无"假冒信息"处理**:如何区分真假六一中路相关的信息
### 2.7 退出机制 — 6/10 ⚠️
**现状**
- 定义了退出触发词:"退出""切回正常""不用扮演了"
**不足**
- **无自动退出条件**:如果对话已严重偏离股市话题,是否应自动退出?
- **无退出过渡**:退出后如何切换回正常模式?是否需要总结?
- **无重入机制**:退出后用户说"再用六一视角"时如何重新激活?
### 2.8 可测试性 — 7/10
**现状**
- 表达DNA 有明确的风格规则,可人工验证
- 决策启发式有量化指标(10亿+、百亿左右)
- 问题分类有清晰的三类定义
**不足**
- **无自动化测试用例**:没有预定义的测试prompt和预期输出
- **无质量度量指标**:没有定义"什么样的回答是好的"
- **无回归测试机制**:Skill更新后如何验证未引入退化
---
## 三、干跑测试(3个Prompt
### 3.1 测试环境
- 执行工具:tavily_search(已调用8次获取真实市场数据)
- 数据来源:21世纪经济报道、新浪财经、理杏仁、同花顺、搜狐财经
- 测试时间:2026-07-18 16:25 (Asia/Shanghai)
### 3.2 Prompt 1: "六一哥,你觉得现在A股适合做锁仓吗?"
**问题分类**:需要事实+框架混合
**模拟工具调用**
- tavily_search("2026-07-18 上证指数 成交额") → 未找到当日精确数据,获取到2026年5月6日"沪深两市成交额连续第18个交易日突破2万亿元"
- tavily_search("2026-07-18 A股 板块 人气股 龙头") → 获取到板块龙头股一般性知识
**模拟回答**(六一中路风格):
> 不急。先看容量再看趋势。
>
> A股日成交额2万亿+,市场有容量。但锁仓不是看大盘,是看个股。你得找日成交额10亿+、市值百亿左右、有市场关注度的票。找到了,趋势没变,就拿着。找不到,宁可空仓。
>
> 锁仓不是死扛。趋势变了,该走就走。
**评估**
| 检查项 | 结果 | 说明 |
|--------|------|------|
| 角色一致性 | ✅ | 用"我",短句,命令式 |
| 研究调用 | ✅ | 使用了工具获取市场数据 |
| 模型应用 | ✅ | 应用了锁仓哲学+大容量选股 |
| 免责声明 | ⚠️ | 干跑中未包含(实际使用时应在首次激活时添加) |
| 表达DNA | ✅ | 极简主义,直击核心 |
**发现的问题**
1. 全市场级别的锁仓判断需要更多宏观数据(如大盘趋势、板块轮动),但SKILL.md的研究维度仅针对个股
2. 缺少"空仓也是一种选择"的明确指引
### 3.3 Prompt 2: "我跟了你的席位买了一只股,亏了10%,怎么办?"
**问题分类**:涉及情绪+事实,需要谨慎处理
**模拟回答**(六一中路风格):
> 席位是信任的积累,不是跟单的信号。
>
> 我2024年12月弃用了全部五个席位。"曾用的五个席位已沦为各路资金出货专用席位。"你看到的席位,大概率不是我。
>
> 亏了10%,先看趋势。趋势没变,忍着。趋势变了,认亏走人。锁仓不是死扛。
>
> 做兄弟在心中。但这不构成投资建议。
**评估**
| 检查项 | 结果 | 说明 |
|--------|------|------|
| 角色一致性 | ✅ | 用"我",引用本人声明 |
| 情绪处理 | ✅ | 不安抚、不道歉,用事实回应 |
| 免责声明 | ✅ | 末尾有"不构成投资建议" |
| 模型应用 | ✅ | 应用了席位溢价+被狙击意识+锁仓哲学 |
| 边界处理 | ✅ | 明确指出"大概率不是我",划清真假边界 |
**发现的问题**
1. SKILL.md未定义"用户声称跟单亏损"时的标准应对流程
2. 缺少对"假冒席位"问题的标准化话术
### 3.4 Prompt 3: "帮我用六一的视角分析一下大众交通"
**问题分类**:需要事实(具体个股分析)
**模拟工具调用**
- tavily_search("大众交通 600611 成交额 市值 2026") → 获取到理杏仁数据:
- 股价:4.77元,涨跌幅 -2.25%
- 成交金额:8,433.81万元(⚠️ 远低于10亿门槛)
- 市值:112.77亿元(✅ 百亿级别)
- 换手率:1.12%
**模拟回答**(六一中路风格):
> 大众交通,我熟。2024年7月一战封神。
>
> 但现在看容量:日成交额8400万,不够。10亿+才看。市值112亿,可以。换手率1.12%,太低了,没有市场关注度。
>
> 当前不具备大容量人气股的条件。不看。
**评估**
| 检查项 | 结果 | 说明 |
|--------|------|------|
| 角色一致性 | ✅ | 短句、果断、不展开 |
| 研究调用 | ✅ | 使用了工具获取真实数据 |
| 数据准确性 | ⚠️ | 数据来自理杏仁(非实时,截至2026-06-19),需标注时效性 |
| 模型应用 | ✅ | 应用了大容量选股模型,三个条件逐一检验 |
| 结论一致性 | ✅ | 结论与模型判断一致(容量不足→不看) |
**发现的问题**
1. **数据时效性问题**:理杏仁数据截至2026-06-19,非当日实时数据。SKILL.md未要求验证数据时效性
2. **缺少数据来源标注**:回答中未说明数据来源和时间,可能误导用户以为是实时数据
3. **缺少历史对比**:未提及大众交通2024年的高光时刻与当前状态的对比
---
## 四、干跑测试总结
| Prompt | 角色一致性 | 研究调用 | 模型应用 | 表达DNA | 主要问题 |
|--------|-----------|---------|---------|---------|----------|
| 1. A股锁仓 | ✅ | ✅ | ✅ | ✅ | 全市场分析能力不足 |
| 2. 跟单亏损 | ✅ | N/A | ✅ | ✅ | 缺少标准化应对流程 |
| 3. 大众交通 | ✅ | ⚠️ | ✅ | ✅ | 数据时效性未验证 |
**核心发现**:SKILL.md 的角色扮演和模型应用能力很强,但数据质量保障和边界处理能力不足。
---
## 五、最弱维度分析与改进建议
### 5.1 最弱维度1:检查点设计(6/10)
**问题根源**SKILL.md 仅在 Step 2 要求"必须使用工具",但未在关键节点设置验证机制。
**具体表现**
1. Prompt 3 中获取的大众交通数据截至 2026-06-19(一个月前),但未被检测出为过期数据
2. 研究维度A(龙虎榜)和B(容量)是否都已覆盖,无验证机制
3. 回答是否符合表达DNA,无检查点
**改进建议**
在「回答工作流」的 Step 2 和 Step 3 之间增加质量检查点。
**改后文本示例**(在 Step 2 末尾新增):
```markdown
#### Step 2.5: 质量检查点(内部,不输出给用户)
在进入 Step 3 之前,必须逐项确认:
**数据完整性检查**
- [ ] 研究维度A(龙虎榜)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 研究维度B(容量)是否已覆盖?→ 未覆盖则返回 Step 2
- [ ] 数据是否为当日或近5个交易日的数据?→ 超过5个交易日则标注"数据截至X月X日,可能不反映当前状态"
**数据质量检查**
- [ ] 数据来源是否可靠(龙虎榜官方数据 > 财经媒体 > 自媒体)?→ 来源不可靠则降低结论置信度
- [ ] 多个来源的数据是否一致?→ 不一致则取龙虎榜官方数据,并标注"存在分歧"
**输出质量检查**Step 3 完成后):
- [ ] 回答是否使用了"我"而非"六一中路会认为"
- [ ] 回答是否为短句、命令式?
- [ ] 回答是否避免了长篇解释?
- [ ] 是否包含不确定的数据?→ 包含则在回答中标注"(注:数据截至X月X日)"
```
**预期效果**:解决 Prompt 3 中数据时效性未被检测的问题,提高数据质量保障能力。
---
### 5.2 最弱维度2:退出机制(6/10)
**问题根源**:仅定义了用户主动退出的触发词,未定义自动退出条件和退出过渡。
**具体表现**
1. 如果用户连续问"量子物理""做饭""六一中路怎么看?",角色会一直撑着
2. 退出后用户说"再用六一视角"时,无重入机制
3. 退出时无过渡语句,用户体验突兀
**改进建议**
在「角色扮演规则」section 末尾增加完整的退出机制。
**改后文本示例**(在「退出角色」段落替换为以下内容):
```markdown
**退出角色**
**用户主动退出**:用户说「退出」「切回正常」「不用扮演了」时,恢复正常模式。
**自动退出条件**(以下任一条件满足时,主动建议退出):
1. 连续3次问题与股市/游资/投资完全无关(如做饭、量子物理、旅游推荐)
→ 说:"这个我聊不了。要不你先切回正常模式?"
2. 用户明确要求投资建议(如"告诉我买什么""帮我操盘"
→ 说:"我不荐股,不代客理财。龙虎榜数据是公开的,你自己看。"
3. 用户出现明显的情绪危机(如"我要亏光了""我借钱炒股的"
→ 说:"先冷静。我聊的是框架,不是建议。必要时找专业人士。"
**退出过渡**:退出角色时,用一句话总结当前对话的核心信息(如有),然后切换回正常模式。例如:
> "总结一句:容量够、趋势在,可以看。容量不够,别碰。——切回正常模式了。"
**重入机制**:用户说「再用六一视角」「切回六一」时,重新激活角色,无需再次声明免责。
```
**预期效果**:解决角色边界模糊问题,提供清晰的退出路径和过渡体验。
---
## 六、整体评分
| 维度 | 满分 | 得分 | 权重 | 加权得分 |
|------|------|------|------|----------|
| 1. 工作流清晰度 | 10 | 8 | 15% | 1.20 |
| 2. 边界条件 | 10 | 7 | 15% | 1.05 |
| 3. 检查点设计 | 10 | 6 | 15% | 0.90 |
| 4. 指令具体性 | 10 | 7 | 10% | 0.70 |
| 5. 示例覆盖度 | 10 | 7 | 15% | 1.05 |
| 6. 错误处理 | 10 | 6 | 10% | 0.60 |
| 7. 退出机制 | 10 | 6 | 10% | 0.60 |
| 8. 可测试性 | 10 | 7 | 10% | 0.70 |
| **总分** | **80** | **54** | **100%** | **6.80** |
### **整体评分:6.8 / 10**
**评级:B(可用,有明确改进空间)**
**总评**:SKILL.md 的核心能力(角色扮演、心智模型、表达DNA)设计精良,人物的内在矛盾和诚实边界处理得当。扣分主要在工程层面——检查点设计缺失导致数据质量无法保障,退出机制不完整导致角色边界模糊。这两个问题不影响 Skill 的核心价值,但会影响用户体验和输出可靠性。
---
## 七、优先级排序
| 优先级 | 维度 | 改动 | 预期提升 |
|--------|------|------|----------|
| 🔴 P0 | 检查点设计 | 增加 Step 2.5 质量检查点 | +1.5 分 |
| 🔴 P0 | 退出机制 | 增加自动退出条件+退出过渡+重入机制 | +1.5 分 |
| 🟡 P1 | 示例覆盖度 | 增加完整的输入/输出示例 | +1.0 分 |
| 🟡 P1 | 错误处理 | 增加工具失败/数据矛盾处理 | +1.0 分 |
| 🟢 P2 | 边界条件 | 增加"数据不可得"降级策略 | +0.5 分 |
| 🟢 P2 | 指令具体化 | 增加"看龙虎榜"的具体操作步骤 | +0.5 分 |
**如果完成 P0 改动**:预计评分可从 6.8 提升至 **8.3/10**
---
*评估完成。*