主题
跨端交接:pos_definitions v15(GDEX round2 + LLM 例句)→ RB reseed
日期:2026-06-03 方向:RVH(治理 + 例句生成 + 重导出)→ RB(reseed 重导入) 前序:v14 见 04-pos-definitions-governance-reseed-handoff.md关联:rvh/docs/plans/pos-definitions-governance-v15-examples.md、CHANGELOG [Unreleased]
背景
v14 减法治理 reseed 进 RB 后,RB 复检发现仍有漏网(appeal 残留 ~190 字符丁尼生诗),且约 51% 义项无例句。v15 增量做两件事(不重做 v14 减法):
- GDEX round 2:例句长度门 200→150;丢含换行/
" / "诗行;古词表扩充spake+ 精选古语-est。 - LLM 例句生成补全:
deepseek-v4-flash为每个 sense 预生成短·现代·贴义例句,与清洗后语料混排,结果持久化进仓库缓存(确定性复用,不每 build 调 LLM)。
治理效果(实测)
| 指标 | v14 | v15 |
|---|---|---|
| 词数 | 12,291 | 12,291(不变) |
| 例句 >150 字符 | (门=200) | 0 |
| 有例句义项占比 | ~49% | 95%(corpus 35,760 + llm 50,896) |
| 评审留空义项 | — | 4,072(宁缺毋滥) |
| 生成成本 | — | $1.18 一次性 |
确定性已验证:连续两次重建,pos_definitions 内容 sha 完全一致。
⚠️ 新增 additive 字段:example_source
每个 sense 新增与 examples 等长的平行数组 example_source,值 "corpus" / "llm":
json
"definitions": [
{"gloss": "...", "examples": ["...","...","..."],
"example_source": ["corpus","corpus","llm"], "translations": {...}}
]- additive:RB / Edge 解析 pos_definitions 时忽略未知键即可(不会破坏现有解析)。
- 可选消费:RB 展示层可据此重排(corpus/llm 顺序)或打「AI 生成」角标;不消费也无碍。
- 默认数据层序:corpus 在前、llm 在后,cap≤3(典型 2 corpus + 1 llm)。
交付给 RB 的产物
- 新 DB:
assets/databases/reading_vocab.db(RVH 仓库,本批 commit) - SHA256:
688aafdfc0fcb4fa72c835ae4ebce07ec34c20bdf0bea301695ffc80e374b5c3 - VOCABULARY_SEED_VERSION(RVH 侧
_preinstalledVocabVersion):15 - schema 不变(v52)
RB 需做(reseed migration)
- 用
/vocab-reseedskill(参考 v14 reseed 流程),从上述 byte-equal 内容重导入 vocabulary 表,pos_definitions 整列覆盖(含新example_source)。 - bump RB 自己的
VOCABULARY_SEED_VERSION,触发既存安装重 seed。 INSERT ... ON CONFLICT(word) DO UPDATESET 覆盖 pos_definitions(禁 INSERT OR REPLACE,遵 RB 父表红线)。- 确认 RB 的 pos_definitions 解析对未知键
example_source容忍(如需可消费做 UI 角标)。 - 校验:reseed 后词数 = 12,291,无 example >150,95% 义项有例句。
注意
- 通用词典例句 = build 时一次性生成、三端 byte-equal 共享。未来若再生成(新增词增量),同样走「RVH 缓存生成 → 重导出 → bump version → RB reseed」流程。
- 后续 per-user「真实语境」例句(区别于通用例句)更适合 RB 端产出(RVH 语境为 OCR 图片),见 v14 plan backlog。