Skip to content

跨端交接:pos_definitions v15(GDEX round2 + LLM 例句)→ RB reseed

日期:2026-06-03 方向:RVH(治理 + 例句生成 + 重导出)→ RB(reseed 重导入) 前序:v14 见 04-pos-definitions-governance-reseed-handoff.md关联rvh/docs/plans/pos-definitions-governance-v15-examples.md、CHANGELOG [Unreleased]


背景

v14 减法治理 reseed 进 RB 后,RB 复检发现仍有漏网(appeal 残留 ~190 字符丁尼生诗),且约 51% 义项无例句。v15 增量做两件事(不重做 v14 减法):

  1. GDEX round 2:例句长度门 200→150;丢含换行/" / " 诗行;古词表扩充 spake + 精选古语 -est
  2. LLM 例句生成补全deepseek-v4-flash 为每个 sense 预生成短·现代·贴义例句,与清洗后语料混排,结果持久化进仓库缓存(确定性复用,不每 build 调 LLM)。

治理效果(实测)

指标v14v15
词数12,29112,291(不变)
例句 >150 字符(门=200)0
有例句义项占比~49%95%(corpus 35,760 + llm 50,896)
评审留空义项4,072(宁缺毋滥)
生成成本$1.18 一次性

确定性已验证:连续两次重建,pos_definitions 内容 sha 完全一致。

⚠️ 新增 additive 字段:example_source

每个 sense 新增与 examples 等长的平行数组 example_source,值 "corpus" / "llm"

json
"definitions": [
  {"gloss": "...", "examples": ["...","...","..."],
   "example_source": ["corpus","corpus","llm"], "translations": {...}}
]
  • additive:RB / Edge 解析 pos_definitions 时忽略未知键即可(不会破坏现有解析)。
  • 可选消费:RB 展示层可据此重排(corpus/llm 顺序)或打「AI 生成」角标;不消费也无碍。
  • 默认数据层序:corpus 在前、llm 在后,cap≤3(典型 2 corpus + 1 llm)。

交付给 RB 的产物

  • 新 DBassets/databases/reading_vocab.db(RVH 仓库,本批 commit)
  • SHA256688aafdfc0fcb4fa72c835ae4ebce07ec34c20bdf0bea301695ffc80e374b5c3
  • VOCABULARY_SEED_VERSION(RVH 侧 _preinstalledVocabVersion:15
  • schema 不变(v52)

RB 需做(reseed migration)

  1. /vocab-reseed skill(参考 v14 reseed 流程),从上述 byte-equal 内容重导入 vocabulary 表,pos_definitions 整列覆盖(含新 example_source)。
  2. bump RB 自己的 VOCABULARY_SEED_VERSION,触发既存安装重 seed。
  3. INSERT ... ON CONFLICT(word) DO UPDATE SET 覆盖 pos_definitions(禁 INSERT OR REPLACE,遵 RB 父表红线)。
  4. 确认 RB 的 pos_definitions 解析对未知键 example_source 容忍(如需可消费做 UI 角标)。
  5. 校验:reseed 后词数 = 12,291,无 example >150,95% 义项有例句。

注意

  • 通用词典例句 = build 时一次性生成、三端 byte-equal 共享。未来若再生成(新增词增量),同样走「RVH 缓存生成 → 重导出 → bump version → RB reseed」流程。
  • 后续 per-user「真实语境」例句(区别于通用例句)更适合 RB 端产出(RVH 语境为 OCR 图片),见 v14 plan backlog。