离线反思闭环 + 人设漂移守护 #41
Loading…
Add table
Add a link
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
Parent
Phase 4 PRD:#33([PRD] arise 主动性与真人感(Proactivity & Liveliness)—— Phase 4 落地)
What to build
机器人开始从自己的主动尝试里学到教训——主动开口后被无视了、被追问了、对方接得很开心——这些弱反馈
离线积累成自然语言教训,自主微调门控阈值/画像/技能。但任何一笔这样的自主写入,落库前都必须先过一道
独立的"是否偏离人设"否决闸;没通过就直接丢弃,不会有第二次机会去污染人设。这两件事(反思闭环本身、
以及守护它的否决闸)打包在一个 ticket 里,因为否决闸在本阶段唯一的存在意义就是监督反思的写入。
Acceptance criteria
(正:主动后有人接/话题延续/energy 升;负:被无视/被"别烦"/冷场/被追问)产出自然语言教训
(带证据指针,指向具体决策快照)。
"最大化净参与"(会导致噪声坍缩)——需要有测试或至少明确的实现说明证明这两种退化解都被目标函数
本身挡住,不是靠额外的检测逻辑。
- 门控阈值 offset:对称有界
[floor, ceiling],步长不对称(抬静默阈值快于降),无信号时衰减朝安静方向,offset 本身锚回基值(不会永久漂移)。
- per-chat 画像。
- 技能(写入前按向量相似度查是否与现有技能语义重叠,命中则融入/精炼现有条目,不命中才新建)。
landed/fell-flat/annoyed)是同一份分类逻辑,被 #34 的情感态 dominance快路、本 ticket 的 hit-rate 慢路共同消费,不重复写分类代码。
(不承接产出候选那条推理链的新鲜调用)LLM-as-judge 判断——喂 persona port 完整结构化人设 +
候选内容,做二元判断"是否与人设基线冲突" + 简短理由。
反思下轮可重新尝试产出同一条教训(不是永久拉黑)。
反思闭环自己已有的反坍缩护栏,不需要漂移守护重复覆盖)。
候选通过并落库、候选被否决而丢弃、判断调用失败触发 fail-closed 丢弃。
Blocked by