跳转至

小樱桃语音交互 · 概念

type: concept status: 已确认 相关: 数字孪生系统 · SOP-001

是什么

小樱桃是苏子桐的 AI 语音小伙伴——不是助手、不是老师,是永远比苏子桐大 2 岁的姐姐型玩伴

技术选型

组件 选型 原因
硬件 OH2P 小爱音箱 Pro(刷 xiaozhi-esp32 固件) 开源、低成本、可自控
桥接器 open-xiaoai-xiaozhi 开源中间层,连接音箱与服务器
服务器 xiaozhi-esp32-server(Docker) 全栈语音服务
LLM glm-4.5-air(智谱,备用 deepseek-chat) 免费额度大、中文好、支持PowerMem
TTS CosyVoice2-0.5B:anna(硅基流动) 音质好、延迟低
ASR FunASR SenseVoiceSmall(本地) 离线稳定、延迟低
记忆 PowerMem(SQLite + embedding-3 1536维) 本地向量记忆
稳定层 stable_profile.txt(你维护的权威画像) 每次对话按话题匹配注入

关键参数(当前实际值)

参数 server bridge
VAD threshold 0.30 0.10
VAD threshold_low 0.20 0.01
min_silence 1200ms 1200ms(两端统一)
音量增益 +6dB +6dB(codec.py)+3dB(TTS gain)
记忆 PowerMem 动态层 stable_profile.txt 稳定层

用户画像 — 双层注入

<memory>
  <stable_profile>          ← 你维护的文件,按话题匹配
    [聊RAZ → 只注入学习块]
    [聊叶罗丽 → 只注入兴趣块]
    [不命中 → 只注入概要]
  </stable_profile>

  <dynamic_profile>         ← PowerMem 自动学习
    [AI 对话中提取的印象]
  </dynamic_profile>

  优先级:stable > dynamic
</memory>

反哺机制(新版)

旧机制(已废弃):融合画像 → inject_portrait_to_powermem.py → 向量切片 → PowerMem

新机制:融合画像 → stable_profile_generator.py → stable_profile.txt → 每句话直接注入

详细运维参数见 SOP-001