Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

当前实现状态(2026-07-18)

宋红 · AgentOS 编排层 / SimCar 端侧探索 资料入口:D:\THU\BeiJing\嘲风\工作日志\26-当前项目与总览资料联合进度盘点-2026-07-17.md

一、当前基线

项目状态
AgentOS 集成分支integration/agentos-20260717 已验证
SimCar 探索分支feat/simcar-agent-loop
SimCar worktree/root/chaofeng/.claude/worktrees/simcar-agent-loop/agent-llm-vla
最新提交55d45ac
全量测试277 collected / 267 passed / 10 skipped / 0 failed
模拟器修改
vla_service/** 修改
push未执行

二、已经具备的端侧能力

2.1 语言与编排

  • 中文文本输入;
  • SenseVoice 音频文件转写入口;
  • 关键词、动作-对象信号和否定拦截;
  • Ollama/Qwen 高层 Planner 接口;
  • TaskPlan/TaskStep 结构化计划;
  • Orchestrator 的执行、Judge、重试和终态契约;
  • 结构化 attempt 日志。

2.2 SimCar 控制

  • 前进、后退、左右转、停车;
  • 单段平移不超过 5 cm;
  • 单次运动距离和转角上限;
  • 每段动作后读取位姿;
  • 碰撞、断连和超时 fail closed;
  • hasBall=true + armState=holding 的真值捡球判定。

2.3 复合任务 MVP

端侧 Planner 允许以下技能:

move
turn
stop
navigate_around
pick_ball

在障碍物坐标、尺寸和安全间距已经配置的前提下,可以执行:

绕过已知障碍物,把球捡起来

当前绕障来源是 known_scene_geometry,不是相机视觉。未知障碍物或“这个”无法唯一 grounding 时,不会发出移动命令。

三、语音和端侧推理现状

3.1 已确认

  • WSLg 已暴露 unix:/mnt/wslg/PulseServer
  • WSLg 目录中存在 PulseAudioRDPSource,具备向 WSL 提供音频源的基础条件;
  • SenseVoice provider 已经能够处理 WAV 文件;
  • /root/.ollama 中已有 qwen2.5:1.5b 模型文件;
  • Runner 已支持文本和 @audio /absolute/path.wav

3.2 尚未完成

  • Ubuntu 用户态尚未安装 pactlparec/arecord 等采集工具;
  • 当前入口是“录音文件→识别”,不是实时麦克风流;
  • 还没有 VAD、分片上传、实时 partial transcript、打断和急停通道;
  • Ollama daemon 需要显式启动并完成一次 Planner 实测;
  • 尚未决定是 WSLg 直接采集还是 Windows/浏览器采集后推送到 WSL。

推荐顺序:先用 WSLg PulseAudio source 验证 16 kHz 单声道录音,再加 200~500 ms 音频分片和 VAD,最后将 partial transcript 接入 Planner;急停单独走本地确定性通道,不等待 LLM。

四、抽象轨迹能力边界

当前 Planner 还不是 GPT-5.6 级的任意抽象轨迹执行器。对于:

走个正方形

系统不应该让 1.5B 模型随意猜边长。正确实现方式是新增高层技能,例如:

{
  "skill": "trace_shape",
  "arguments": {
    "shape": "square",
    "side_cm": 20,
    "direction": "left"
  }
}

其中 side_cm 可以来自用户明确表达,也可以来自配置的安全默认值;若没有默认值则进入澄清。trace_shape 内部再编译成四段平移和四段 90° 转向,并在每段后读状态。

后续应按以下等级扩展:

  1. L1:平移、旋转、速度、持续时间、急停;
  2. L2:正方形、长方形、圆形、等边三角形;
  3. L3:S 型、8 字、已知障碍物绕行、窄通道、返回起点;
  4. L4:全局路径、局部避障、找球、抓球和多步任务调度。

五、真实能力边界

已经在线验证的是:准备好的无障碍 SimCar 场景中,真值状态驱动的自动捡球闭环。

尚未证明的是:

  • 通过摄像头识别任意可乐瓶或障碍物;
  • 对“前面那个”进行视觉 grounding;
  • 未知环境下自主建图和导航;
  • GPT-5.6 级任意抽象指令的一次性可靠执行。

六、下一步验收门槛

  • 安装并验证 WSLg 音频采集工具;
  • 启动 Ollama,记录 Qwen 1.5B 对基础动作、规则图形和复合任务的计划成功率;
  • 新增 trace_shape 及其 Schema、动作编译器和安全测试;
  • 将实时语音入口拆成“识别流”和“动作流”,支持急停优先;
  • 在 SimCar 中建立带障碍物坐标的确定性场景,完成一次真实绕障 live 验收;
  • 1.5B 若在结构化计划、指代和抽象轨迹上不稳定,再比较 3B/7B 端侧模型,不先把低层安全交给模型。