feat: Agent 多模式系统、视觉模型集成、LLM 能力分层与 P3 性能收尾
核心架构变更:
1. Agent 多模式系统替代 Coordinator
- 移除 src/agent/coordinator/(Coordinator Agent/Worker/Tools,946 行)
- 新建 src/agent/modes/:声明式模式抽象(AgentMode/ModeConfig/ToolSet)
- 三种内置模式:
- default:通用科研助手,零覆盖保持现有行为
- deep-research:16 步、启用思考、research 权限、系统性调研
- literature-reader:白名单工具、只读沙箱、结构化阅读
- ModeRegistry + ModeConfig 预设 + ToolSet 过滤 + 身份/原则覆盖
- AgentRuntime::with_mode() 统一入口,模式持久化到 session.mode 字段
- GET /api/chat/modes 提供模式列表给前端选择器
2. 视觉模型与图片分析
- 新增 analyze_image 工具(340 行):本地/URL 图片 → 视觉模型流式分析
- LlmClient::analyze_image_stream():SSE 增量实时推送
- 配置:LLM_VISION_MODEL / LLM_VISION_API_KEY / LLM_VISION_API_BASE
- 前端:粘贴/选择图片附件,重试时复用文件路径
- Service 层移除 /chat/rag 和 /chat/figure 端点,统一走 Agent SSE
- Body limit 提升至 100MB 适配大图上传
3. LLM 三级能力分层
- Tier 1 (Core) → Tier 2 (Medium) → Tier 3 (Fast),级联回退
- medium_llm / fast_llm / vision_llm 注入 AppState
- 资产批量翻译 → Medium LLM + Semaphore(3) 并发控制
- 记忆提取/上下文压缩子代理 → Fast LLM
- SubAgentRunner::with_llm_client() 支持注入专用 LLM
4. 数据库与性能优化
- SQLite 启用 WAL + busy_timeout(10s) 处理并发写入
- RAG ingest:DELETE 合并为原子语句 + 批量事务写入
- Meta sync:save_paper_to_db_tx() 事务化批量插入
- 翻译词典:first_words HashSet 预过滤 + next_valid_index 跳跃优化
- read_file 不截断输出 + skip_persist 防止级联磁盘持久化
5. 工具系统增强
- ToolContext 增加 tool_call_id + max_output_chars
- ToolOutput 增加 skip_persist 标记
- TextDelta SSE 携带可选 tool_call_id 支持工具的流式输出
- ChatMessage::text() 辅助方法
This commit is contained in:
+17
-5
@@ -21,6 +21,23 @@ LLM_MODEL=gpt-4o-mini
|
||||
# 备用模型链(逗号分隔,按顺序轮换尝试,可选)
|
||||
# LLM_FALLBACK_CHAIN=gpt-4o-mini,deepseek-chat
|
||||
|
||||
# 中型大语言模型配置(用于文献翻译、RAG,默认级联回退至核心 LLM 配置)
|
||||
# LLM_MEDIUM_API_KEY=your_llm_medium_api_key_here
|
||||
# LLM_MEDIUM_API_BASE=https://api.openai.com/v1
|
||||
# LLM_MEDIUM_MODEL=gpt-4o-mini
|
||||
|
||||
# 快速大语言模型配置(用于记忆提取等后台辅助任务,默认级联回退至中型 LLM 配置)
|
||||
# LLM_FAST_API_KEY=your_llm_fast_api_key_here
|
||||
# LLM_FAST_API_BASE=https://api.openai.com/v1
|
||||
# LLM_FAST_MODEL=gpt-3.5-turbo
|
||||
|
||||
# ── 视觉模型(可选,配置后启用图片分析能力)──
|
||||
# 专用视觉模型名称。主 Agent 可为纯文本模型,图片分析通过 analyze_image 工具
|
||||
# 委托给此模型。用户上传图片时也会先用此模型预处理再交给 Agent。
|
||||
# LLM_VISION_MODEL=gpt-4o
|
||||
# LLM_VISION_API_KEY=your_vision_api_key_here(空时回退到 LLM_API_KEY)
|
||||
# LLM_VISION_API_BASE=https://api.openai.com/v1(空时回退到 LLM_API_BASE)
|
||||
|
||||
# 向量嵌入模型配置(未设置时默认回退到 LLM 的 API Key 和 Base)
|
||||
# EMBEDDING_API_KEY=your_embedding_api_key_here
|
||||
# EMBEDDING_API_BASE=https://api.openai.com/v1
|
||||
@@ -92,11 +109,6 @@ LOG_DIR=./logs
|
||||
# 触发 snip 压缩的最大消息数(默认 50)
|
||||
# AGENT_MAX_MESSAGES=50
|
||||
|
||||
# ── P2 Coordinator Mode ──
|
||||
# Worker 最大并发数(默认 4)
|
||||
# AGENT_COORDINATOR_MAX_WORKERS=4
|
||||
# Worker 超时秒数(默认 300)
|
||||
# AGENT_COORDINATOR_WORKER_TIMEOUT=300
|
||||
|
||||
# ── 权限系统 ──
|
||||
# Agent 工具权限规则(逗号分隔,支持内容级匹配 "ToolName(pattern)")
|
||||
|
||||
Reference in New Issue
Block a user