Files

27 lines
1.1 KiB
Markdown

# Tasks: 文本与 Agent 图片理解能力
## 1. 绑定能力
- [x] 1.1 为文本协议绑定增加图片输入能力字段
- [x] 1.2 为 `google.generateContent``openai.chat.completions` 推断默认图片输入能力
- [x] 1.3 为不支持图片输入的文本绑定保留安全默认值
## 2. 聊天抽屉文本链
- [x] 2.1 改造 `chat-service`,在支持的文本绑定上将附件图片组装为 `image_url` parts
- [x] 2.2 保持不支持图片输入的文本模型现有文本行为不变
- [x] 2.3 复用现有图片预处理与 URL 处理逻辑,避免新增平行实现
## 3. Agent 与 AI 分析链
- [x] 3.1 改造 `AgentExecutor` 默认消息组装逻辑,发送真实参考图片内容
- [x] 3.2 改造 `ai_analyze` 相关入口,确保图片内容在工作流路径中被保留
- [x] 3.3 保留原有参考图片说明文字,但不再仅依赖占位符
## 4. 验证
- [x] 4.1 补充文本多模态消息组装测试
- [x] 4.2 验证 OpenAI 文本协议可接收图片 part
- [x] 4.3 验证 Google 文本协议可将图片 part 转为 `inline_data`
- [x] 4.4 验证不支持图片输入的文本绑定不会发送图片内容