1.1 KiB
1.1 KiB
Tasks: 文本与 Agent 图片理解能力
1. 绑定能力
- 1.1 为文本协议绑定增加图片输入能力字段
- 1.2 为
google.generateContent和openai.chat.completions推断默认图片输入能力 - 1.3 为不支持图片输入的文本绑定保留安全默认值
2. 聊天抽屉文本链
- 2.1 改造
chat-service,在支持的文本绑定上将附件图片组装为image_urlparts - 2.2 保持不支持图片输入的文本模型现有文本行为不变
- 2.3 复用现有图片预处理与 URL 处理逻辑,避免新增平行实现
3. Agent 与 AI 分析链
- 3.1 改造
AgentExecutor默认消息组装逻辑,发送真实参考图片内容 - 3.2 改造
ai_analyze相关入口,确保图片内容在工作流路径中被保留 - 3.3 保留原有参考图片说明文字,但不再仅依赖占位符
4. 验证
- 4.1 补充文本多模态消息组装测试
- 4.2 验证 OpenAI 文本协议可接收图片 part
- 4.3 验证 Google 文本协议可将图片 part 转为
inline_data - 4.4 验证不支持图片输入的文本绑定不会发送图片内容