Files

1.1 KiB

Tasks: 文本与 Agent 图片理解能力

1. 绑定能力

  • 1.1 为文本协议绑定增加图片输入能力字段
  • 1.2 为 google.generateContentopenai.chat.completions 推断默认图片输入能力
  • 1.3 为不支持图片输入的文本绑定保留安全默认值

2. 聊天抽屉文本链

  • 2.1 改造 chat-service,在支持的文本绑定上将附件图片组装为 image_url parts
  • 2.2 保持不支持图片输入的文本模型现有文本行为不变
  • 2.3 复用现有图片预处理与 URL 处理逻辑,避免新增平行实现

3. Agent 与 AI 分析链

  • 3.1 改造 AgentExecutor 默认消息组装逻辑,发送真实参考图片内容
  • 3.2 改造 ai_analyze 相关入口,确保图片内容在工作流路径中被保留
  • 3.3 保留原有参考图片说明文字,但不再仅依赖占位符

4. 验证

  • 4.1 补充文本多模态消息组装测试
  • 4.2 验证 OpenAI 文本协议可接收图片 part
  • 4.3 验证 Google 文本协议可将图片 part 转为 inline_data
  • 4.4 验证不支持图片输入的文本绑定不会发送图片内容