# 图片输入

> 在对话中上传图片，让 Agent 结合图片内容回答问题。

---

LLMS 索引： [llms.txt](/zh/llms.txt)

---

## 用图片补充文字

遇到界面问题、设计稿或图表时，可以直接把图片附在消息中，让 Agent 结合图片和文字理解任务。例如，附上错误截图并说明操作步骤，或让支持视觉的模型检查页面布局。

## 把问题说具体

例如，附上页面截图后可以问：“这张图中保存按钮被遮住了，请指出可能的布局问题，并说明还需要哪些信息。”比较两张图时，注明哪张是预期效果、哪张是当前页面。这样 Agent 更容易围绕同一个问题回答。

如果希望修改代码，还需要提供对应项目及文件访问能力；一张截图本身只提供视觉信息。

## 开始使用

1. 选择支持图片理解的模型和执行目标。
2. 在 Chat 中添加图片：Web 和 Desktop 把图片粘贴到输入框，Mobile 从相册选择。然后写明希望 Agent 关注的部分。
3. 确认附件后发送，检查回复是否正确理解了图片内容。

| 项目 | 支持范围 |
| --- | --- |
| 图片格式 | JPEG、PNG、GIF、WebP |
| 每条消息 | 最多 5 张图片 |
| 单张大小 | 最多 5 MB |
| 附件总大小 | 每条消息最多 10 MB |

```mermaid
flowchart LR
    A["图片 + 文字问题"] --> B["Chat 消息"]
    B --> C["支持图片的模型 / 外部运行时"]
    C --> D["结合图片作答"]
```

图片能否被理解，取决于所选模型及外部运行时的支持情况；成功添加附件不代表所有模型都能识别图片。截图中的文字过小或内容不清晰时，补充关键文字和具体问题通常更有效。

[查看 Chat 使用指南](/zh/docs/guides/chat/)。
