<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Computer Vision on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/computer-vision/</link><description>Recent content in Computer Vision on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/computer-vision/index.xml" rel="self" type="application/rss+xml"/><item><title>文生图 (T2I)</title><link>https://terms-en.ai-term-hub.com/zh/terms/t2i/</link><pubDate>Sat, 18 Jul 2026 11:35:43 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/t2i/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>文生图（T2I）生成涉及使用深度学习模型（如扩散模型或GANs），根据自然语言提示合成图像。这些模型学习文本与图像之间的相关性。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>T2I是Text-to-Image（文生图）的缩写，这是一种从文本描述生成视觉图像的生成式AI技术。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>扩散模型&lt;/li>
&lt;li>自然语言处理&lt;/li>
&lt;li>生成对抗网络&lt;/li>
&lt;li>提示工程&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>数字艺术创作&lt;/li>
&lt;li>营销材料生成&lt;/li>
&lt;li>概念可视化&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/stable_diffusion-stable-diffusion/">stable_diffusion (Stable Diffusion)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dalle-dall-e/">dalle (DALL-E)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/multimodal_learning-%E5%A4%9A%E6%A8%A1%E6%80%81%E5%AD%A6%E4%B9%A0/">multimodal_learning (多模态学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>相似度学习</title><link>https://terms-en.ai-term-hub.com/zh/terms/similarity_learning/</link><pubDate>Sat, 18 Jul 2026 11:33:18 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/similarity_learning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>相似度学习专注于训练模型，将输入映射到向量空间，其中相似的项目彼此靠近，不相似的项目相距较远。常用的技术包括孪生网络和三元组损失函数。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种机器学习方法，通过学习距离度量来确定两个对象之间的相似或不相似程度。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>嵌入空间&lt;/li>
&lt;li>距离度量&lt;/li>
&lt;li>三元组损失&lt;/li>
&lt;li>孪生网络&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>人脸识别&lt;/li>
&lt;li>重复项检测&lt;/li>
&lt;li>推荐系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/embeddings-%E5%B5%8C%E5%85%A5%E5%90%91%E9%87%8F/">Embeddings (嵌入向量)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/metric-learning-%E5%BA%A6%E9%87%8F%E5%AD%A6%E4%B9%A0/">Metric Learning (度量学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/contrastive-loss-%E5%AF%B9%E6%AF%94%E6%8D%9F%E5%A4%B1/">Contrastive Loss (对比损失)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/vector-search-%E5%90%91%E9%87%8F%E6%90%9C%E7%B4%A2/">Vector Search (向量搜索)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Sam3</title><link>https://terms-en.ai-term-hub.com/zh/terms/sam3/</link><pubDate>Sat, 18 Jul 2026 11:32:41 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/sam3/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Sam3 不像 SAM（Segment Anything Model）那样是一个广泛认可的标准公共 AI 术语。它可能指第三方的迭代版本、SAM 2 的拼写错误，或者是公司 AI&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>Sam3 可能指分割模型或 AI 工具的特定版本或变体，可能与 Segment Anything Model (SAM) 的迭代版本或专有的内部工具有关。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>图像分割&lt;/li>
&lt;li>模型迭代&lt;/li>
&lt;li>专有工具&lt;/li>
&lt;li>AI 变体&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>图像分割任务&lt;/li>
&lt;li>计算机视觉应用&lt;/li>
&lt;li>模型基准测试&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sam/">SAM&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/segment-anything-model-%E4%BB%BB%E6%84%8F%E5%88%86%E5%89%B2%E6%A8%A1%E5%9E%8B/">Segment Anything Model (任意分割模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89-computer-vision/">计算机视觉 (Computer Vision)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%B7%B1%E5%BA%A6%E5%AD%A6%E4%B9%A0-deep-learning/">深度学习 (Deep Learning)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Sam3 Video</title><link>https://terms-en.ai-term-hub.com/zh/terms/sam3_video/</link><pubDate>Sat, 18 Jul 2026 11:32:41 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/sam3_video/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Sam3 Video 指的是将高级分割模型（可能是 Meta 的 Segment Anything Model 的假设性或特定版本）应用于视频数据。它涉及跨帧跟踪对象&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>该术语可能指应用于视频流的第三代或特定版本的 Segment Anything Model 相关的视频分割功能。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>视频分割&lt;/li>
&lt;li>目标跟踪&lt;/li>
&lt;li>时间一致性&lt;/li>
&lt;li>动态掩码&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动化视频编辑&lt;/li>
&lt;li>自动驾驶感知&lt;/li>
&lt;li>监控分析&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sam/">SAM&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%A7%86%E9%A2%91%E7%9B%AE%E6%A0%87%E5%88%86%E5%89%B2-video-object-segmentation/">视频目标分割 (Video Object Segmentation)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%B7%9F%E8%B8%AA-tracking/">跟踪 (Tracking)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%97%B6%E5%BA%8F%E6%A8%A1%E5%9E%8B-temporal-models/">时序模型 (Temporal Models)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>表征坍塌</title><link>https://terms-en.ai-term-hub.com/zh/terms/representation_collapse/</link><pubDate>Sat, 18 Jul 2026 11:32:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/representation_collapse/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>当神经网络（特别是在自监督对比学习框架中）将所有输入数据点映射到同一个固定的输出向量时，就会发生表征坍塌。这种平凡解虽然最小化了损失函数，但未能学习到有用的特征表示。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>自监督学习中的一种失效模式，模型对所有输入输出相同的表征，导致判别能力丧失。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>自监督学习&lt;/li>
&lt;li>对比损失&lt;/li>
&lt;li>平凡解&lt;/li>
&lt;li>特征学习&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>调试 SimCLR 或 MoCo 模型&lt;/li>
&lt;li>改进对比损失函数&lt;/li>
&lt;li>分析模型收敛性&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%AF%B9%E6%AF%94%E5%AD%A6%E4%B9%A0/">对比学习&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%89%B9%E5%BD%92%E4%B8%80%E5%8C%96/">批归一化&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8A%A8%E9%87%8F%E7%BC%96%E7%A0%81%E5%99%A8/">动量编码器&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%89%B9%E5%BE%81%E6%8F%90%E5%8F%96/">特征提取&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>光学字符识别</title><link>https://terms-en.ai-term-hub.com/zh/terms/ocr/</link><pubDate>Sat, 18 Jul 2026 11:28:49 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/ocr/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>光学字符识别（OCR）利用图像处理与模式识别算法来识别数字图像中的文本。它将打印或手写的字符转换为机器编码的数据，从而实现信息的数字化提取。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>OCR 是一项将扫描纸质文档或图像等不同类型的文档转换为可编辑和可搜索数据的技術。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>文本检测&lt;/li>
&lt;li>字符识别&lt;/li>
&lt;li>图像处理&lt;/li>
&lt;li>数字化&lt;/li>
&lt;li>模式匹配&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>历史档案数字化&lt;/li>
&lt;li>自动化发票处理&lt;/li>
&lt;li>从截图中提取文本&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/computer_vision-%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/">computer_vision (计算机视觉)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/text_recognition-%E6%96%87%E6%9C%AC%E8%AF%86%E5%88%AB/">text_recognition (文本识别)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/document_processing-%E6%96%87%E6%A1%A3%E5%A4%84%E7%90%86/">document_processing (文档处理)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/image_classification-%E5%9B%BE%E5%83%8F%E5%88%86%E7%B1%BB/">image_classification (图像分类)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>目标检测</title><link>https://terms-en.ai-term-hub.com/zh/terms/object_detection/</link><pubDate>Sat, 18 Jul 2026 11:28:35 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/object_detection/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>目标检测扩展了图像分类的功能，不仅确定存在哪些对象，还确定它们的位置。它输出检测到的项目周围的边界坐标及其类别标签。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种计算机视觉技术，使用边界框在图像或视频流中识别并定位目标对象。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>边界框&lt;/li>
&lt;li>类别标签&lt;/li>
&lt;li>YOLO&lt;/li>
&lt;li>Faster R-CNN&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶导航&lt;/li>
&lt;li>零售库存管理&lt;/li>
&lt;li>安防摄像头监控&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9B%BE%E5%83%8F%E5%88%86%E7%B1%BB/">图像分类&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AF%AD%E4%B9%89%E5%88%86%E5%89%B2/">语义分割&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/">计算机视觉&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>掩码生成</title><link>https://terms-en.ai-term-hub.com/zh/terms/mask_generation/</link><pubDate>Sat, 18 Jul 2026 11:25:36 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/mask_generation/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>掩码生成涉及产生空间或时间掩码，以确定在特定操作期间数据集的哪些元素是可见或激活的。在计算机视觉中，它用于对象分割、图像修复等任务；在自然语言处理中，则用于控制注意力机制。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>创建二进制或概率掩码的过程，用于在模型处理期间选择性地隐藏或强调输入数据的某些部分。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>二值掩码&lt;/li>
&lt;li>注意力掩码&lt;/li>
&lt;li>图像修复&lt;/li>
&lt;li>特征选择&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>图像修复与重建&lt;/li>
&lt;li>Transformer注意力机制&lt;/li>
&lt;li>目标检测与分割&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/attention-mechanism-%E6%B3%A8%E6%84%8F%E5%8A%9B%E6%9C%BA%E5%88%B6/">Attention mechanism (注意力机制)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/semantic-segmentation-%E8%AF%AD%E4%B9%89%E5%88%86%E5%89%B2/">Semantic segmentation (语义分割)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/inpainting-%E5%9B%BE%E5%83%8F%E4%BF%AE%E5%A4%8D/">Inpainting (图像修复)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/feature-masking-%E7%89%B9%E5%BE%81%E6%8E%A9%E7%A0%81/">Feature masking (特征掩码)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>LocateAnything</title><link>https://terms-en.ai-term-hub.com/zh/terms/locateanything/</link><pubDate>Sat, 18 Jul 2026 11:24:46 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/locateanything/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>LocateAnything 是一个多功能计算机视觉框架，能够基于自然语言提示或通用先验知识，检测并分割图像中的物体。它利用预训练的基础模型泛化能力，实现零样本环境下的精准定位与分割。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个开源框架，旨在无需针对特定任务进行训练的情况下，跨多种视觉领域实现零样本物体定位和分割。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>零样本学习&lt;/li>
&lt;li>物体定位&lt;/li>
&lt;li>语义分割&lt;/li>
&lt;li>基础模型&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动化库存管理&lt;/li>
&lt;li>医学影像分析&lt;/li>
&lt;li>自动驾驶场景理解&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sam-segment-anything-model-%E5%88%86%E5%89%B2%E4%B8%80%E5%88%87%E6%A8%A1%E5%9E%8B/">SAM (Segment Anything Model, 分割一切模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/clip-%E5%AF%B9%E6%AF%94%E8%AF%AD%E8%A8%80-%E5%9B%BE%E5%83%8F%E9%A2%84%E8%AE%AD%E7%BB%83%E6%A8%A1%E5%9E%8B/">CLIP (对比语言-图像预训练模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/open-vocabulary-detection-%E5%BC%80%E6%94%BE%E8%AF%8D%E6%B1%87%E6%A3%80%E6%B5%8B/">Open-vocabulary Detection (开放词汇检测)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/vision-language-models-%E8%A7%86%E8%A7%89-%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/">Vision-Language Models (视觉-语言模型)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>智能文字识别</title><link>https://terms-en.ai-term-hub.com/zh/terms/intelligent_word_recognition/</link><pubDate>Sat, 18 Jul 2026 11:22:43 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/intelligent_word_recognition/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>智能文字识别是指由神经网络驱动的高级光学字符识别（OCR）技术。它超越了简单的模式匹配，通过理解上下文并处理n&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>利用人工智能算法（特别是深度学习）准确识别和解读来自图像或手写来源的文本。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>光学字符识别&lt;/li>
&lt;li>深度学习&lt;/li>
&lt;li>计算机视觉&lt;/li>
&lt;li>文本提取&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>历史档案数字化&lt;/li>
&lt;li>发票自动化处理&lt;/li>
&lt;li>实时翻译应用&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ocr-%E5%85%89%E5%AD%A6%E5%AD%97%E7%AC%A6%E8%AF%86%E5%88%AB/">OCR (光学字符识别)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/natural-language-processing-%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86/">Natural Language Processing (自然语言处理)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/image-classification-%E5%9B%BE%E5%83%8F%E5%88%86%E7%B1%BB/">Image Classification (图像分类)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/handwriting-recognition-%E6%89%8B%E5%86%99%E8%AF%86%E5%88%AB/">Handwriting Recognition (手写识别)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>图像到图像</title><link>https://terms-en.ai-term-hub.com/zh/terms/image_to_image/</link><pubDate>Sat, 18 Jul 2026 11:21:59 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/image_to_image/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>图像到图像（Image To Image, I2I）涉及使用深度学习模型（如生成对抗网络GANs或扩散模型）将一张图像转换为另一张图像。与简单的滤镜不同，I2I可以极大地改变外观，例如将素描转化为逼真的照片，或将白天场景转换为夜景，同时在转换过程中保持原始图像的基本结构和语义信息。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种生成式AI技术，将输入图像转换为不同的风格、格式或内容，同时保留结构元素。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>风格迁移&lt;/li>
&lt;li>语义分割&lt;/li>
&lt;li>扩散模型&lt;/li>
&lt;li>条件生成&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>艺术风格迁移&lt;/li>
&lt;li>照片增强与修复&lt;/li>
&lt;li>建筑可视化渲染&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/generative-adversarial-networks-%E7%94%9F%E6%88%90%E5%AF%B9%E6%8A%97%E7%BD%91%E7%BB%9C/">Generative Adversarial Networks (生成对抗网络)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/stable-diffusion-%E7%A8%B3%E5%AE%9A%E6%89%A9%E6%95%A3/">Stable Diffusion (稳定扩散)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/super-resolution-%E8%B6%85%E5%88%86%E8%BE%A8%E7%8E%87/">Super Resolution (超分辨率)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/inpainting-%E5%9B%BE%E5%83%8F%E4%BF%AE%E5%A4%8D-inpainting/">Inpainting (图像修复/ inpainting)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>图像到图像转换</title><link>https://terms-en.ai-term-hub.com/zh/terms/i2i/</link><pubDate>Sat, 18 Jul 2026 11:21:46 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/i2i/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>图像到图像（I2I）翻译涉及使用深度学习方法（如生成对抗网络 GAN 或扩散模型），将源域中的像素映射到目标域。它允许进行风格迁移、语义分割等操作，实现不同图像域之间的转换。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>图像到图像（Image-to-Image）翻译是一种计算机视觉技术，它在保留语义内容的同时将输入图像转换为相应的输出图像。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>生成对抗网络&lt;/li>
&lt;li>语义分割&lt;/li>
&lt;li>风格迁移&lt;/li>
&lt;li>潜在空间&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>艺术风格迁移&lt;/li>
&lt;li>照片上色&lt;/li>
&lt;li>卫星图像增强&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/gan-%E7%94%9F%E6%88%90%E5%AF%B9%E6%8A%97%E7%BD%91%E7%BB%9C/">GAN (生成对抗网络)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/diffusion-models-%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B/">Diffusion Models (扩散模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/computer-vision-%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/">Computer Vision (计算机视觉)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>方向位移直方图</title><link>https://terms-en.ai-term-hub.com/zh/terms/histogram_of_oriented_displacements/</link><pubDate>Sat, 18 Jul 2026 11:20:58 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/histogram_of_oriented_displacements/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>方向位移直方图（HOD）是一种用于视频分析的特征提取方法，它将HOG（方向梯度直方图）的概念扩展到时间维度。它在光流向量中计算位移的方向和幅度分布，从而能够有效地描述视频片段中的动态行为和动作模式。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种用于计算机视觉的特征描述符，通过分析视频序列中的位移直方图来捕捉运动模式。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>光流&lt;/li>
&lt;li>特征描述符&lt;/li>
&lt;li>运动分析&lt;/li>
&lt;li>视频处理&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>动作识别&lt;/li>
&lt;li>人类活动分析&lt;/li>
&lt;li>视频监控&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hog-%E6%96%B9%E5%90%91%E6%A2%AF%E5%BA%A6%E7%9B%B4%E6%96%B9%E5%9B%BE/">HOG (方向梯度直方图)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/optical-flow-%E5%85%89%E6%B5%81/">Optical Flow (光流)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sift-%E5%B0%BA%E5%BA%A6%E4%B8%8D%E5%8F%98%E7%89%B9%E5%BE%81%E5%8F%98%E6%8D%A2/">SIFT (尺度不变特征变换)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Google Clips</title><link>https://terms-en.ai-term-hub.com/zh/terms/google_clips/</link><pubDate>Sat, 18 Jul 2026 11:19:07 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/google_clips/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Google Clips 是谷歌开发的一款消费电子产品，它利用设备端的机器学习来识别有趣的场景和主体（如人脸或宠物），并自动拍摄照片或视频。该产品旨在简化摄影过程，让用户专注于体验而非操作。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>Google Clips 是一款口袋大小的 AI 驱动相机，旨在利用机器学习自动捕捉精彩瞬间。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>计算机视觉&lt;/li>
&lt;li>边缘 AI&lt;/li>
&lt;li>自动摄影&lt;/li>
&lt;li>物联网&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>休闲摄影&lt;/li>
&lt;li>宠物监控&lt;/li>
&lt;li>家庭记忆捕捉&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/smart-camera-%E6%99%BA%E8%83%BD%E7%9B%B8%E6%9C%BA/">Smart Camera (智能相机)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/object-detection-%E7%9B%AE%E6%A0%87%E6%A3%80%E6%B5%8B/">Object Detection (目标检测)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/tensorflow-lite-tensorflow-lite%E6%A1%86%E6%9E%B6/">TensorFlow Lite (TensorFlow Lite框架)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>EfficientNet</title><link>https://terms-en.ai-term-hub.com/zh/terms/efficientnet/</link><pubDate>Sat, 18 Jul 2026 11:15:59 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/efficientnet/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>由Google开发，EfficientNet使用复合缩放方法来平衡网络深度、宽度和输入图像分辨率。这种方法使模型能够在保持参数效率的同时达到最先进的准确率水平。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>EfficientNet是一系列卷积神经网络架构，通过均匀扩展深度、宽度和分辨率，以更少的参数实现更高的准确率。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>复合缩放 (Compound scaling)&lt;/li>
&lt;li>MobileNetV2块&lt;/li>
&lt;li>SE注意力机制 (SE attention)&lt;/li>
&lt;li>参数效率&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>移动设备上的图像分类&lt;/li>
&lt;li>资源受限环境中的物体检测&lt;/li>
&lt;li>大规模视觉数据集的特征提取&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/resnet/">ResNet&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/mobilenet/">MobileNet&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8D%B7%E7%A7%AF%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C-convolutional-neural-network/">卷积神经网络 (Convolutional Neural Network)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E7%A5%9E%E7%BB%8F%E6%9E%B6%E6%9E%84%E6%90%9C%E7%B4%A2-neural-architecture-search/">神经架构搜索 (Neural Architecture Search)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Diffusers: Stable Video Diffusion Pipeline</title><link>https://terms-en.ai-term-hub.com/zh/terms/diffusersstablevideodiffusionpipeline/</link><pubDate>Sat, 18 Jul 2026 11:15:21 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/diffusersstablevideodiffusionpipeline/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>该术语指 Hugging Face Diffusers 库中专为视频生成设计的特定实现。它集成了 Stable Video Diffusion (SVD) 模型，这是一种潜在视频扩散模型，能够将静态图像转化为动态视频内容。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个 Hugging Face Diffusers 管道封装，利用 Stable Video Diffusion 模型从静态图像生成视频。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>图像到视频生成&lt;/li>
&lt;li>潜在空间扩散&lt;/li>
&lt;li>Hugging Face Diffusers&lt;/li>
&lt;li>Stable Video Diffusion 模型&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>为静态艺术作品或照片添加动画效果&lt;/li>
&lt;li>为社交媒体内容创建短视频片段&lt;/li>
&lt;li>在电影制作中进行视觉效果的原型设计&lt;/li>
&lt;/ul>
&lt;h2 id="code-example">Code Example&lt;/h2>
&lt;div class="highlight">&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;">&lt;code class="language-python" data-lang="python">&lt;span style="display:flex;">&lt;span>&lt;span style="color:#f92672">from&lt;/span> diffusers &lt;span style="color:#f92672">import&lt;/span> StableVideoDiffusionPipeline
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>&lt;span style="color:#f92672">import&lt;/span> torch
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>pipe &lt;span style="color:#f92672">=&lt;/span> StableVideoDiffusionPipeline&lt;span style="color:#f92672">.&lt;/span>from_pretrained(&lt;span style="color:#e6db74">&amp;#34;stabilityai/stable-video-diffusion-img2vid&amp;#34;&lt;/span>, torch_dtype&lt;span style="color:#f92672">=&lt;/span>torch&lt;span style="color:#f92672">.&lt;/span>float16)
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>pipe&lt;span style="color:#f92672">.&lt;/span>enable_model_cpu_offload()
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>&lt;span style="color:#75715e"># Usage would involve loading an image and calling pipe(image)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/div>&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/stable-diffusion-%E7%A8%B3%E5%AE%9A%E6%89%A9%E6%95%A3/">Stable Diffusion (稳定扩散)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/video-diffusion-models-%E8%A7%86%E9%A2%91%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B/">Video Diffusion Models (视频扩散模型)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hugging-face-transformers-hugging-face-%E8%BD%AC%E6%8D%A2%E5%99%A8%E5%BA%93/">Hugging Face Transformers (Hugging Face 转换器库)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/latent-diffusion-%E6%BD%9C%E5%9C%A8%E6%89%A9%E6%95%A3/">Latent Diffusion (潜在扩散)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Diella</title><link>https://terms-en.ai-term-hub.com/zh/terms/diella/</link><pubDate>Sat, 18 Jul 2026 11:14:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/diella/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Diella 指的是针对提高图像质量（通过增加分辨率或去除噪声）而优化的特定神经网络模型。这些架构通常采用先进的注意力机制或残差连接来提高重建图像的感知质量。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种专为高效图像超分辨率和恢复任务设计的专用深度学习架构。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>超分辨率&lt;/li>
&lt;li>图像恢复&lt;/li>
&lt;li>注意力机制&lt;/li>
&lt;li>感知质量&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>视频超采样/放大&lt;/li>
&lt;li>医学图像增强&lt;/li>
&lt;li>卫星影像分析&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/cnn-%E5%8D%B7%E7%A7%AF%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/">CNN (卷积神经网络)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/gan-%E7%94%9F%E6%88%90%E5%AF%B9%E6%8A%97%E7%BD%91%E7%BB%9C/">GAN (生成对抗网络)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/upsampling-%E4%B8%8A%E9%87%87%E6%A0%B7/">Upsampling (上采样)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/image-processing-%E5%9B%BE%E5%83%8F%E5%A4%84%E7%90%86/">Image Processing (图像处理)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>深度学习抗锯齿</title><link>https://terms-en.ai-term-hub.com/zh/terms/deep_learning_anti_aliasing/</link><pubDate>Sat, 18 Jul 2026 11:13:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/deep_learning_anti_aliasing/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>深度学习抗锯齿是指利用神经网络减轻混叠伪影的方法，混叠伪影发生在高频信号以不足的速率采样时。在计算机图形学&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>使用神经网络减少渲染图像或下采样特征中如锯齿状边缘等视觉伪影的技术。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>信号处理&lt;/li>
&lt;li>特征平滑&lt;/li>
&lt;li>下采样&lt;/li>
&lt;li>视觉伪影&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>图像超分辨率&lt;/li>
&lt;li>神经渲染&lt;/li>
&lt;li>视频稳定&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%B6%85%E9%87%87%E6%A0%B7-super-sampling/">超采样 (Super sampling)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8D%B7%E7%A7%AF-convolution/">卷积 (Convolution)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%B1%A0%E5%8C%96-pooling/">池化 (Pooling)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9B%BE%E5%83%8F%E4%BF%AE%E5%A4%8D-image-restoration/">图像修复 (Image restoration)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据集：嵌入数据/Flickr30K 描述</title><link>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataflickr30k_captions/</link><pubDate>Sat, 18 Jul 2026 11:12:55 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/datasetembedding_dataflickr30k_captions/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>Flickr30K Captions 是一个广泛使用的基准数据集，包含 31,783 张图像，每张图像都标注了五个不同的英文句子来描述视觉内容。它作为构建跨模态理解模型的基础资源。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一个多模态数据集，将 31,000 张图像与人工生成的描述相关联，用于训练跨模态嵌入模型。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>多模态学习&lt;/li>
&lt;li>图文对齐&lt;/li>
&lt;li>跨模态检索&lt;/li>
&lt;li>视觉定位&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>构建图像搜索引擎&lt;/li>
&lt;li>生成图像描述&lt;/li>
&lt;li>训练视觉-语言模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/clip-%E6%A8%A1%E5%9E%8B-clip-model/">CLIP 模型 (CLIP Model)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%A7%86%E8%A7%89-%E8%AF%AD%E8%A8%80%E9%A2%84%E8%AE%AD%E7%BB%83-visual-language-pretraining/">视觉-语言预训练 (Visual-Language Pretraining)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9B%BE%E5%83%8F%E6%8F%8F%E8%BF%B0%E7%94%9F%E6%88%90-image-captioning/">图像描述生成 (Image Captioning)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>对比式语言-图像预训练</title><link>https://terms-en.ai-term-hub.com/zh/terms/contrastive_languageimage_pre_training/</link><pubDate>Sat, 18 Jul 2026 11:11:27 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/contrastive_languageimage_pre_training/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>对比式语言-图像预训练（CLIP）是一种在图像及其对应的互联网标题上训练的神经网络架构。它使用对比目标来最大化共现（图像-文本对的相似度）。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种多模态预训练方法，使用对比损失函数对齐图像和文本表示。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>多模态学习&lt;/li>
&lt;li>余弦相似度&lt;/li>
&lt;li>零样本分类&lt;/li>
&lt;li>编码器架构&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>图像搜索引擎&lt;/li>
&lt;li>文生图生成指导&lt;/li>
&lt;li>视觉问答&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/dall-e/">DALL-E&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%A7%86%E8%A7%89transformer-vision-transformers/">视觉Transformer (Vision Transformers)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86-natural-language-processing/">自然语言处理 (Natural Language Processing)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%B5%8C%E5%85%A5%E7%A9%BA%E9%97%B4-embedding-spaces/">嵌入空间 (Embedding Spaces)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>类激活映射</title><link>https://terms-en.ai-term-hub.com/zh/terms/class_activation_mapping/</link><pubDate>Sat, 18 Jul 2026 11:10:07 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/class_activation_mapping/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>CAM 在输入图像上叠加热力图，以显示哪些像素对模型针对特定类别标签的决策贡献最大。它通过对最终卷积层应用全局平均池化来工作，从而定位关键特征区域。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>类激活映射（CAM）是一种可视化技术，用于高亮显示输入图像中对特定预测类别贡献最大的区域。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>热力图可视化&lt;/li>
&lt;li>可解释性&lt;/li>
&lt;li>特征重要性&lt;/li>
&lt;li>全局平均池化&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>医学影像诊断验证&lt;/li>
&lt;li>自动驾驶物体检测调试&lt;/li>
&lt;li>可解释 AI 报告&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/grad-cam-%E6%A2%AF%E5%BA%A6%E5%8A%A0%E6%9D%83%E7%B1%BB%E6%BF%80%E6%B4%BB%E6%98%A0%E5%B0%84/">Grad-CAM (梯度加权类激活映射)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/saliency-maps-%E6%98%BE%E8%91%97%E6%80%A7%E5%9B%BE/">Saliency Maps (显著性图)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainable-ai-%E5%8F%AF%E8%A7%A3%E9%87%8A%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/">Explainable AI (可解释人工智能)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/convolutional-neural-networks-%E5%8D%B7%E7%A7%AF%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/">Convolutional Neural Networks (卷积神经网络)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>两阶段的</title><link>https://terms-en.ai-term-hub.com/zh/terms/two_stage/</link><pubDate>Sat, 18 Jul 2026 10:59:01 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/two_stage/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>两阶段架构将复杂任务划分为两个独立的步骤，通常涉及检测后跟分类或细化。在计算机视觉中，典型的例子包括像 Faster R-CNN 这样的对象检测器，先生成区域建议，再进行分类。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种流水线架构，其中处理过程分为 distinct 且顺序进行的阶段。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>顺序处理&lt;/li>
&lt;li>区域提议&lt;/li>
&lt;li>模块化&lt;/li>
&lt;li>流水线&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>对象检测（例如 Faster R-CNN）&lt;/li>
&lt;li>人脸识别流水线&lt;/li>
&lt;li>大语言模型中的多步推理&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/single_stage-%E5%8D%95%E9%98%B6%E6%AE%B5/">single_stage (单阶段)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/object_detection-%E5%AF%B9%E8%B1%A1%E6%A3%80%E6%B5%8B/">object_detection (对象检测)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/pipeline-%E6%B5%81%E6%B0%B4%E7%BA%BF/">pipeline (流水线)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>细粒度</title><link>https://terms-en.ai-term-hub.com/zh/terms/fine_grained/</link><pubDate>Sat, 18 Jul 2026 10:56:23 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/fine_grained/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>细粒度分析涉及在子类别层面而非仅仅在主类别层面识别和分类对象或概念。例如，区分狗的具体品种或不同品牌的智能手机，而不是仅仅将其归类为“动物”或“电子产品”。这要求模型捕捉更细微的特征差异。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>描述需要在宽泛类别内区分细微差异的分析或分类任务。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>子分类&lt;/li>
&lt;li>类内方差&lt;/li>
&lt;li>详细特征&lt;/li>
&lt;li>分层标签&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>生态学中的物种鉴定&lt;/li>
&lt;li>电商中的产品变体检测&lt;/li>
&lt;li>面部表情的微分析&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/classification-%E5%88%86%E7%B1%BB/">classification (分类)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/visual_features-%E8%A7%86%E8%A7%89%E7%89%B9%E5%BE%81/">visual_features (视觉特征)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hierarchy-%E5%B1%82%E7%BA%A7%E7%BB%93%E6%9E%84/">hierarchy (层级结构)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/granularity-%E7%B2%92%E5%BA%A6/">granularity (粒度)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>视觉（Visual）</title><link>https://terms-en.ai-term-hub.com/zh/terms/visual/</link><pubDate>Sat, 18 Jul 2026 10:55:52 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/visual/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AI 中的“视觉”一词主要涉及计算机视觉领域，该领域致力于使机器能够从数字图像、视频和其他视觉输入中提取有意义的信息。它涉及图像处理、对象检测等技术。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>与视力或图像相关，通常指处理和解释图像和视频等视觉数据的计算机视觉任务。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>计算机视觉&lt;/li>
&lt;li>图像处理&lt;/li>
&lt;li>目标检测&lt;/li>
&lt;li>像素数据&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>人脸识别系统&lt;/li>
&lt;li>用于诊断的医学图像分析&lt;/li>
&lt;li>自动驾驶汽车的障碍物检测&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/computer-vision-%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/">Computer Vision (计算机视觉)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/image-recognition-%E5%9B%BE%E5%83%8F%E8%AF%86%E5%88%AB/">Image Recognition (图像识别)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/cnn-%E5%8D%B7%E7%A7%AF%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/">CNN (卷积神经网络)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/optical-character-recognition-%E5%85%89%E5%AD%A6%E5%AD%97%E7%AC%A6%E8%AF%86%E5%88%AB/">Optical Character Recognition (光学字符识别)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>感知</title><link>https://terms-en.ai-term-hub.com/zh/terms/perception/</link><pubDate>Sat, 18 Jul 2026 10:53:38 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/perception/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AI 感知涉及将原始传感器数据转换为可由更高层推理模块处理的意义信息。这包括用于解释视觉场景的计算机视觉、用于处理声音的语音识别以及用于理解文本的自然语言处理。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>感知是 AI 系统解释图像或音频等感官输入数据以理解其环境的过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>计算机视觉&lt;/li>
&lt;li>传感器融合&lt;/li>
&lt;li>特征提取&lt;/li>
&lt;li>模式识别&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶车辆导航&lt;/li>
&lt;li>人脸识别系统&lt;/li>
&lt;li>语音助手&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/sensing-%E4%BC%A0%E6%84%9F/">Sensing (传感)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/object-detection-%E7%9B%AE%E6%A0%87%E6%A3%80%E6%B5%8B/">Object Detection (目标检测)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/nlp-%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86/">NLP (自然语言处理)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/multimodal-learning-%E5%A4%9A%E6%A8%A1%E6%80%81%E5%AD%A6%E4%B9%A0/">Multimodal Learning (多模态学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>运动</title><link>https://terms-en.ai-term-hub.com/zh/terms/motion/</link><pubDate>Sat, 18 Jul 2026 10:53:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/motion/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在计算机视觉和机器人领域，运动指的是对视觉数据或物理系统中移动的检测与分析。光流等算法用于估计视在运动的模式。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>物体相对于时间和参考系的位置随时间的连续变化。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>光流&lt;/li>
&lt;li>运动学&lt;/li>
&lt;li>目标跟踪&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶车辆导航&lt;/li>
&lt;li>视频监控系统分析&lt;/li>
&lt;li>手势识别系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/velocity-%E9%80%9F%E5%BA%A6/">Velocity (速度)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/acceleration-%E5%8A%A0%E9%80%9F%E5%BA%A6/">Acceleration (加速度)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/pose-estimation-%E5%A7%BF%E6%80%81%E4%BC%B0%E8%AE%A1/">Pose Estimation (姿态估计)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>匹配</title><link>https://terms-en.ai-term-hub.com/zh/terms/matching/</link><pubDate>Sat, 18 Jul 2026 10:53:03 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/matching/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>匹配是机器学习中用于建立不同数据实体之间关系的关键技术。在计算机视觉中，特征匹配用于识别图像间的对应点；在推荐系统中，则用于匹配用户偏好与物品特征。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>匹配涉及将两组数据点或特征对齐，以识别它们之间的对应关系、相似性或最优配对。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>特征对应&lt;/li>
&lt;li>相似度度量&lt;/li>
&lt;li>嵌入空间&lt;/li>
&lt;li>最近邻搜索&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>视频中的目标跟踪&lt;/li>
&lt;li>推荐引擎&lt;/li>
&lt;li>数据库中的重复项检测&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/cosine-similarity-%E4%BD%99%E5%BC%A6%E7%9B%B8%E4%BC%BC%E5%BA%A6/">Cosine Similarity (余弦相似度)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/retrieval-%E6%A3%80%E7%B4%A2/">Retrieval (检索)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/clustering-%E8%81%9A%E7%B1%BB/">Clustering (聚类)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/embedding-%E5%B5%8C%E5%85%A5/">Embedding (嵌入)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>检测</title><link>https://terms-en.ai-term-hub.com/zh/terms/detection/</link><pubDate>Sat, 18 Jul 2026 10:49:53 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/detection/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>检测是计算机视觉和信号处理的核心任务，AI模型在此过程中识别感兴趣实体的存在及其位置。与仅分配标签的分类不同，检测通常还包含定位信息（如边界框）。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>在数据集或环境中识别和定位特定对象、事件或异常的过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>边界框&lt;/li>
&lt;li>对象定位&lt;/li>
&lt;li>异常识别&lt;/li>
&lt;li>阈值处理&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>人脸识别系统&lt;/li>
&lt;li>制造缺陷检测&lt;/li>
&lt;li>自动驾驶行人检测&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/computer-vision-%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/">Computer Vision (计算机视觉)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/yolo-you-only-look-once/">YOLO (You Only Look Once)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/segmentation-%E5%88%86%E5%89%B2/">Segmentation (分割)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>