<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Data Quality on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/data-quality/</link><description>Recent content in Data Quality on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/data-quality/index.xml" rel="self" type="application/rss+xml"/><item><title>标签噪声</title><link>https://terms-en.ai-term-hub.com/zh/terms/label_noise/</link><pubDate>Sat, 18 Jul 2026 11:23:29 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/label_noise/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>标签噪声指的是数据实例的真实类别标签与训练数据集中提供的标签之间的差异。这可能源于人工标注错误、模糊的数据点或数据采集过程中的缺陷。标签噪声会降低模型的泛化能力和准确性，因此研究鲁棒学习算法以减轻其影响至关重要。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>用于监督机器学习训练的数据集中，目标标签存在的错误或不一致性。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>数据质量&lt;/li>
&lt;li>鲁棒学习&lt;/li>
&lt;li>标注错误&lt;/li>
&lt;li>对称/非对称噪声&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>在众包数据上训练模型&lt;/li>
&lt;li>处理现实世界中不完美的数据集&lt;/li>
&lt;li>提高模型鲁棒性&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data_cleaning-%E6%95%B0%E6%8D%AE%E6%B8%85%E6%B4%97/">data_cleaning (数据清洗)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/robust_statistics-%E9%B2%81%E6%A3%92%E7%BB%9F%E8%AE%A1%E5%AD%A6/">robust_statistics (鲁棒统计学)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/supervised_learning-%E7%9B%91%E7%9D%A3%E5%AD%A6%E4%B9%A0/">supervised_learning (监督学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/outlier_detection-%E5%BC%82%E5%B8%B8%E5%80%BC%E6%A3%80%E6%B5%8B/">outlier_detection (异常值检测)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据标注</title><link>https://terms-en.ai-term-hub.com/zh/terms/data_annotation/</link><pubDate>Sat, 18 Jul 2026 11:12:24 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/data_annotation/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>这一关键步骤涉及为原始数据点附加有意义的元数据，以便算法能够学习输入与输出之间的关系。例如，在图像中物体周围绘制边界框……&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>数据标注是对原始数据（如图像或文本）进行标记的过程，使其适用于监督式机器学习训练。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>监督学习&lt;/li>
&lt;li>标记&lt;/li>
&lt;li>地面真值&lt;/li>
&lt;li>元数据&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练目标检测模型&lt;/li>
&lt;li>构建情感分析分类器&lt;/li>
&lt;li>创建语音识别数据集&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ground-truth-%E5%9C%B0%E9%9D%A2%E7%9C%9F%E5%80%BC/">Ground Truth (地面真值)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/active-learning-%E4%B8%BB%E5%8A%A8%E5%AD%A6%E4%B9%A0/">Active Learning (主动学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/crowdsourcing-%E4%BC%97%E5%8C%85/">Crowdsourcing (众包)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/labeled-data-%E6%A0%87%E6%B3%A8%E6%95%B0%E6%8D%AE/">Labeled Data (标注数据)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>概念漂移</title><link>https://terms-en.ai-term-hub.com/zh/terms/concept_drift/</link><pubDate>Sat, 18 Jul 2026 11:11:03 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/concept_drift/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>概念漂移是机器学习中的一种现象，即随着新数据的到来，输入特征与目标输出之间的关系会发生变化。这在用户行为动态变化的环境中经常发生。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>当目标变量的统计特性随时间发生变化时，就会发生概念漂移，从而导致模型性能下降。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>数据分布偏移&lt;/li>
&lt;li>模型退化&lt;/li>
&lt;li>在线学习&lt;/li>
&lt;li>重新训练&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>欺诈检测系统&lt;/li>
&lt;li>股票市场预测&lt;/li>
&lt;li>客户流失建模&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data-drift-%E6%95%B0%E6%8D%AE%E6%BC%82%E7%A7%BB/">Data Drift (数据漂移)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/covariate-shift-%E5%8D%8F%E5%8F%98%E9%87%8F%E5%81%8F%E7%A7%BB/">Covariate Shift (协变量偏移)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model-monitoring-%E6%A8%A1%E5%9E%8B%E7%9B%91%E6%8E%A7/">Model Monitoring (模型监控)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/adaptive-learning-%E8%87%AA%E9%80%82%E5%BA%94%E5%AD%A6%E4%B9%A0/">Adaptive Learning (自适应学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>算法偏见</title><link>https://terms-en.ai-term-hub.com/zh/terms/algorithmic_bias/</link><pubDate>Sat, 18 Jul 2026 11:04:37 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/algorithmic_bias/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>算法偏见通常源于非代表性的训练数据、主观的设计选择或放大现有社会偏见的反馈循环。它表现为预测结果的偏差&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>算法偏见是指计算机系统中系统性且可重复的错误，导致不公平的结果，例如偏袒某一任意群体而忽视其他群体。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>数据代表性&lt;/li>
&lt;li>系统性错误&lt;/li>
&lt;li>缓解策略&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>纠正搜索结果排名&lt;/li>
&lt;li>平衡医疗诊断数据集&lt;/li>
&lt;li>多样化图像识别训练集&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/algorithmic-discrimination-%E7%AE%97%E6%B3%95%E6%AD%A7%E8%A7%86/">Algorithmic Discrimination (算法歧视)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data-cleaning-%E6%95%B0%E6%8D%AE%E6%B8%85%E6%B4%97/">Data Cleaning (数据清洗)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model-fairness-%E6%A8%A1%E5%9E%8B%E5%85%AC%E5%B9%B3%E6%80%A7/">Model Fairness (模型公平性)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>高质量</title><link>https://terms-en.ai-term-hub.com/zh/terms/high_quality/</link><pubDate>Sat, 18 Jul 2026 10:56:47 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/high_quality/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在人工智能中，高质量通常描述具有高保真度、低噪声和强大泛化能力的模型或数据输出。高质量的训练数据确保模型能够&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>指具有 superior 准确性、可靠性和最小噪声的数据集、模型或输出。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>数据保真度&lt;/li>
&lt;li>降噪&lt;/li>
&lt;li>泛化能力&lt;/li>
&lt;li>精度&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>训练鲁棒的计算机视觉模型&lt;/li>
&lt;li>评估大语言模型输出的连贯性&lt;/li>
&lt;li>医学诊断数据的策展&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data_cleaning-%E6%95%B0%E6%8D%AE%E6%B8%85%E6%B4%97/">data_cleaning (数据清洗)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model_accuracy-%E6%A8%A1%E5%9E%8B%E5%87%86%E7%A1%AE%E7%8E%87/">model_accuracy (模型准确率)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ground_truth-%E5%9C%B0%E9%9D%A2%E7%9C%9F%E5%80%BC/">ground_truth (地面真值)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>