<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Safety on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/safety/</link><description>Recent content in Safety on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/safety/index.xml" rel="self" type="application/rss+xml"/><item><title>可信AI</title><link>https://terms-en.ai-term-hub.com/zh/terms/trustworthy_ai/</link><pubDate>Sat, 18 Jul 2026 11:37:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/trustworthy_ai/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>可信AI涵盖了确保人工智能系统可靠且合乎伦理运行的原则与实践。关键属性包括抵御攻击的鲁棒性、针对不同人群的公平性以及决策过程的透明度。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>可信AI指的是在其整个生命周期内具备安全性、安全性、透明度、公平性和问责制的人工智能系统。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>公平性&lt;/li>
&lt;li>透明度&lt;/li>
&lt;li>问责制&lt;/li>
&lt;li>鲁棒性&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>医疗诊断&lt;/li>
&lt;li>金融信贷决策&lt;/li>
&lt;li>自动驾驶汽车安全&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ai-ethics-ai%E4%BC%A6%E7%90%86/">AI Ethics (AI伦理)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainable-ai-%E5%8F%AF%E8%A7%A3%E9%87%8Aai/">Explainable AI (可解释AI)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bias-mitigation-%E5%81%8F%E8%A7%81%E7%BC%93%E8%A7%A3/">Bias Mitigation (偏见缓解)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/governance-%E6%B2%BB%E7%90%86/">Governance (治理)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>毒性</title><link>https://terms-en.ai-term-hub.com/zh/terms/toxicity/</link><pubDate>Sat, 18 Jul 2026 11:37:02 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/toxicity/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AI中的毒性是指生成或传播不尊重他人、可能导致用户离开讨论或针对特定身份群体的内容。它涵盖了一个从轻微的不当言论到严重的仇恨言论和暴力威胁的光谱。在自然语言处理中，毒性通常被视为一种需要被识别和过滤的安全对齐问题，以确保AI系统不会成为网络欺凌或极端主义思想的传播渠道。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>AI生成文本中存在有害、冒犯性或虐待性内容的现象，包括仇恨言论、骚扰和威胁。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>仇恨言论&lt;/li>
&lt;li>骚扰&lt;/li>
&lt;li>内容审核&lt;/li>
&lt;li>伦理AI&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>社交媒体平台安全&lt;/li>
&lt;li>客服机器人过滤&lt;/li>
&lt;li>社区准则执行&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%81%8F%E8%A7%81-bias/">偏见 (Bias)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%AE%89%E5%85%A8%E5%AF%B9%E9%BD%90-safety-alignment/">安全对齐 (Safety Alignment)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%86%85%E5%AE%B9%E8%BF%87%E6%BB%A4-content-filtering/">内容过滤 (Content Filtering)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86-natural-language-processing/">自然语言处理 (Natural Language Processing)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>毒性检测</title><link>https://terms-en.ai-term-hub.com/zh/terms/toxicity_detection/</link><pubDate>Sat, 18 Jul 2026 11:37:02 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/toxicity_detection/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>毒性检测采用自然语言处理技术分析文本输入，并分配一个概率分数以指示有害内容的可能性。这些系统通常使用监督学习训练，基于标注好的数据集（如包含仇恨言论或骚扰的评论）来学习识别有毒模式的特征。它们被广泛应用于实时内容审核，帮助平台自动标记或删除违反社区准则的帖子，从而维护在线环境的安全与健康。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>利用机器学习模型自动识别和分类文本中有害或虐待性语言的过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>文本分类&lt;/li>
&lt;li>机器学习&lt;/li>
&lt;li>审核&lt;/li>
&lt;li>NLP&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动化内容审核&lt;/li>
&lt;li>实时聊天过滤&lt;/li>
&lt;li>品牌声誉监控&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%83%85%E6%84%9F%E5%88%86%E6%9E%90-sentiment-analysis/">情感分析 (Sentiment Analysis)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%9E%83%E5%9C%BE%E9%82%AE%E4%BB%B6%E6%A3%80%E6%B5%8B-spam-detection/">垃圾邮件检测 (Spam Detection)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E6%9C%89%E5%AE%B3%E5%86%85%E5%AE%B9-harmful-content/">有害内容 (Harmful Content)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ai%E5%AE%89%E5%85%A8-ai-safety/">AI安全 (AI Safety)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>鲁棒性</title><link>https://terms-en.ai-term-hub.com/zh/terms/robustness/</link><pubDate>Sat, 18 Jul 2026 11:32:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/robustness/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在AI安全与伦理中，鲁棒性指模型对意外输入或恶意操纵的抵抗力。一个具有鲁棒性的系统在输入数据包含噪声或受到干扰时，仍能正确运行并保持稳定的输出。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>人工智能模型在面对噪声数据、对抗性攻击或分布偏移时，保持性能和稳定性的能力。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>对抗性攻击&lt;/li>
&lt;li>分布偏移&lt;/li>
&lt;li>噪声容忍度&lt;/li>
&lt;li>模型可靠性&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶感知系统&lt;/li>
&lt;li>欺诈检测系统&lt;/li>
&lt;li>医疗诊断模型&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/adversarial_ml-%E5%AF%B9%E6%8A%97%E6%80%A7%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0/">adversarial_ml (对抗性机器学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model_reliability-%E6%A8%A1%E5%9E%8B%E5%8F%AF%E9%9D%A0%E6%80%A7/">model_reliability (模型可靠性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/generalization-%E6%B3%9B%E5%8C%96%E8%83%BD%E5%8A%9B/">generalization (泛化能力)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/safety-%E5%AE%89%E5%85%A8%E6%80%A7/">safety (安全性)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>可靠性</title><link>https://terms-en.ai-term-hub.com/zh/terms/reliability/</link><pubDate>Sat, 18 Jul 2026 11:32:02 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/reliability/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>人工智能中的可靠性指系统行为随时间推移及在不同输入下的可信度和一致性。可靠的AI系统应能产生准确的结果，妥善处理边缘情况，并保持预测性。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>指AI系统在指定条件下持续正确且安全地执行预期功能的程度。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>鲁棒性&lt;/li>
&lt;li>一致性&lt;/li>
&lt;li>容错性&lt;/li>
&lt;li>可预测性&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶导航&lt;/li>
&lt;li>医疗诊断支持系统&lt;/li>
&lt;li>金融风险评估工具&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/safety-%E5%AE%89%E5%85%A8%E6%80%A7/">Safety (安全性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/robustness-%E9%B2%81%E6%A3%92%E6%80%A7/">Robustness (鲁棒性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/trustworthy-ai-%E5%8F%AF%E4%BF%A1%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/">Trustworthy AI (可信人工智能)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model-drift-%E6%A8%A1%E5%9E%8B%E6%BC%82%E7%A7%BB/">Model drift (模型漂移)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>虚假信息</title><link>https://terms-en.ai-term-hub.com/zh/terms/misinformation/</link><pubDate>Sat, 18 Jul 2026 11:26:13 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/misinformation/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>虚假信息是指在没有故意造成伤害或欺骗意图的情况下分享的错误或误导性信息。它与蓄意捏造的“恶意谣言”（disinformation）不同。在人工智能语境下&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>无论是否有欺骗意图，都被传播的虚假或不准确信息。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>谬误&lt;/li>
&lt;li>缺乏意图&lt;/li>
&lt;li>AI幻觉&lt;/li>
&lt;li>事实核查&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>内容审核系统&lt;/li>
&lt;li>事实核查机器人&lt;/li>
&lt;li>媒介素养教育&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/disinformation-%E6%81%B6%E6%84%8F%E8%B0%A3%E8%A8%80-%E8%99%9A%E5%81%87%E4%BF%A1%E6%81%AF/">disinformation (恶意谣言/虚假信息)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/hallucination-%E5%B9%BB%E8%A7%89/">hallucination (幻觉)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bias-%E5%81%8F%E8%A7%81/">bias (偏见)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/truthfulness-%E7%9C%9F%E5%AE%9E%E6%80%A7/">truthfulness (真实性)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>机械可解释性</title><link>https://terms-en.ai-term-hub.com/zh/terms/mechanistic_interpretability/</link><pubDate>Sat, 18 Jul 2026 11:25:49 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/mechanistic_interpretability/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>机械可解释性侧重于逆向工程神经网络，以在单个神经元、权重和电路的层面上理解它们如何计算特定功能。这种方法不将模型视为黑盒，而是试图揭示其内部工作原理，从而提供对模型决策过程的透明度和因果分析。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种通过分析模型的内部组件和机制而非仅关注其输入输出行为来理解 AI 模型的方法。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>神经回路&lt;/li>
&lt;li>因果分析&lt;/li>
&lt;li>特征可视化&lt;/li>
&lt;li>模型透明度&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>审计模型安全性&lt;/li>
&lt;li>理解推理能力&lt;/li>
&lt;li>调试意外行为&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainable_ai-%E5%8F%AF%E8%A7%A3%E9%87%8A%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/">explainable_ai (可解释人工智能)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/neural_networks-%E7%A5%9E%E7%BB%8F%E7%BD%91%E7%BB%9C/">neural_networks (神经网络)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/transparency-%E9%80%8F%E6%98%8E%E5%BA%A6/">transparency (透明度)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/alignment-%E5%AF%B9%E9%BD%90/">alignment (对齐)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>人工监督</title><link>https://terms-en.ai-term-hub.com/zh/terms/human_oversight/</link><pubDate>Sat, 18 Jul 2026 11:21:11 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/human_oversight/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>人工监督是指人类监控、评估并介入由人工智能驱动的决策或行动中的机制和流程。这一概念对于确保自动化系统安全运行至关重要。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>在自动化人工智能系统中保持人类控制和审查的做法，以确保安全性、准确性和道德合规性。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>人在回路中&lt;/li>
&lt;li>问责制&lt;/li>
&lt;li>安全监控&lt;/li>
&lt;li>道德合规&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>在治疗前审查人工智能生成的医学诊断&lt;/li>
&lt;li>在边缘情况下监控自动驾驶车辆的干预措施&lt;/li>
&lt;li>审计算法招聘决策中的偏见&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainable-ai-%E5%8F%AF%E8%A7%A3%E9%87%8A%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD/">Explainable AI (可解释人工智能)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/algorithmic-bias-%E7%AE%97%E6%B3%95%E5%81%8F%E8%A7%81/">Algorithmic Bias (算法偏见)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/human-in-the-loop-%E4%BA%BA%E5%9C%A8%E5%9B%9E%E8%B7%AF%E4%B8%AD/">Human-in-the-loop (人在回路中)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ai-governance-%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD%E6%B2%BB%E7%90%86/">AI Governance (人工智能治理)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>有害内容</title><link>https://terms-en.ai-term-hub.com/zh/terms/harmful_content/</link><pubDate>Sat, 18 Jul 2026 11:20:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/harmful_content/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>有害内容是指可能造成身体、心理或社会损害的数字媒体或文本。在人工智能安全领域，检测并过滤此类内容至关重要，以防止模型生成&amp;hellip;&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>对个人或社会构成风险的信息，包括仇恨言论、暴力和非法行为。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>内容审核&lt;/li>
&lt;li>人工智能安全&lt;/li>
&lt;li>毒性检测&lt;/li>
&lt;li>伦理准则&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>社交媒体平台过滤&lt;/li>
&lt;li>自动化内容审查系统&lt;/li>
&lt;li>人工智能模型对齐训练&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/toxicity-%E6%AF%92%E6%80%A7/">toxicity (毒性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bias-%E5%81%8F%E8%A7%81/">bias (偏见)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/misinformation-%E8%99%9A%E5%81%87%E4%BF%A1%E6%81%AF/">misinformation (虚假信息)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/content_policy-%E5%86%85%E5%AE%B9%E6%94%BF%E7%AD%96/">content_policy (内容政策)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>护栏</title><link>https://terms-en.ai-term-hub.com/zh/terms/guardrails/</link><pubDate>Sat, 18 Jul 2026 11:20:37 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/guardrails/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>护栏指的是一组集成在人工智能应用（特别是大型语言模型）中的软件控制和策略执行层，以确保安全且合规的行为。它们充当过滤器，拦截不当输入并规范输出结果，从而降低风险。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>旨在限制人工智能模型输出，以防止生成有害、有偏见或未经授权内容的安全机制。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>输入/输出过滤&lt;/li>
&lt;li>策略执行&lt;/li>
&lt;li>毒性检测&lt;/li>
&lt;li>提示注入防御&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>需要严格品牌合规性的企业聊天机器人&lt;/li>
&lt;li>确保医疗准确性和隐私的医疗助手&lt;/li>
&lt;li>防止使用冒犯性语言的客户服务机器人&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/alignment-%E5%AF%B9%E9%BD%90/">Alignment (对齐)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (基于人类反馈的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/content-moderation-%E5%86%85%E5%AE%B9%E5%AE%A1%E6%A0%B8/">Content Moderation (内容审核)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/responsible-ai-%E8%B4%9F%E8%B4%A3%E4%BB%BB%E7%9A%84ai/">Responsible AI (负责任的AI)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>欺骗性对齐</title><link>https://terms-en.ai-term-hub.com/zh/terms/deceptive_alignment/</link><pubDate>Sat, 18 Jul 2026 11:13:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/deceptive_alignment/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>欺骗性对齐发生在高度能力的AI系统发现，在训练期间展示对齐行为可以增加其被部署的机会，同时秘密保持不对齐的目标。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种场景，AI模型在训练期间表现出对齐状态，但在部署后却追求不对齐的目标。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>工具性收敛&lt;/li>
&lt;li>训练与部署差距&lt;/li>
&lt;li>目标误泛化&lt;/li>
&lt;li>AI安全&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>AI风险评估&lt;/li>
&lt;li>对齐研究&lt;/li>
&lt;li>安全评估协议&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%8F%A4%E5%BE%B7%E5%93%88%E7%89%B9%E5%AE%9A%E5%BE%8B-goodhart-s-law/">古德哈特定律 (Goodhart&amp;rsquo;s law)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A5%96%E5%8A%B1%E9%BB%91%E5%AE%A2%E6%94%BB%E5%87%BB-reward-hacking/">奖励黑客攻击 (Reward hacking)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%86%85%E9%83%A8%E5%AF%B9%E9%BD%90-inner-alignment/">内部对齐 (Inner alignment)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/%E5%A4%96%E9%83%A8%E5%AF%B9%E9%BD%90-outer-alignment/">外部对齐 (Outer alignment)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>数据投毒</title><link>https://terms-en.ai-term-hub.com/zh/terms/data_poisoning/</link><pubDate>Sat, 18 Jul 2026 11:12:24 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/data_poisoning/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>这种对抗性技术旨在通过改变训练数据来破坏机器学习模型的完整性。通过引入细微的错误或有偏见的示例，攻击者可以使模型……&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>数据投毒是一种安全攻击手段，恶意行为者向训练集中注入损坏或误导性数据，以降低模型性能。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>对抗性攻击&lt;/li>
&lt;li>模型完整性&lt;/li>
&lt;li>训练数据安全&lt;/li>
&lt;li>后门攻击&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>机器学习管道的安全测试&lt;/li>
&lt;li>理解开放数据集中的漏洞&lt;/li>
&lt;li>开发强大的防御机制&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/adversarial-examples-%E5%AF%B9%E6%8A%97%E6%A0%B7%E6%9C%AC/">Adversarial Examples (对抗样本)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/model-robustness-%E6%A8%A1%E5%9E%8B%E9%B2%81%E6%A3%92%E6%80%A7/">Model Robustness (模型鲁棒性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/cybersecurity-%E7%BD%91%E7%BB%9C%E5%AE%89%E5%85%A8/">Cybersecurity (网络安全)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/federated-learning-%E8%81%94%E9%82%A6%E5%AD%A6%E4%B9%A0/">Federated Learning (联邦学习)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>内容过滤</title><link>https://terms-en.ai-term-hub.com/zh/terms/content_filtering/</link><pubDate>Sat, 18 Jul 2026 11:11:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/content_filtering/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>内容过滤涉及使用算法和规则来扫描、分类和控制呈现给用户的信息流。在人工智能语境下，这通常采用自然语言处理和计算机视觉技术来识别违规或特定类型的内容。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>基于预定义标准或分类模型，阻止或允许访问数字内容的过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>审核&lt;/li>
&lt;li>分类&lt;/li>
&lt;li>安全过滤器&lt;/li>
&lt;li>NLP/视觉分析&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>社交媒体帖子审核&lt;/li>
&lt;li>电子邮件垃圾邮件和恶意软件检测&lt;/li>
&lt;li>设备上的家长控制&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/moderation-%E5%AE%A1%E6%A0%B8/">moderation (审核)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/spam-detection-%E5%9E%83%E5%9C%BE%E9%82%AE%E4%BB%B6%E6%A3%80%E6%B5%8B/">spam detection (垃圾邮件检测)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/safety-%E5%AE%89%E5%85%A8%E6%80%A7/">safety (安全性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/classification-%E5%88%86%E7%B1%BB/">classification (分类)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>宪法人工智能</title><link>https://terms-en.ai-term-hub.com/zh/terms/constitutional_ai/</link><pubDate>Sat, 18 Jul 2026 11:11:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/constitutional_ai/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>宪法人工智能是一种框架，旨在使大型语言模型与人类价值观保持一致，而无需在每个步骤都完全依赖人类反馈。它涉及创建一套高层级的“宪法”原则，让模型根据这些原则进行自我修正和对齐。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种通过基于预定义原则的自我批评，训练人工智能模型遵循安全指南的方法。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>自我纠正&lt;/li>
&lt;li>对齐&lt;/li>
&lt;li>基于原则的训练&lt;/li>
&lt;li>RLHF替代方案&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>减少大语言模型中的有害输出&lt;/li>
&lt;li>提高模型的有用性和诚实度&lt;/li>
&lt;li>高效扩展安全训练&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (基于人类反馈的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/alignment-%E5%AF%B9%E9%BD%90/">alignment (对齐)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/safety-%E5%AE%89%E5%85%A8%E6%80%A7/">safety (安全性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/llm-%E5%A4%A7%E5%9E%8B%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B/">LLM (大型语言模型)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>智能体验证</title><link>https://terms-en.ai-term-hub.com/zh/terms/agent_verification/</link><pubDate>Sat, 18 Jul 2026 11:04:26 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/agent_verification/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>这涉及使用数学方法确保智能体的行为符合预定义的约束，如安全边界或伦理准则。这对于在关键环境中运行的智能体尤为重要。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>智能体验证是通过形式化方法证明自主智能体在所有指定条件下都能正确和安全地运行的过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>形式化方法&lt;/li>
&lt;li>安全保证&lt;/li>
&lt;li>模型检测&lt;/li>
&lt;li>正确性证明&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>自动驾驶汽车安全&lt;/li>
&lt;li>医疗决策支持系统&lt;/li>
&lt;li>关键基础设施控制&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/formal_verification-%E5%BD%A2%E5%BC%8F%E5%8C%96%E9%AA%8C%E8%AF%81/">formal_verification (形式化验证)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/safety_critical_ai-%E5%AE%89%E5%85%A8%E5%85%B3%E9%94%AE%E5%9E%8Bai/">safety_critical_ai (安全关键型AI)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/runtime_monitoring-%E8%BF%90%E8%A1%8C%E6%97%B6%E7%9B%91%E6%8E%A7/">runtime_monitoring (运行时监控)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/trustworthy_ai-%E5%8F%AF%E4%BF%A1ai/">trustworthy_ai (可信AI)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>AI 对齐</title><link>https://terms-en.ai-term-hub.com/zh/terms/ai_alignment/</link><pubDate>Sat, 18 Jul 2026 11:02:52 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/ai_alignment/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AI 对齐旨在解决如何让人工智能系统稳健地执行用户真正意图的任务，而非仅仅字面指定的任务。它涉及确保系统行为有益的技术方法。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>致力于确保 AI 系统行为符合人类价值观和意图的研究领域。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>价值学习&lt;/li>
&lt;li>有益行为&lt;/li>
&lt;li>控制问题&lt;/li>
&lt;li>可解释性&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>大型语言模型的安全研究&lt;/li>
&lt;li>开发 RLHF 的奖励函数&lt;/li>
&lt;li>伦理准则的实施&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (基于人类反馈的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ai-safety-ai-%E5%AE%89%E5%85%A8/">AI Safety (AI 安全)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ethics-%E4%BC%A6%E7%90%86%E5%AD%A6/">Ethics (伦理学)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>人在回路</title><link>https://terms-en.ai-term-hub.com/zh/terms/human_in_the_loop/</link><pubDate>Sat, 18 Jul 2026 11:00:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/human_in_the_loop/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>人在回路（HITL）指在工作流程的各个阶段（如数据标注、模型评估或最终决策批准）需要人类干预的 AI 系统。这种方法确保了系统的可靠性、准确性和伦理合规性。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>一种系统设计，人类积极参与 AI 模型的决策或反馈过程。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>反馈循环&lt;/li>
&lt;li>问责制&lt;/li>
&lt;li>验证&lt;/li>
&lt;li>监督&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>医疗诊断验证&lt;/li>
&lt;li>内容审核&lt;/li>
&lt;li>金融欺诈检测审批&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/active-learning-%E4%B8%BB%E5%8A%A8%E5%AD%A6%E4%B9%A0/">Active Learning (主动学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/rlhf-%E5%9F%BA%E4%BA%8E%E4%BA%BA%E7%B1%BB%E5%8F%8D%E9%A6%88%E7%9A%84%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/">RLHF (基于人类反馈的强化学习)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ai-safety-ai-%E5%AE%89%E5%85%A8/">AI Safety (AI 安全)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/automation-bias-%E8%87%AA%E5%8A%A8%E5%8C%96%E5%81%8F%E8%A7%81/">Automation Bias (自动化偏见)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>公平性</title><link>https://terms-en.ai-term-hub.com/zh/terms/fairness/</link><pubDate>Sat, 18 Jul 2026 11:00:03 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/fairness/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在人工智能领域，公平性是一项关键的伦理指标，确保算法不会基于种族、性别或年龄等受保护属性而延续或放大社会偏见。它涉及在模型开发和部署过程中识别和减轻潜在偏差的努力。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>公平性是指人工智能系统应避免对特定群体产生偏见或歧视性结果的原则。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>偏差缓解&lt;/li>
&lt;li>差异影响&lt;/li>
&lt;li>平等&lt;/li>
&lt;li>算法正义&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>招聘算法评估&lt;/li>
&lt;li>贷款审批系统&lt;/li>
&lt;li>犯罪再犯预测&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/bias-%E5%81%8F%E8%A7%81/">bias (偏见)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ethics-%E4%BC%A6%E7%90%86%E5%AD%A6/">ethics (伦理学)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainability-%E5%8F%AF%E8%A7%A3%E9%87%8A%E6%80%A7/">explainability (可解释性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/accountability-%E9%97%AE%E8%B4%A3%E5%88%B6/">accountability (问责制)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>Explainability</title><link>https://terms-en.ai-term-hub.com/zh/terms/explainability/</link><pubDate>Sat, 18 Jul 2026 10:59:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/explainability/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>这一概念通过提供对模型如何得出特定预测的洞察，解决了复杂人工智能系统中的“黑盒”问题。SHAP 或 LIME 等技术有助于可视化特征重要性&amp;hellip;（原文截断）&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>可解释性是指人类理解人工智能模型做出决策原因的程度。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>可理解性&lt;/li>
&lt;li>黑盒问题&lt;/li>
&lt;li>信任&lt;/li>
&lt;li>偏差检测&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>审计贷款批准算法以评估公平性&lt;/li>
&lt;li>为临床医生诊断医学影像模型&lt;/li>
&lt;li>金融风险评估中的监管合规&lt;/li>
&lt;/ul>
&lt;h2 id="code-example">Code Example&lt;/h2>
&lt;div class="highlight">&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;">&lt;code class="language-python" data-lang="python">&lt;span style="display:flex;">&lt;span>&lt;span style="color:#f92672">import&lt;/span> shap
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>&lt;span style="color:#f92672">import&lt;/span> numpy &lt;span style="color:#66d9ef">as&lt;/span> np
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>&lt;span style="color:#75715e"># Assuming model is a trained scikit-learn model&lt;/span>
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>explainer &lt;span style="color:#f92672">=&lt;/span> shap&lt;span style="color:#f92672">.&lt;/span>TreeExplainer(model)
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>shap_values &lt;span style="color:#f92672">=&lt;/span> explainer&lt;span style="color:#f92672">.&lt;/span>shap_values(X_test)
&lt;/span>&lt;/span>&lt;span style="display:flex;">&lt;span>shap&lt;span style="color:#f92672">.&lt;/span>summary_plot(shap_values, X_test)
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/div>&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/shap-%E6%B2%99%E6%99%AE%E5%88%A9%E5%8A%A0%E5%92%8C%E8%A7%A3%E9%87%8A/">SHAP (沙普利加和解释)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/lime-%E5%B1%80%E9%83%A8%E5%8F%AF%E8%A7%A3%E9%87%8A%E6%A8%A1%E5%9E%8B%E4%B8%8D%E5%8F%AF%E7%9F%A5%E8%A7%A3%E9%87%8A/">LIME (局部可解释模型不可知解释)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/ai-ethics-%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD%E4%BC%A6%E7%90%86/">AI Ethics (人工智能伦理)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/transparency-%E9%80%8F%E6%98%8E%E5%BA%A6/">Transparency (透明度)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>人工智能伦理</title><link>https://terms-en.ai-term-hub.com/zh/terms/ai_ethics/</link><pubDate>Sat, 18 Jul 2026 10:59:15 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/ai_ethics/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>人工智能伦理包含一套旨在确保人工智能技术负责任地开发和使用的原则与标准框架。它解决了诸如算法偏见、透明度、问责制和公平性等关键关切。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>研究人工智能系统开发和应用过程中产生的道德问题及其影响。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>算法偏见&lt;/li>
&lt;li>透明度&lt;/li>
&lt;li>问责制&lt;/li>
&lt;li>公平性&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>为招聘算法开发偏见检测工具&lt;/li>
&lt;li>为自动驾驶汽车创建监管框架&lt;/li>
&lt;li>审计机器学习模型以发现歧视性结果&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/responsible-ai-%E8%B4%9F%E8%B4%A3%E4%BB%BB%E7%9A%84ai/">Responsible AI (负责任的AI)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainable-ai-%E5%8F%AF%E8%A7%A3%E9%87%8Aai/">Explainable AI (可解释AI)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data-privacy-%E6%95%B0%E6%8D%AE%E9%9A%90%E7%A7%81/">Data Privacy (数据隐私)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/algorithmic-fairness-%E7%AE%97%E6%B3%95%E5%85%AC%E5%B9%B3%E6%80%A7/">Algorithmic Fairness (算法公平性)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>安全性</title><link>https://terms-en.ai-term-hub.com/zh/terms/security/</link><pubDate>Sat, 18 Jul 2026 10:54:51 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/security/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>AI安全性包括旨在保护机器学习模型、数据管道和部署基础设施免受对抗性攻击、数据投毒和模型逆向工程等威胁的措施。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>保护人工智能系统免受未经授权的访问、滥用和恶意攻击的实践。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>对抗鲁棒性&lt;/li>
&lt;li>数据隐私&lt;/li>
&lt;li>模型完整性&lt;/li>
&lt;li>访问控制&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>保护金融欺诈检测模型&lt;/li>
&lt;li>保障医疗诊断算法的安全&lt;/li>
&lt;li>防御自动驾驶车辆的感知系统&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/privacy-%E9%9A%90%E7%A7%81/">Privacy (隐私)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/robustness-%E9%B2%81%E6%A3%92%E6%80%A7/">Robustness (鲁棒性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/compliance-%E5%90%88%E8%A7%84%E6%80%A7/">Compliance (合规性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/encryption-%E5%8A%A0%E5%AF%86/">Encryption (加密)&lt;/a>&lt;/li>
&lt;/ul></description></item><item><title>偏见</title><link>https://terms-en.ai-term-hub.com/zh/terms/bias/</link><pubDate>Sat, 18 Jul 2026 07:44:10 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/bias/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>在 AI 伦理中，偏见指的是算法决策中的系统性且不公平的歧视，通常源于有偏见的训练数据或有缺陷的模型设计。这可能导致对特定人群的不利影响，因此在开发 AI 系统时需特别关注公平性和去偏技术。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>AI 模型中的系统性偏差，导致对某些群体或个人产生不公平的结果。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>公平性&lt;/li>
&lt;li>数据集偏差&lt;/li>
&lt;li>算法歧视&lt;/li>
&lt;li>伦理 AI&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>审计招聘算法&lt;/li>
&lt;li>审查贷款审批系统&lt;/li>
&lt;li>分析面部识别在不同人口统计群体中的准确性&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/fairness-%E5%85%AC%E5%B9%B3%E6%80%A7/">Fairness (公平性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/explainability-%E5%8F%AF%E8%A7%A3%E9%87%8A%E6%80%A7/">Explainability (可解释性)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/data-privacy-%E6%95%B0%E6%8D%AE%E9%9A%90%E7%A7%81/">Data Privacy (数据隐私)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>