被遗忘权
Definition
被遗忘权使用户有权要求从数据库和 AI 训练集中移除其个人信息。在机器学习中实施这一权利具有挑战性,因为模型可能已经将从这些数据中学习到的知识固化在参数中。
Summary
一项 …
欢迎使用 AI术语词典 — 一部全面的多语种人工智能术语参考工具。
被遗忘权使用户有权要求从数据库和 AI 训练集中移除其个人信息。在机器学习中实施这一权利具有挑战性,因为模型可能已经将从这些数据中学习到的知识固化在参数中。
一项 …
在人工智能中,当模型学习并放大训练数据中存在的社会偏见时,就会产生刻板印象。这可能导致歧视性结果,例如将某些职业与特定性别联系起来。
一种概括性的、往往过于简化的 …
课程学习模仿人类教育过程,以结构化的顺序呈现训练数据,通常从简单样本开始,并逐渐增加复杂度。这种方法有助于神经网络更好地收敛并提高泛化能力。
一种训练策略,模型先 …
模型提取涉及查询目标机器学习模型的 API,以推断其内部结构、权重或决策边界。攻击者利用这些查询构建一个代理模型,从而窃取知识产权或绕过安全限制。
一种攻击方式, …
数据最小化是一项核心的隐私原则,要求组织将数据收集限制在充分、相关且必要的范围内。在人工智能领域,这意味着设计能够减少不必要数据依赖的模型。
仅收集和处理特定目的 …
Wumpus World 是 Russell 和 Norvig 的 AI 教科书中引入的一个基于网格的环境。智能体必须在网格中导航以寻找金子,同时避开陷阱和一个名为 Wumpus …
XLM-RoBERTa(跨语言语言模型 RoBERTa)是由 Meta AI 开发的大规模多语言模型。它通过在一个涵盖 100 多种语言的多样化数据集上进行预训练, …
后门攻击涉及使用特定的模式(称为触发器)对机器学习模型的训练数据进行投毒。虽然模型在干净数据上表现正常,但在检测到触发器时会激活错误的行为,例如将特定图像错误分类为指定标签, …
零样本提示涉及直接通过文本提示要求预训练语言模型完成任务,而不提供任何少样本示例或进行额外的微调。该模型利用其在大规模数据上学习到的通用知识和指令遵循能力来生成响应, …
泽滕策略是一种基于规则的博弈方法,用于多智能体谈判。它计算智能体为推动其首选结果而愿意承担的最大风险,定义为智能体在坚持立场时可能遭受的效用损失与其在妥协时的效用损失之比, …
Token最大化涉及精心构造输入内容,以充分利用模型的上下文窗口容量,或通过优化Token的语义密度来提升性能。实践者可能会填充无关文本以占满上下文空间(Padding),或者极 …
AI中的毒性是指生成或传播不尊重他人、可能导致用户离开讨论或针对特定身份群体的内容。它涵盖了一个从轻微的不当言论到严重的仇恨言论和暴力威胁的光谱。在自然语言处理中,毒性通常被视为 …
毒性检测采用自然语言处理技术分析文本输入,并分配一个概率分数以指示有害内容的可能性。这些系统通常使用监督学习训练,基于标注好的数据集(如包含仇恨言论或骚扰的评论)来学习识别有毒模 …
这一概念指的是人工智能技术在全球金融系统中引入脆弱性的历史及预测事件序列。它涵盖了早期算法交易引发的市场动荡,到近年来由深度学习模型驱动的复杂风险传播路径,再到监管机构试图通过压 …
在人工智能和计算机科学中,玩具问题是一个高度简化的场景,旨在说明某个概念或测试新算法。例如八皇后问题或旅行商问题的简化版。这类问题通常具有明确的规则和较小的搜索空间,使得研究人员 …
THUDM(清华大学自然语言处理实验室)是一个著名的人工智能学术和研究实体,特别专注于自然语言处理领域。他们致力于开发先进的开源大语言模型,如ChatGLM系列,这些模型在中文理 …
三因子学习是强化学习中的一种特定方法,它将学习过程分解为三个不同的组成部分:奖励信号、价值函数和策略。奖励信号提供即时反馈,价值函数评估长期预期收益,而策略则决定智能体的行动选 …
时间序列数据是由按时间间隔顺序记录的观测值组成的。在人工智能中,这种数据类型对于基于历史模式预测未来趋势至关重要。专门的模型如循环神经网络(RNN)、长短期记忆网络(LSTM)以 …
虽然人类的思考是生物性的,但人工智能的“思考”涉及模仿认知功能的计算操作。它包括逻辑演绎、模式识别和推断。现代大型语言模型(LLM)通过复杂的神经网络架构实现了这种类人思维能力的 …
在人工智能工程中,吞吐量是一个关键的性能指标,用于指示系统容量。对于大语言模型(LLMs),它通常以每秒令牌数(tokens per second)来衡量;对于计算机视觉模型,则 …