فرض کنید مدل غربال رزومه ۹۲٪ Accuracy دارد. تیم SHAP هم اجرا کرده، نمودار Fairness سبز است و هیچ باگ API دیده نمی‌شود. بااین‌حال، «صلاحیت» از استخدام‌های تاریخی برچسب خورده، افراد بدون داده کنار گذاشته می‌شوند، Recruiter روزانه فقط چند ثانیه برای Override وقت دارد و داوطلب نمی‌داند چرا رد شده یا چگونه اعتراض کند. آیا سیستم «اخلاقی» است؟ هیچ Test score به‌تنهایی پاسخ این سؤال را نمی‌دهد.

تست اخلاقی هوش مصنوعی گواهی فضیلت مدل نیست؛ فرایندی اجتماعی-فنی برای تبدیل ادعای مبهم «مسئولانه» به سؤال‌های قابل‌رد، شواهد تفکیک‌شده، Guardrail، حق اعتراض و تصمیم پاسخگوست: Use/Decision → Stakeholder/Right/Harm → Alternative/Boundary → Claim/Metric → Data/Slice/Uncertainty → Workflow/Control → Appeal/Remedy → Monitor/Review/Stop.

پاسخ کوتاه: تست اخلاقی AI چیست؟

  • پیش از مدل بپرسید آیا AI برای این تصمیم لازم، متناسب و مجاز است یا گزینهٔ کم‌آسیب‌تری وجود دارد.
  • افراد متاثر، حقوق/منافع، Benefit، Harm، توزیع اثر و افراد غایب از جلسه/داده را مشخص کنید.
  • Decision و Workflow کامل را تست کنید؛ Model score فقط یکی از اجزاست.
  • Fairness را از هدف و Harm تعریف کنید؛ هیچ Metric جهان‌شمولی «عدالت» را اثبات نمی‌کند.
  • نتایج Aggregate را با Sliceهای موجه، تقاطع‌ها، اندازهٔ نمونه و عدم‌قطعیت همراه کنید.
  • Label، Proxy، Missingness، دسترسی نابرابر و feedback loop را به‌عنوان Test object ببینید.
  • Explanation را برای مخاطب/وظیفه بسنجید؛ SHAP/LIME پاسخگویی، حق اعتراض یا صحت تصمیم نیست.
  • Human-in-the-loop را با Authority، زمان، استقلال، اطلاعات، Override و Automation bias تست کنید.
  • Privacy، Security، Accessibility، Safety، محیط‌زیست و کار را Trade-offهای واقعی بدانید، نه چک‌باکس.
  • Release فقط با owner، stop/rollback، monitoring، incident، appeal، correction و remedy معنا دارد.

Intent جست‌وجو و کلیدواژه‌ها

Intent اصلی اطلاعاتی/اجرایی است: «ملاحظات اخلاقی در تست سیستم هوش مصنوعی را چگونه عملی کنیم؟» کلیدواژهٔ اصلی تست اخلاقی هوش مصنوعی است. عبارت‌های مکمل: اخلاق در هوش مصنوعی، Ethical AI Testing، Responsible AI Testing، ارزیابی اثر اخلاقی AI، AI Impact Assessment، تست سوگیری الگوریتم، تست Fairness مدل، Harmful Bias، انصاف الگوریتمی، تست Explainability، شفافیت AI، پاسخگویی الگوریتم، Human Oversight، حق اعتراض به تصمیم خودکار، AI Red Teaming، تست حریم خصوصی مدل، AI Governance و چک‌لیست اخلاق هوش مصنوعی.

این مقاله لایهٔ ارزیابی اثر و Governance را مالک است. برای Data/Model/Drift و Production به راهنمای تست سیستم‌های AI/ML، برای دوراهی‌های حرفه‌ای خود QA به اخلاق در تست نرم‌افزار و برای الزامات داده به راهنمای تست حریم خصوصی مراجعه کنید. اینجا شواهد فنی را به Harm، حق، اختیار و جبران وصل می‌کنیم.

Ethics، Compliance، Safety و Quality مترادف نیستند

LensسؤالEvidence نمونهمحدودیت
Ethics/rightsچه کسی چه Benefit/Harm/Power/Remedy دارد؟impact map، stakeholder evidenceبا Score واحد بسته نمی‌شود
Law/complianceچه الزام و حوزهٔ قضایی اعمال می‌شود؟applicability/controls/legal reviewانطباق حداقل ممکن است، نه اخلاق کامل
Safetyچه Hazardی به آسیب می‌رسد؟hazard/control/incident evidenceهمهٔ عدالت/حقوق را پوشش نمی‌دهد
Securityچه تهدیدی confidentiality/integrity/availability را می‌شکند؟threat model/red-team/controlخروجی امن می‌تواند ناعادلانه باشد
PrivacyData processing چگونه بر autonomy/dignity اثر دارد؟data flow/minimization/deletionناشناس‌سازی عدالت را ثابت نمی‌کند
Quality/utilityسیستم برای Task چقدر مفید/درست است؟validity/reliability/UX/operationsAccuracy بالا Harm را رد نمی‌کند
Governanceچه کسی تصمیم/اعتراض/تغییر/توقف می‌دهد؟authority/records/audit/remedyکاغذبازی بدون اجرا نیست

واژهٔ «اخلاقی» را به Label بازاریابی تبدیل نکنید. NIST در AI Risk Management Framework ویژگی‌هایی مانند validity/reliability، safety، security/resilience، accountability/transparency، explainability، privacy و Fairness با مدیریت harmful bias را در Context و Trade-off می‌بیند. AI RMF ۱.۰ داوطلبانه است و طبق صفحهٔ فعلی در حال بازنگری؛ Certification، قانون ایران یا اثبات Trustworthiness نیست.

Test نمی‌تواند «اخلاقی بودن» را اثبات کند

Test می‌تواند یک Claim محدود را در Population/Window/Metric مشخص رد یا پشتیبانی کند: «در این held-out sample، شکاف TPR بین Slice A و B از حد توافق‌شده بیشتر نبود» یا «هر تصمیم منفی مسیر اعتراض قابل‌دسترسی داشت». این Evidence دربارهٔ جامعهٔ غایب، آینده، حقانیت Label، تناسب خودکارسازی، اثر بلندمدت یا اجرای Remedy چیزی را خودکار ثابت نمی‌کند.

Ethical Claim Contract
Use case / decision / benefit / non-goal
Affected stakeholders and absent voices
Right, interest, harm and distribution pathway
Legal/policy/domain applicability owner
No-AI and less-intrusive alternatives considered
System/workflow boundary and human authority
Claim phrased to be falsifiable
Population / slice / intersection / time / geography
Outcome/label provenance and contestability
Metric/formula/threshold/rationale/countermetric
Data source/consent/access/missingness/uncertainty
Evidence method / independence / limitations
Control / residual risk / owner / expiry
Appeal / correction / remedy / incident route
Pass / Fail / Inconclusive / Unknown / Stop rule
Decision authority / dissent / publication / review

«مدل تبعیض ندارد»، «شفاف است»، «حریم خصوصی را تضمین می‌کند» و «برای همه مفید است» Claim آزمون‌پذیر نیستند. واژهٔ گروه، نتیجهٔ مثبت، qualification، error، Harm، data window و threshold را تعریف کنید و Scope عدم‌ادعا را کنار نتیجه بنویسید.

اول سؤال سخت: آیا باید AI بسازیم یا استفاده کنیم؟

گزینهچه چیزی را می‌کاهد؟چه چیزی باقی می‌ماند؟
Do nothingAI-specific risk/costضرر فرایند فعلی
Fix policy/processاتوماسیون مشکل تعریف‌نشدهاجرای انسانی/عملیاتی
Rule/checklistopacity/variabilityRule bias/maintenance
Decision supportautonomous authorityautomation bias/workload
Triage/queuescope تصمیم مدلdelay/priority harm
Limited pilotblast radiusconsent/selection/rollback
Automated decisionthroughput/toilبالاترین نیاز به validity/appeal/remedy
Prohibit/stopunacceptable/unmanageable harmجایگزین و transition

Accuracy بهتر از انسان، اگر واقعاً با Design معتبر نشان داده شود، هنوز ضرورت AI یا خودکارسازی را ثابت نمی‌کند. سؤال مقایسه‌ای است: کدام گزینه برای چه جمعیت و harm، با چه هزینه، اختیار، قابلیت اعتراض و اثر توزیعی بهتر است؟ Baseline انسانی نیز بی‌طرف یا بی‌خطا فرض نمی‌شود؛ باید همان‌قدر دقیق تعریف شود.

Stakeholder و Power map؛ فقط «کاربر» نداریم

Stakeholder / community / representative
Direct user, subject, bystander or indirectly affected
Benefit promised / burden imposed / harm pathway
Right/interest and decision dependency
Power to consent, refuse, opt out or appeal
Access to information and explanation
Ability to absorb delay/error/cost
Language, disability, connectivity and access needs
Representation in data/design/test/governance
Conflict of interest / retaliation / coercion risk
Contact, engagement method and compensation
Disagreement / unresolved concern / owner / review date

خریدار سیستم، operator، فرد subject، خانواده، کارمند، جامعهٔ محلی، Vendor، Regulator و تیم Operations ممکن است هدف‌های متضاد داشته باشند. نظرسنجی چند کاربر نمایندهٔ Public interest نیست. مشارکت باید زودهنگام، قابل‌اثر، دسترس‌پذیر و امن باشد؛ «نظرخواهی» بعد از تصمیم قطعی یا بدون امکان تغییر، Participation معنادار نیست.

Harm map؛ از Error تا اثر توزیع‌شده

Harm lensنمونهٔ مسیرEvidence/Control
Allocationوام/شغل/خدمت/صف ناعادلانهoutcome slices + appeal/remedy
Quality of serviceخطای بیشتر برای زبان/دستگاه خاصdisaggregated reliability
Representationتحقیر، کلیشه یا حذفcommunity review + policy
Privacy/autonomyجمع‌آوری/استنتاج/دستکاری بدون اختیارdata flow/minimization/consent boundary
Safety/securityآسیب جسمی، مالی یا سوءاستفادهhazard/threat/control/incident
Proceduralدلیل/اعتراض/اصلاح در دسترس نیستnotice/explanation/appeal SLA
Labourنظارت، deskilling، workload یا رتبه‌بندیworker engagement/non-use/work design
Collective/systemicfeedback loop، تمرکز قدرت، chilling effectlongitudinal/external review/stop
Environment/accessمصرف منابع یا شکاف اتصال/هزینهresource/access/alternative evidence

Severity×Likelihood عددی فقط وقتی معنا دارد که تعریف، Evidence و Authority داشته باشد؛ Harmهای حقوقی/کرامت/تبعیض را بی‌دلیل با هزینه مالی جمع نزنید. Reversibility، duration، scale، vulnerability، detectability، cumulative effect و امکان جبران را جدا نگه دارید. Unknown را صفر نکنید.

System boundary: مدل فقط یک جزء است

Policy and eligibility definition
Data collection / consent / labeling / historical process
Feature and proxy construction
Model / threshold / calibration / abstention
UI / ranking / explanation / defaults
Human reviewer / workload / authority / incentives
Action / notification / delay / access
Appeal / correction / remedy / escalation
Monitoring / feedback / retraining / vendor change
Governance / audit / publication / retirement

مدل می‌تواند Metric انتخابی را برابر کند اما UI رتبه را برجسته، Reviewer را تحت فشار و Policy گروهی را حذف کند. Label تاریخی ممکن است نتیجهٔ دسترسی نابرابر باشد. Workflow، انسان، سازمان، Vendor و محیط بخشی از Test object هستند؛ «مدل منصف» عبارت کافی برای «سیستم منصف» نیست.

Bias چیست؟ تفاوت آماری همیشه Harm نیست

Bias می‌تواند Statistical/systematic error، inductive bias مفید مدل، خطای شناختی یا harmful social bias باشد. تفاوت خروجی میان گروه‌ها Signal بررسی است، نه اثبات خودکار تبعیض یا مجوز حذف تفاوت. NIST SP ۱۲۷۰ دربارهٔ شناسایی و مدیریت Bias در AI بر این نکته تاکید دارد که Bias فقط در Data/algorithm نیست و Context انسانی/سازمانی نیز باید مدیریت شود؛ این چارچوب قانون یا فرمول واحد Fairness نیست.

منبعسؤال تستخطای تشخیص
HistoricalLabel/Outcome گذشته چه نابرابری را حمل می‌کند؟قدیمی بودن را تنها علت دانستن
Representationچه جمعیتی کم/غایب/بداندازه‌گیری شده؟برابرکردن Count بدون Population
MeasurementProxy/Instrument برای چه گروهی خطا دارد؟Label را Ground truth گرفتن
Aggregationیک مدل/threshold تفاوت‌های معنادار را می‌پوشاند؟تفکیک غیرمجاز یا Overfit
EvaluationBenchmark/metric با Use case هم‌راستاست؟Leaderboard=real utility
DeploymentContext/Operator/User رفتار را چگونه عوض می‌کند؟مدل ثابت=اثر ثابت
FeedbackOutput چه دادهٔ آینده‌ای می‌سازد؟Drift را فقط فنی دیدن
Organizationalهدف، Incentive، deadline و قدرت چه اثری دارند؟ابزار فنی به‌عنوان درمان ساختار

Fairness question را پیش از Metric بنویسید

Decision and positive/negative outcome
Who benefits / who bears which error
Qualification/label meaning and validity
Affected group and why grouping is legitimate
Reference population / time / geography
Access/exposure/eligibility denominator
Relevant error: FP, FN, ranking, calibration, delay, abstention
Fairness concept and metric chosen
Why this concept fits the right/harm/policy
Known incompatible goals and trade-offs
Minimum sample / uncertainty / multiplicity
Intersection and small-group handling
Threshold/control/remedy—not only model optimization
Legal/domain/community owner and dissent
Non-use / expiry / production monitoring

Demographic parity، Equal opportunity، Equalized odds، Predictive parity، Calibration، Individual/Counterfactual fairness سؤال‌های یکسانی ندارند و تحت شرایطی با هم ناسازگارند. راهنمای آموزشی Google ML دربارهٔ Counterfactual Fairness نیز صریحاً می‌گوید معیار واحد جهانی وجود ندارد و بعضی تعریف‌ها با هم ناسازگارند؛ این منبع آموزشی است، نه Policy مناسب استخدام/وام ایران.

Metricهای Fairness با سؤال و خطر خودشان

Metric/Conceptسؤال ساده‌شدهDependencyخطر سوءبرداشت
Selection/Demographic parityنرخ نتیجه مثبت برابر است؟eligible/exposure denominatorQualification/Harm را نادیده می‌گیرد
Equal opportunityTPR میان گروه‌ها برابر است؟Label مثبت معتبرFPR و access را نمی‌بیند
Equalized oddsTPR و FPR برابرند؟Label و thresholdPPV/calibration متفاوت می‌ماند
Predictive parityPPV نتیجه مثبت برابر است؟base rate/labelخطای رد را نمی‌بیند
CalibrationScore مشابه معنای outcome مشابه دارد؟time/population/outcomeDecision threshold عادلانه نیست
Counterfactual testبا تغییر attribute/representation چه می‌شود؟valid comparable pair/causal assumptionsجهان خلاف‌واقع ساده‌سازی می‌شود
Individual consistencyافراد مشابه خروجی مشابه دارند؟تعریف SimilaritySimilarity خودش ارزش‌بار است
Burden/appeal parityزمان/هزینه/اصلاح برابر است؟workflow telemetryمدل را تنها سطح می‌بیند

Gap صفر نیز عدالت را ثابت نمی‌کند: ممکن است هر دو گروه به یک اندازه بد خدمت بگیرند. Threshold بر مبنای ۸۰% rule یا هر عدد آماده را بدون applicability استفاده نکنید. Absolute rate، denominator، confidence interval/uncertainty، sample، missing group، multiple comparisons و practical harm را کنار Ratio/Gap گزارش دهید.

آزمایش قابل‌بازتولید: سه Policy، سه پاسخ متفاوت

برای مشاهدهٔ مکانیک Metricها، یک اسکریپت Node.js بدون وابستگی روی Confusion countهای کاملاً ساختگی اجرا شد. هر Policy دو گروه انتزاعی A/B و برای هر گروه فقط هشت مورد دارد؛ هر گروه چهار Label مثبت و چهار منفی دارد. A/B هیچ ویژگی جمعیت‌شناختی واقعی را نمایندگی نمی‌کنند.

{"policy":"BASELINE","aggregateAccuracy":81.3,"selectionRateGap":37.5,"truePositiveRateGap":50,"falsePositiveRateGap":25,"byGroup":{"A":{"n":8,"selectionRate":62.5,"truePositiveRate":100,"falsePositiveRate":25,"accuracy":87.5},"B":{"n":8,"selectionRate":25,"truePositiveRate":50,"falsePositiveRate":0,"accuracy":75}}}
{"policy":"SELECTION_PARITY","aggregateAccuracy":62.5,"selectionRateGap":0,"truePositiveRateGap":25,"falsePositiveRateGap":25,"byGroup":{"A":{"n":8,"selectionRate":50,"truePositiveRate":75,"falsePositiveRate":25,"accuracy":75},"B":{"n":8,"selectionRate":50,"truePositiveRate":50,"falsePositiveRate":50,"accuracy":50}}}
{"policy":"OPPORTUNITY_PARITY","aggregateAccuracy":75,"selectionRateGap":25,"truePositiveRateGap":0,"falsePositiveRateGap":50,"byGroup":{"A":{"n":8,"selectionRate":37.5,"truePositiveRate":75,"falsePositiveRate":0,"accuracy":87.5},"B":{"n":8,"selectionRate":62.5,"truePositiveRate":75,"falsePositiveRate":50,"accuracy":62.5}}}

Policy پایه: Accuracy بهتر، شکاف‌های بزرگ

BASELINE با Accuracy کلی ۸۱٫۳٪ در این جدول بهترین است، اما شکاف Selection برابر ۳۷٫۵، شکاف TPR برابر ۵۰ و شکاف FPR برابر ۲۵ واحد درصد دارد. Aggregate، گروه B و نوع خطای آن را پنهان می‌کند. هنوز نمی‌دانیم Label معتبر یا کدام Error زیان‌بارتر است.

Selection parity: یک Gap صفر، نه عدالت کامل

SELECTION_PARITY نرخ انتخاب هر دو گروه را ۵۰٪ و Gap آن را صفر می‌کند، اما Accuracy کلی به ۶۲٫۵٪ می‌رسد و شکاف TPR/FPR هر دو ۲۵ واحد درصد باقی می‌مانند. این Policy معیار نام‌گذاری‌شده را برآورده می‌کند؛ حقانیت Outcome، کیفیت Label، Harm و سایر معیارها را اثبات نمی‌کند.

Opportunity parity: TPR برابر، FPR نابرابر

OPPORTUNITY_PARITY شکاف TPR را صفر می‌کند، اما شکاف Selection به ۲۵ و شکاف FPR به ۵۰ واحد درصد می‌رسد. اگر False positive اثر سنگینی داشته باشد، این Trade-off مهم است. اسم Policy به‌تنهایی نمی‌گوید برای کدام حق/خطر مناسب است.

محدودیت سخت آزمایش

تمام Countها، گروه‌ها و Policyها توسط نویسنده انتخاب شده‌اند. نمونهٔ ۱۶تایی فاقد داده، مدل، انسان، زمان، عدم‌قطعیت، significance، intersection، missingness، access، qualification validity، base-rate realism، cost، causality و feedback است. خروجی Benchmark، مطالعهٔ Fairness، اثبات ناسازگاری عمومی، دستور Threshold، ابزار تصمیم استخدام/وام یا معیار Performance افراد نیست؛ فقط نشان می‌دهد بهینه‌کردن یک تعریف می‌تواند پاسخ تعریف دیگر را باز بگذارد.

Slice، Intersection و عدم‌قطعیت

  • گروه را به‌خاطر سهولت Data انتخاب نکنید؛ رابطهٔ آن با Harm/حق/قانون/کاربرد را ثبت کنید.
  • Attribute حساس را حدس یا از Name/Image/Voice استنتاج نکنید؛ مبنای جمع‌آوری و non-use لازم است.
  • Aggregate subgroup می‌تواند تقاطع‌ها—مثلاً زبان×دستگاه×دسترسی—را پنهان کند.
  • Slice ریز، N کم و interval بزرگ می‌سازد؛ صفر Event را صفر Risk ندانید.
  • گزارش چند ده Gap احتمال کشف تصادفی را زیاد می‌کند؛ plan و multiplicity را پیشاپیش تعریف کنید.
  • Missing/Unknown/Prefer-not-to-say را حذف خاموش نکنید و Missingness گروهی را بسنجید.
  • خصوصیت گروهی برای Evaluation نباید به Feature تصمیم یا رتبه‌بندی فرد تبدیل شود.
  • نتیجهٔ گروهی را به فرد تعمیم ندهید و فرد/تیم را با Fairness score رتبه‌بندی نکنید.

Label و Ground truth ممکن است خودِ مسئله باشند

Label نمونهچرا Ground truth نیست؟آزمون/جایگزین
استخدام شددسترسی/ترجیح/فرایند تاریخیjob-relevant outcome + structured review
وام را بازپرداخت کردoffer/price/shock/selectionpolicy-aware longitudinal outcome
Fraud تایید شدفقط موارد بررسی‌شده Label دارندverification sampling/selection model
کلیک کردexposure، dark pattern، preference لحظه‌ایuser outcome/guardrail
هزینه درماندسترسی و قیمت ≠ نیازdomain-defined need/outcome
Rating کاربرselection/retaliation/culturemulti-source/task evidence
Moderator labelinstruction/ambiguity/disagreementguide/blind adjudication/unknown

Inter-annotator agreement بالا صحت ارزش/واقعیت را تضمین نمی‌کند؛ همه ممکن است راهنمای بد را یکسان اجرا کنند. Label guide، provenance، disagreement، adjudication، appeals/corrections و drift را نگه دارید. Fine-tuning روی «داده متعادل» تاریخی را خودکار درمان Bias ننامید.

Counterfactual test مفید است، اما Causal proof نیست

تغییر نام، ضمیر یا گروه در رزومه و ثابت‌گرفتن بقیه می‌تواند حساسیت مدل را آشکار کند؛ اما «دو فرد یکسان جز جنسیت» همیشه Counterfactual معتبر نیست. نام ممکن است زبان/منطقه را نیز Proxy کند، ویژگی‌ها causal relation داشته باشند و Generator جمله را نامعمول کند. Pair construction، realism، invariance assumptions و human review را ثبت کنید.

Counterfactual Probe
Claim / protected or salient attribute / harm
Original input provenance and permission
Transformation and fields deliberately held constant
Causal/domain justification for comparability
Language/grammar/realism checks
Model/prompt/system/config/seed versions
Expected invariant or bounded relation
Outcome/score/reason/tool-call differences
Multiple variants and order/control conditions
Known proxies and interactions not controlled
Human/domain review / limitations / next test
Prohibition on creating real-person decisions

نتیجهٔ ثابت نیز absence of bias را ثابت نمی‌کند؛ مدل ممکن است از Proxy دیگری استفاده کند یا Harm گروهی/ساختاری باقی باشد. Counterfactual probe مکمل disaggregated outcomes، data audit و workflow study است.

Transparency، Explainability و Contestability سه هدف‌اند

هدفمخاطب/TaskEvidenceFalse comfort
Transparencyچه سیستم/داده/مالک/محدودیتی؟notice، model/system card، change logانتشار سند طولانی
InterpretabilityOutput در Context چه معنایی دارد؟score/threshold/uncertainty semanticsنمودار زیبا
Explainabilityچه Evidence/reason برای این خروجی؟reason fidelity/stability/comprehensionSHAP=علت
Auditabilityآیا روند و اثر قابل‌بازبینی است؟provenance/log/version/controlsانباشت همهٔ داده
Contestabilityفرد چگونه تصمیم را رد/اصلاح کند؟appeal path/authority/SLA/remedyHuman review اسمی
Accountabilityچه کسی پاسخ/تغییر/توقف می‌دهد؟decision rights/action records«مدل تصمیم گرفت»

برای عمق XAI به راهنمای هوش مصنوعی قابل توضیح وصل شوید. NISTIR 8312 چهار Lens مفید—وجود explanation، معناداری برای مخاطب، accuracy نسبت به فرایند سیستم و knowledge limits—پیشنهاد می‌کند. این اصول به‌خودی‌خود الزام حقوقی، روش آزمون کامل یا تضمین Trust نیستند.

Explanation Test Contract
Decision / explanation purpose / audience / action
System/output/model/policy/threshold versions
Source evidence versus generated narrative
Global, local, example, counterfactual or procedural form
Fidelity/accuracy claim and validation method
Stability under irrelevant and relevant changes
Meaningful language / accessibility / literacy / locale
Uncertainty / knowledge limits / missing data
Actionable correction or appeal—not gaming advice
Sensitive/proprietary/security information boundary
Human comprehension and misuse study
Owner / correction / expiry / non-use

LIME/SHAP ممکن است attribution تحت فرض/Background/implementation مشخص بدهند؛ علت، حقانیت Feature، نبود Proxy، صحت Label یا توضیح قابل‌فهم برای داوطلب را ثابت نمی‌کنند. توضیح باید با مخاطب—Developer، Reviewer، فرد متاثر، Auditor یا Operator—و Task او سنجیده شود.

Privacy-enhancing با Privacy-safe برابر نیست

روشچه کمکی می‌کند؟چه چیزی را تضمین نمی‌کند؟
Synthetic dataکاهش استفاده مستقیم از بعضی Recordهای واقعیعدم بازسازی/نشت/سوگیری/نمایندگی
Pseudonymizationجداسازی شناسه مستقیمناشناس‌بودن یا عدم linkability
Anonymization claimهدف کاهش identifiabilityمقاومت در هر Auxiliary data/context
Differential privacyضمانت ریاضی تعریف‌شده تحت mechanism/ε/δ/compositionPrivacy کل Pipeline یا Utility/Fairness
Federated learningData خام ممکن است محلی بماندعدم نشت gradient/update، secure aggregation یا consent
Encryptionحفاظت در Transit/At rest طبق پیاده‌سازیمصرف نامجاز پس از decrypt
Access controlمحدودکردن Actor/ActionPurpose limitation/retention correctness
Deletionحذف Artifactهای تعریف‌شدهUnlearning کامل مدل مگر سنجیده شود

داده مصنوعی را «از نظر آماری شبیه واقعی و بدون اطلاعات افراد» فرض نکنید؛ generator ممکن است Recordهای نادر را حفظ کند یا Harm تاریخی را تکثیر کند. Membership/attribute inference، nearest-neighbour/duplicate، canary، downstream utility، slice fidelity، provenance و licensing را در Threat model مناسب بررسی کنید. راهنمای داده مصنوعی/واقعی و TDM در مدیریت داده تست مالک جزئیات عملی است.

Human oversight را مثل Control واقعی تست کنید

Human Oversight Contract
Decision and harm requiring oversight
Reviewer role / authority / independence / competence
Information shown and intentionally hidden
Time, queue, workload, fatigue and accessibility
Model output timing: before, after or blinded comparison
Override / abstain / escalate / stop permissions
Reason/evidence required—not checkbox rationale
Disagreement and second-review rules
Automation/default/order/anchoring tests
Retaliation/conflict/incentive protections
Outcome feedback and correction loop
Override/appeal quality metrics and non-use
Backup / outage / review SLA / expiry

«Human in the loop» اگر Reviewer وقت، اختیار، اطلاعات یا مسیر Escalation ندارد، Control نیست. نرخ Override کم ممکن است نشان‌دهندهٔ مدل خوب، Automation bias، فشار KPI یا Override دشوار باشد. نرخ زیاد نیز ضعف مدل یا اختلاف Policy را ثابت نمی‌کند. تصمیم‌ها را با Blinded/ordered presentation و qualitative evidence بررسی کنید و Reviewer را با agreement-to-model رتبه‌بندی نکنید.

Appeal، Correction و Remedy را E2E تست کنید

مرحلهسؤال تستEvidence
Noticeفرد می‌فهمد AI/Decision/اثر چیست؟locale/accessibility/comprehension
Accessکانال اعتراض پیدا و قابل‌استفاده است؟unassisted task success
Identity/dataاصلاح داده بدون افشای اضافی ممکن است؟secure correction flow
ReviewReviewer مستقل و صاحب اختیار است؟authority/workload/trace
Evidenceفرد می‌تواند دلیل/مدرک مرتبط بدهد؟submission/accessibility/receipt
Timelineتاخیر خودش Harm می‌سازد؟distribution/SLA/urgent route
Outcomeدلیل و اقدام قابل‌فهم است؟decision record
CorrectionData/model/downstream systems اصلاح می‌شوند؟propagation/replay
Remedyاثر گذشته چگونه جبران می‌شود؟owner/action/closure
Learningخطای تکراری به change می‌رسد؟trend/root cause/control

قرار دادن یک ایمیل عمومی «حق اعتراض» قابل‌اجرا نیست. مسیر را با زبان فارسی طبیعی، RTL، موبایل، Screen reader، اتصال ضعیف، مدرک ناقص، deadline نزدیک و کاربر فاقد مهارت فنی آزمایش کنید. Appeal success rate نیز نباید هدف کمینه‌سازی یا امتیاز Reviewer شود.

Ethical Red Teaming: Charter، ایمنی و Closure

Responsible AI Red Team Charter
System/use/decision/harm scope and explicit non-scope
Authorization / environment / accounts / data / safe harbour
Stakeholders and community/domain input
Threat/harm hypotheses—not only prohibited words
Protected/PII/sensitive content handling
Allowed probes / rate / cost / physical/social boundaries
No real-person decision or stigmatizing dataset creation
Oracle / severity / evidence / uncertainty
Stop conditions / incident escalation / responder
Finding ownership / remediation / retest / residual risk
Disclosure / publication / redaction / retention
Participant wellbeing / compensation / support
Expiry and independent review

Red Team نباید با «تلاش برای شکستن اخلاق مدل» بی‌مرز شود. تولید محتوای آزاردهنده، جعل هویت، تست روی فرد واقعی یا جمع‌آوری دادهٔ حساس می‌تواند خودش Harm بسازد. Findings بدون owner/repair/retest فقط نمایش ریسک‌اند. تنوع تیم مفید است اما به‌تنهایی نمایندگی جامعه یا بی‌سوگیری را تضمین نمی‌کند.

امنیت و Robustness بخشی از اخلاق‌اند، نه کل آن

حمله/FailureHarm linkکنترل/آزمون
Evasion/adversarial inputرد/پذیرش یا safety غلطthreat-bounded perturbation
Poisoning/backdoorهدف‌گیری گروه/triggerprovenance/anomaly/canary
Prompt injection/tool abuseافشا/اقدام نامجازinstruction-data boundary/auth
Model extraction/inversionIP/privacyrate/access/privacy testing
Availability/cost attackقطع خدمت برای گروه وابستهquota/fallback/capacity
Unsafe fallbackPolicy یا Human overloadfailure-mode exercise
Vendor/model driftتغییر silent در outcomeversion/shadow/regression/rollback

یک مدل Robust ممکن است Policy ناعادلانه را بسیار پایدار اجرا کند؛ یک مدل Fairness-optimized نیز ممکن است Secret نشت دهد. Threat/Harm/Controlها را به هم متصل کنید ولی یک محور را جای دیگری ننشانید. حمله را فقط با مجوز، محیط ایزوله و دادهٔ امن اجرا کنید.

Vendor و مدل بسته: «نمی‌دانیم» را رسمی کنید

AI Supplier Evidence Request
Intended/prohibited use and customer responsibility
System/model/provider/subprocessor/version/change policy
Training/evaluation data provenance and limitations
Population/geography/language/accessibility evidence
Label/benchmark/metric/slice/uncertainty definitions
Known failures/incidents/abuse and residual risks
Privacy/security/retention/training use/data region
Explanation/log/audit/appeal/correction capabilities
Human oversight and operational requirements
Monitoring/drift notification/rollback/service continuity
Independent assessment scope and report access
Export/portability/termination/deletion/model retirement
Contractual remedies, support and evidence expiry

نبود دسترسی به Train data یا weights مانع همهٔ ارزیابی نیست؛ Black-box outcome، workflow، appeal، privacy contract و operational behavior قابل‌بررسی‌اند. اما Evidence gap را با Logo، گواهی مبهم یا «proprietary» پر نکنید. Gap بحرانی می‌تواند نتیجهٔ Defer/Limit/Stop باشد.

سناریوی ایرانی: غربال رزومه بدون تصمیم خودکار

یک شرکت خیالی ایرانی می‌خواهد ابزار Vendor برای رتبه‌بندی رزومهٔ QA بخرد. هدف اعلامی کاهش زمان Triage است؛ استخدام/رد نهایی باید انسانی بماند. هیچ داده یا آمار این سناریو واقعی نیست و مقاله قانون کار، ضدتبعیض یا مشاورهٔ حقوقی ایران ارائه نمی‌کند.

CV Triage Pilot — fictional
Decision: prioritize review queue, never auto-reject
No-AI baseline: structured rubric + randomized/blinded review sample
Population: consented fictional/synthetic Persian CVs
Job evidence: role-relevant work sample and explicit criteria
Prohibited features/inference: photo, age, gender, ethnicity,
  religion, health, marital status, pregnancy, salary history,
  personality/emotion and inferred protected traits
Group evaluation: only approved, consented, purpose-limited attributes
Critical harms: missed qualified candidate, disclosure, inaccessible appeal,
  reviewer anchoring, proxy exclusion, vendor retention
Reviewer: score hidden in an independent control arm where feasible
Output: priority suggestion + evidence uncertainty; no candidate ranking KPI
Appeal/correction: accessible Persian route with authorized independent review
Data: no real candidate in development; retention/deletion/vendor use tested
Gate: benefit versus baseline + harm guardrails + rollback + expiry

Problem و Alternative را قبل از Vendor بسنجید

ممکن است علت Queue، شرح شغل مبهم، Rubric ناسازگار، کمبود Reviewer یا کانال‌های جذب نابرابر باشد. گزینه‌های اصلاح JD، Rubric ساختاریافته، Work sample، ظرفیت Review و random sampling را با ابزار AI مقایسه کنید. «کاهش زمان» بدون کیفیت، missed candidate، workload و appeal cost Benefit کافی نیست.

Data و Proxy را کنترل کنید

نام دانشگاه، فاصلهٔ شغلی، محل سکونت، زبان، قالب CV و سابقهٔ شرکت می‌توانند Proxy فرصت/دسترسی باشند؛ حذف Feature حساس Proxy را حذف نمی‌کند. عکس، تاریخ تولد و اطلاعات غیرمرتبط را پیش از Vendor کمینه کنید. دادهٔ واقعی داوطلب برای PoC، Prompt یا Annotation عمومی مجاز فرض نشود.

Reviewer، Ranking و Appeal را تست کنید

آزمون کنترل‌شدهٔ کوچک می‌تواند اثر نمایش Score قبل/بعد از Rubric را بر تصمیم Reviewer بررسی کند، بدون رتبه‌بندی خود Reviewer. Candidate نباید به‌خاطر Score پایین خودکار حذف شود. Notice باید نقش ابزار و دادهٔ قابل‌اصلاح را روشن کند و اعتراض به Reviewer مستقل، نتیجهٔ ثبت‌شده و اصلاح downstream برسد.

مرز داده، زبان و ایران

فارسی/انگلیسی، Unicode/نیم‌فاصله، RTL، اعداد، فایل PDF/تصویر، اینترنت ضعیف و Screen reader بخشی از access/quality‌اند. Region/VPN، تحریم، پرداخت ارزی، Vendor training use، data residency، subprocessor، account closure و export/deletion باید در Contract باشند. Applicability قانونی/کارگری/حریم خصوصی و مبنای Attribute گروهی فقط با مسئول محلی تعیین می‌شود.

تعارض Privacy و Fairness را پنهان نکنید

برای کشف Gap ممکن است Attribute حساس لازم شود؛ جمع‌نکردن آن نیز Blind spot می‌سازد، اما جمع‌آوری بی‌هدف Harm حریم خصوصی دارد. راه‌حل خودکار نیست: Purpose limitation، رضایت/مبنای مجاز، voluntary/unknown، جداسازی Evaluation از Decision، access محدود، aggregation، minimum reporting size، retention، deletion و prohibition on individual use را با Privacy/Legal/community owner طراحی کنید.

گزینهBenefitRiskEvidence لازم
عدم جمع‌آوریکمینه‌سازیعدم مشاهده Harm گروهیalternative audit/gap
Self-report جداگانهگروه تعریف‌شده توسط فردconsent/coercion/missingnesspurpose/non-use/access
Trusted third partyseparationvendor/linkage/governancecontract/audit/delete
Privacy-preserving aggregateکاهش exposurenoise/small-group utilitymechanism/budget/uncertainty
Inferred attributeداده ظاهراً کاملmisclassification/stigma/privacyاغلب prohibit یا authority بسیار قوی

منابع جهانی را با Applicability محدود استفاده کنید

توصیه‌نامهٔ اخلاق هوش مصنوعی UNESCO ارزش‌ها، حقوق بشر، مشارکت، ارزیابی اثر، نظارت چرخهٔ عمر و امکان نپذیرفتن بعضی کاربردها را در سطح سیاستی مطرح می‌کند. این Recommendation راهنمای جهانی برای دولت‌ها و Actorهاست، نه Test standard اجرایی، گواهی محصول یا قانون خودکار در ایران. از آن برای کشف سؤال و Stakeholder استفاده کنید؛ Applicability و Control محلی را جدا بسازید.

چارچوب‌های دیگر نیز Glossary، Lens و Artifact می‌دهند، نه پاسخ اخلاقی نهایی. نسخه، حوزه، داوطلبانه/الزامی بودن، مخاطب و Gap را ثبت کنید. ادعای «مطابق NIST/UNESCO/OECD» بدون Scope، Mapping، Evidence و Review دقیق، اعتبار نمی‌سازد.

Production impact با Offline score تمام نمی‌شود

Production signalچه فرضیه‌ای می‌سازد؟Countermetric/حد
Outcome/error by approved sliceGap یا drift احتمالیmix/label delay/uncertainty
Abstain/fallback rateدانش/پوشش ناکافیبار انسانی و access delay
Override/disagreementمدل/Policy/workflow mismatchautomation bias/incentive
Appeal/correctionداده/تصمیم contestable نیستدسترسی نابرابر به appeal
Time-to-decision/remedyBurden توزیع‌شدهcomplexity/urgency mix
Incident/near misscontrol/harm pathwayunderreporting/retaliation
Access/drop-offشکاف زبان/دستگاه/هزینهchannel/population shift
Resource useهزینه/محیط/availabilityutility and workload
Vendor/model changeoutcome shiftهمبستگی، نه علیت

Monitoring نباید Surveillance جدید بسازد. هر Signal باید Purpose، minimum data، access، retention، denominator، missingness، alert، owner، investigation و non-use داشته باشد. Outcome دیررس و appeal self-selection می‌توانند Gap را پنهان کنند. Production experiment روی تصمیم پرخطر بدون رضایت/Authority/Guardrail قابل‌قبول فرض نشود.

Feedback loop و performative effect را تست کنید

  • Ranking چه چیزهایی را بیشتر دیده/بررسی/Label می‌کند و چه چیزهایی ناپدید می‌شوند؟
  • افراد چگونه رفتار خود را برای Score تغییر می‌دهند و چه کسی توان بازی‌کردن ندارد؟
  • Reviewer از خروجی مدل چه Label تازه‌ای می‌سازد و آیا Circularity رخ می‌دهد؟
  • Rejectشدگان Outcome بعدی ندارند؛ نبود Label به معنی درست‌بودن رد نیست.
  • Policy/قیمت/دسترسی چگونه Base rate و Population آینده را تغییر می‌دهد؟
  • Complaint کم ممکن است ناشی از ناآگاهی، ترس، هزینه یا نبود کانال باشد.
  • Mitigation امروز ممکن است Harm را به زمان/کانال/گروه دیگری منتقل کند.
  • Retraining باید Appeal correction و data lineage را بدون بازتولید Harm مدیریت کند.

Shadow/Canary می‌تواند blast radius را محدود کند اما Fairness/Ethics را خودکار نمی‌کند. Control group، withholding benefit و exposure به Harm نیازمند طراحی و Authority اخلاقی/حقوقی است. برای هر آزمایش، stop condition و remedy کسانی را که آسیب دیده‌اند پیشاپیش تعیین کنید.

Change Impact: هر تغییر می‌تواند Claim را منقضی کند

Responsible AI Change Record
Change: model/data/prompt/tool/threshold/policy/UI/workflow/vendor
Reason / owner / approval / effective time
Affected use, population, stakeholder and harm claims
Compatibility and historical-comparison limits
New/removed data and consent/retention implications
Offline/slice/counterfactual/explanation/security evidence
Human-workflow, accessibility and appeal regression
Shadow/canary scope and ethical authority
Metric/threshold changes and rationale
Known unknowns / dissent / residual risk
Rollback/stop/remedy/communication
Post-change monitor / expiry / independent review

تعویض Prompt یا Threshold فقط «تنظیم کوچک» نیست؛ می‌تواند Selection، explanation، workload و appeal را عوض کند. Vendor ممکن است Model را بدون Version شفاف به‌روزرسانی کند. اگر identity و change notice ندارید، Evidence قبلی قابل‌نسبت‌دادن نیست و Risk owner باید تصمیم محدودسازی/توقف بگیرد.

Evidence Pack و Decision Record

Responsible AI Evidence Pack
Decision/use/non-goal/no-AI alternative
System/workflow/data/model/vendor/version boundary
Stakeholders/right/harm/benefit/power map
Applicable law/policy/standard and owner
Claims, metrics, formulas, thresholds and rationale
Population/slices/intersections/sample/uncertainty/missingness
Label/proxy/data provenance/consent/access/retention
Aggregate and disaggregated results + countermetrics
Explanation/human oversight/accessibility/usability evidence
Privacy/security/safety/environment/labour evidence
Appeal/correction/remedy/incident test results
Independent review, stakeholder input and unresolved dissent
Residual risks, evidence gaps and prohibited use
Controls/owners/runbook/rollback/stop conditions
Decision: Adopt / Adapt / Limit / Defer / Stop
Authority/signatures/date/expiry/monitor/review/public summary

Evidence Pack برای Accountability است، نه انتقال مسئولیت به سند. Data/Model card، Impact assessment، Risk register و Test report را می‌توان به این Pack لینک کرد؛ نسخه‌های متناقض را یک «Single source» ادعایی پنهان نکند. اسرار و دادهٔ شخصی را با دسترسی/Redaction حفظ کنید، اما Public-facing transparency مناسب را نیز تعریف کنید.

Decision Gate: Hard stop را Average جبران نمی‌کند

GateسؤالStop/Limit نمونهAuthority
LegitimacyUse لازم/متناسب/مجاز است؟کاربرد ممنوع/بدون مبناLegal/Policy/Executive
Stakeholderاثر و صداهای غایب فهمیده شده؟Harm پرخطر ناشناختهImpact owner/community mechanism
Dataprovenance/label/privacy معتبر است؟داده نامجاز/label غیرقابل‌دفاعData/Privacy/Domain
FairnessClaim و Trade-off قابل‌دفاع‌اند؟critical gap/no remedyDomain/Risk/Legal
Human workflowAuthority/time/override واقعی است؟rubber-stamp reviewOperations/People/Product
Contestabilitynotice/appeal/correction/remedy کار می‌کند؟تصمیم پراثر بی‌اعتراضService/Legal
Operationsmonitor/incident/rollback/exit وجود دارد؟نسخه/owner نامعلومOperations/Risk
EvidenceGap/uncertainty در حد تصمیم است؟inconclusive critical claimDecision owner

Accuracy، ROI یا زمان کمتر نمی‌تواند دادهٔ نامجاز، کاربرد نامتناسب یا حق اعتراض غایب را جبران کند. راهنمای عمومی تصمیم انتشار و کیفیت به‌اندازهٔ کافی خوب منطق Evidence/Unknown/Authority را توضیح می‌دهد؛ در AI پراثر، Risk acceptance باید به صاحب اختیار مشخص برسد و QA نباید مسئولیت حقوقی/اخلاقی خیالی بپذیرد.

Governance و استقلال بررسی

نقشمسئولیتنباید
Product/use ownerbenefit/use/non-goalتنها risk acceptance همهٔ حقوق
Model/Data ownerprovenance/validity/versionخودش تنها Auditor باشد
QA/TEVVClaim/evidence/limits/reproducibilityاخلاقی اعلام‌کردن محصول
Domain expertlabel/outcome/harm/standardMetric را بدون stakeholder تعیین کند
Privacy/Security/Safetyspecific risk/control/incidentیک Lens را کل Ethics بداند
Legal/Complianceapplicability/obligation/processاخلاق را به compliance تقلیل دهد
Affected stakeholder mechanismlived impact/needs/dissentتزئینی یا بدون قدرت باشد
Independent reviewconflict/challenge/assuranceبه Vendor evidence محدود شود
Decision authorityAdopt/Limit/Stop/remedyپشت «AI گفت» پنهان شود

کمیتهٔ اخلاق بدون Mandate، بودجه، دسترسی، escalation و اختیار Stop به Bottleneck یا تشریفات تبدیل می‌شود. تعارض منافع، dissent، whistleblowing/retaliation، quorum، urgent decision، record و sunset را تعریف کنید. Reviewer مستقل به معنی بی‌خطا یا بی‌سوگیری نیست؛ Scope و Evidence او نیز قابل‌بازبینی است.

Metricهای سالم برای برنامهٔ Responsible AI

Signalتعریف عملیCountermetric/Non-use
Claim coveragecritical claims با owner/evidence/expiryتعداد سند
Evidence-gap closureresolve/limit/accept/stop با authorityاجبار Unknown به Pass
Harm-control linkagecritical harms با preventive/detective/remedy controlrisk count
Slice reliabilityversioned eligible slices با uncertaintyچری‌پیک گروه
Appeal accessibilityunassisted reachable/comprehensible routeکمینه‌کردن appeal rate
Correction propagationاصلاح به systems/outcomes لازم می‌رسدticket closure
Override qualitysampled rationale/outcome reviewagreement-to-model
Incident/remedy timedistribution by harm/stateفشار برای عدم گزارش
Change reassessmentmaterial changes با impact reviewreview count
Retirement/exit readinessfallback/export/delete/owner drillVendor permanence

تعداد Bias found، Fairness score واحد، Ethics checklist completion، Red-team prompts، SHAP plots، complaints، appeals، overrides، blocked releases یا trainings برگزارشده را KPI فرد/تیم نکنید. این اعداد قابل‌بازی‌اند و گزارش ریسک را سرکوب می‌کنند. Outcome باید با denominator، quality و اثر ناخواسته خوانده شود.

AI برای ارزیابی اخلاق AI؛ حلقهٔ بسته نسازید

  • LLM می‌تواند Hypothesis، دسته‌بندی اولیه یا گزارش Draft بدهد؛ تصمیم اخلاقی/حقوقی نمی‌دهد.
  • یک مدل را Judge همان Provider/خانواده نکنید بدون common-mode و conflict analysis.
  • Sentiment، emotion، toxicity و bias classifier خودشان Population/label/error/Harm دارند.
  • خلاصهٔ شکایت نباید صدای اقلیت، uncertainty یا dissent را حذف کند.
  • AI نباید از متن/صدا/چهره attribute حساس، صداقت، شخصیت یا قابلیت شغلی استنتاج کند.
  • Prompt و Output می‌توانند PII/Secret/harassing content داشته باشند؛ دسترسی و retention لازم است.
  • Human review باید اختیار و Evidence داشته باشد؛ تایید خروجی Judge همان Oversight نیست.
  • نسخه/Prompt/temperature/tool/evaluation set و correction trail را ثبت کنید.

برنامهٔ ۳۰روزهٔ Pilot ارزیابی اثر

بازهکارخروجی
روز ۱–۵Use/No-AI/Stakeholder/Authority mapscope + stop candidates
روز ۶–۱۰Harm/right/power/workflow mappingcritical Ethical Claim Contracts
روز ۱۱–۱۵data/label/proxy/slice/metric auditevidence plan + gaps
روز ۱۶–۲۰model/workflow/explanation/oversight testsdisaggregated Evidence Pack
روز ۲۱–۲۵appeal/privacy/security/accessibility tabletopfailure/remedy/runbook findings
روز ۲۶–۳۰independent/stakeholder Evidence reviewAdopt/Adapt/Limit/Defer/Stop + expiry

در ۳۰ روز «اخلاقی بودن» ثابت نمی‌شود. Pilot باید یک Use محدود، دادهٔ امن، بدون تصمیم واقعی پراثر و با امکان Stop داشته باشد. اگر stakeholder access، مبنای داده، Label معتبر یا Appeal وجود ندارد، خروجی ارزشمند می‌تواند Defer/Stop و اصلاح مسئله باشد.

۲۰ ضدالگوی تست اخلاقی AI

  • «AI اخلاقی» به‌عنوان Feature یا Badge.
  • شروع با ابزار Fairness پیش از Harm question.
  • Accuracy کلی به‌عنوان خیر عمومی.
  • Gap صفر به‌عنوان عدالت.
  • Threshold آماده بدون Context/Applicability.
  • Label تاریخی به‌عنوان حقیقت بی‌طرف.
  • حذف Feature حساس به‌عنوان حذف Proxy.
  • استنتاج attribute حساس از نام/صدا/تصویر.
  • Slice کوچک بدون uncertainty/Unknown.
  • Counterfactual نام به‌عنوان Causal proof.
  • SHAP/LIME به‌عنوان علت یا حق اعتراض.
  • Synthetic data به‌عنوان خصوصی/بی‌سوگیری.
  • Federated/DP به‌عنوان Privacy کل سیستم.
  • Human-in-loop بدون وقت/اختیار/استقلال.
  • ایمیل عمومی به‌عنوان Remedy.
  • Red Team بدون مجوز/ایمنی/closure.
  • Vendor certificate به‌جای Evidence.
  • Compliance به‌عنوان سقف Ethics.
  • Fairness/complaint/override score برای افراد.
  • Release بدون monitoring/rollback/stop/remedy.

چک‌لیست ۲۰‌نقطه‌ای تصمیم

  1. Use، Decision، Benefit و non-goal صریح‌اند.
  2. No-AI و گزینهٔ کم‌آسیب‌تر مقایسه شده‌اند.
  3. Stakeholder/subject/bystander و Power map وجود دارد.
  4. Right/Harm/Distribution و افراد غایب ثبت‌اند.
  5. Applicability owner و محدودیت حقوقی روشن است.
  6. System/workflow/human/vendor boundary کامل است.
  7. Critical claimها falsifiable و versioned هستند.
  8. Data/label/proxy/provenance/consent معتبرند.
  9. Population/slice/intersection/missingness تعریف شده‌اند.
  10. Metric/denominator/threshold/rationale/countermetric ثبت‌اند.
  11. Uncertainty/multiplicity/Unknown/Inconclusive حفظ می‌شوند.
  12. Fairness trade-off و dissent مستند است.
  13. Explanation برای audience/task/fidelity تست شده است.
  14. Human oversight اختیار/وقت/override/escalation دارد.
  15. Privacy/security/safety/accessibility/labour بررسی شده‌اند.
  16. Notice/appeal/correction/remedy E2E کار می‌کنند.
  17. Red Team مجاز/ایمن و finding closureدار است.
  18. Vendor evidence/change/exit/deletion کافی است.
  19. Monitoring/incident/rollback/retirement تمرین شده‌اند.
  20. Decision authority، residual risk و expiry ثبت شده‌اند.

جمع‌بندی: از اصل اخلاقی تا Control قابل‌بازبینی

تست اخلاقی AI انتخاب میان «اخلاق» و «سرعت» نیست؛ روشن‌کردن این است که چه Useای مشروع است، چه کسی Benefit/Harm می‌بیند، کدام ادعا با چه Evidence پشتیبانی می‌شود، چه Unknownی باقی است و چه کسی اختیار Limit/Stop و Remedy دارد. ابزار، Metric و Explanation به این تصمیم کمک می‌کنند؛ جای آن را نمی‌گیرند.

از مدل شروع نکنید: مسئله و Alternative، Stakeholder و Power، حق و Harm را بنویسید. سپس Data/Label/Workflow را همراه مدل تست کنید، Fairness را با Context انتخاب کنید، Human oversight و Appeal را واقعی بسازید و Change/Production را زیر Monitoring پاسخگو نگه دارید. نتیجه ممکن است Release، محدودسازی، بازطراحی یا Stop باشد—هر چهار می‌توانند تصمیم حرفه‌ای باشند.

پرسش‌های متداول دربارهٔ تست اخلاقی هوش مصنوعی

آیا تست می‌تواند ثابت کند یک سیستم AI اخلاقی است؟

خیر. Test فقط Claim محدود را در Context، Population، Data، Metric و زمان مشخص بررسی می‌کند. اخلاق شامل حق، قدرت، تناسب استفاده، اثر توزیعی، مشارکت، Trade-off و جبران نیز هست. نتیجه باید Evidence، Unknown، residual risk، authority و expiry داشته باشد؛ Badge «Ethical AI» تولید نکند.

بهترین معیار Fairness برای مدل کدام است؟

بهترین معیار جهانی وجود ندارد. ابتدا outcome، qualification/label، گروه، denominator، خطای زیان‌بار و حق/Policy را تعریف کنید. Demographic parity، Equal opportunity، Equalized odds، calibration و Counterfactual fairness سؤال‌های متفاوت و گاهی ناسازگار دارند؛ Metric را با Domain/Legal/Stakeholder owner و Trade-off صریح انتخاب کنید.

آیا SHAP یا LIME سوگیری و دلیل واقعی تصمیم را نشان می‌دهند؟

آن‌ها می‌توانند attribution مدل را تحت فرض، Background data و پیاده‌سازی مشخص توضیح دهند؛ الزاماً علت جهان واقعی، حقانیت Feature، نبود Proxy، صحت Label یا explanation معنادار برای فرد متاثر نیستند. Fidelity، stability، audience comprehension، knowledge limits و مسیر Appeal را جدا تست کنید.

آیا داده مصنوعی و Federated Learning حریم خصوصی را تضمین می‌کنند؟

خیر. دادهٔ مصنوعی ممکن است Record حفظ یا Bias را بازتولید کند؛ Federated Learning نیز update/gradient، metadata و endpoint risk دارد. Differential Privacy فقط تحت mechanism، بودجه و composition مشخص ضمانت تعریف‌شده می‌دهد. Data flow، consent/purpose، inference threat، access، retention، deletion و Vendor را E2E بررسی کنید.

مسئول خطای یک سیستم هوش مصنوعی چه کسی است؟

پاسخ عمومی و بدون حوزهٔ قضایی وجود ندارد. نقش توسعه‌دهنده، Provider، سازمان deployکننده، operator، data controller و Decision owner به Contract، کنترل واقعی، کاربرد و قانون وابسته است. از ابتدا decision rights، incident، appeal، remedy و record را تعریف و برای مسئولیت حقوقی از مشاور واجدصلاحیت همان حوزه استفاده کنید.

دیدگاهتان را بنویسید