فرض کنید مدل غربال رزومه ۹۲٪ Accuracy دارد. تیم SHAP هم اجرا کرده، نمودار Fairness سبز است و هیچ باگ API دیده نمیشود. بااینحال، «صلاحیت» از استخدامهای تاریخی برچسب خورده، افراد بدون داده کنار گذاشته میشوند، Recruiter روزانه فقط چند ثانیه برای Override وقت دارد و داوطلب نمیداند چرا رد شده یا چگونه اعتراض کند. آیا سیستم «اخلاقی» است؟ هیچ Test score بهتنهایی پاسخ این سؤال را نمیدهد.
تست اخلاقی هوش مصنوعی گواهی فضیلت مدل نیست؛ فرایندی اجتماعی-فنی برای تبدیل ادعای مبهم «مسئولانه» به سؤالهای قابلرد، شواهد تفکیکشده، Guardrail، حق اعتراض و تصمیم پاسخگوست: Use/Decision → Stakeholder/Right/Harm → Alternative/Boundary → Claim/Metric → Data/Slice/Uncertainty → Workflow/Control → Appeal/Remedy → Monitor/Review/Stop.
پاسخ کوتاه: تست اخلاقی AI چیست؟
- پیش از مدل بپرسید آیا AI برای این تصمیم لازم، متناسب و مجاز است یا گزینهٔ کمآسیبتری وجود دارد.
- افراد متاثر، حقوق/منافع، Benefit، Harm، توزیع اثر و افراد غایب از جلسه/داده را مشخص کنید.
- Decision و Workflow کامل را تست کنید؛ Model score فقط یکی از اجزاست.
- Fairness را از هدف و Harm تعریف کنید؛ هیچ Metric جهانشمولی «عدالت» را اثبات نمیکند.
- نتایج Aggregate را با Sliceهای موجه، تقاطعها، اندازهٔ نمونه و عدمقطعیت همراه کنید.
- Label، Proxy، Missingness، دسترسی نابرابر و feedback loop را بهعنوان Test object ببینید.
- Explanation را برای مخاطب/وظیفه بسنجید؛ SHAP/LIME پاسخگویی، حق اعتراض یا صحت تصمیم نیست.
- Human-in-the-loop را با Authority، زمان، استقلال، اطلاعات، Override و Automation bias تست کنید.
- Privacy، Security، Accessibility، Safety، محیطزیست و کار را Trade-offهای واقعی بدانید، نه چکباکس.
- Release فقط با owner، stop/rollback، monitoring، incident، appeal، correction و remedy معنا دارد.
Intent جستوجو و کلیدواژهها
Intent اصلی اطلاعاتی/اجرایی است: «ملاحظات اخلاقی در تست سیستم هوش مصنوعی را چگونه عملی کنیم؟» کلیدواژهٔ اصلی تست اخلاقی هوش مصنوعی است. عبارتهای مکمل: اخلاق در هوش مصنوعی، Ethical AI Testing، Responsible AI Testing، ارزیابی اثر اخلاقی AI، AI Impact Assessment، تست سوگیری الگوریتم، تست Fairness مدل، Harmful Bias، انصاف الگوریتمی، تست Explainability، شفافیت AI، پاسخگویی الگوریتم، Human Oversight، حق اعتراض به تصمیم خودکار، AI Red Teaming، تست حریم خصوصی مدل، AI Governance و چکلیست اخلاق هوش مصنوعی.
این مقاله لایهٔ ارزیابی اثر و Governance را مالک است. برای Data/Model/Drift و Production به راهنمای تست سیستمهای AI/ML، برای دوراهیهای حرفهای خود QA به اخلاق در تست نرمافزار و برای الزامات داده به راهنمای تست حریم خصوصی مراجعه کنید. اینجا شواهد فنی را به Harm، حق، اختیار و جبران وصل میکنیم.
Ethics، Compliance، Safety و Quality مترادف نیستند
| Lens | سؤال | Evidence نمونه | محدودیت |
|---|---|---|---|
| Ethics/rights | چه کسی چه Benefit/Harm/Power/Remedy دارد؟ | impact map، stakeholder evidence | با Score واحد بسته نمیشود |
| Law/compliance | چه الزام و حوزهٔ قضایی اعمال میشود؟ | applicability/controls/legal review | انطباق حداقل ممکن است، نه اخلاق کامل |
| Safety | چه Hazardی به آسیب میرسد؟ | hazard/control/incident evidence | همهٔ عدالت/حقوق را پوشش نمیدهد |
| Security | چه تهدیدی confidentiality/integrity/availability را میشکند؟ | threat model/red-team/control | خروجی امن میتواند ناعادلانه باشد |
| Privacy | Data processing چگونه بر autonomy/dignity اثر دارد؟ | data flow/minimization/deletion | ناشناسسازی عدالت را ثابت نمیکند |
| Quality/utility | سیستم برای Task چقدر مفید/درست است؟ | validity/reliability/UX/operations | Accuracy بالا Harm را رد نمیکند |
| Governance | چه کسی تصمیم/اعتراض/تغییر/توقف میدهد؟ | authority/records/audit/remedy | کاغذبازی بدون اجرا نیست |
واژهٔ «اخلاقی» را به Label بازاریابی تبدیل نکنید. NIST در AI Risk Management Framework ویژگیهایی مانند validity/reliability، safety، security/resilience، accountability/transparency، explainability، privacy و Fairness با مدیریت harmful bias را در Context و Trade-off میبیند. AI RMF ۱.۰ داوطلبانه است و طبق صفحهٔ فعلی در حال بازنگری؛ Certification، قانون ایران یا اثبات Trustworthiness نیست.
Test نمیتواند «اخلاقی بودن» را اثبات کند
Test میتواند یک Claim محدود را در Population/Window/Metric مشخص رد یا پشتیبانی کند: «در این held-out sample، شکاف TPR بین Slice A و B از حد توافقشده بیشتر نبود» یا «هر تصمیم منفی مسیر اعتراض قابلدسترسی داشت». این Evidence دربارهٔ جامعهٔ غایب، آینده، حقانیت Label، تناسب خودکارسازی، اثر بلندمدت یا اجرای Remedy چیزی را خودکار ثابت نمیکند.
Ethical Claim Contract
Use case / decision / benefit / non-goal
Affected stakeholders and absent voices
Right, interest, harm and distribution pathway
Legal/policy/domain applicability owner
No-AI and less-intrusive alternatives considered
System/workflow boundary and human authority
Claim phrased to be falsifiable
Population / slice / intersection / time / geography
Outcome/label provenance and contestability
Metric/formula/threshold/rationale/countermetric
Data source/consent/access/missingness/uncertainty
Evidence method / independence / limitations
Control / residual risk / owner / expiry
Appeal / correction / remedy / incident route
Pass / Fail / Inconclusive / Unknown / Stop rule
Decision authority / dissent / publication / review
«مدل تبعیض ندارد»، «شفاف است»، «حریم خصوصی را تضمین میکند» و «برای همه مفید است» Claim آزمونپذیر نیستند. واژهٔ گروه، نتیجهٔ مثبت، qualification، error، Harm، data window و threshold را تعریف کنید و Scope عدمادعا را کنار نتیجه بنویسید.
اول سؤال سخت: آیا باید AI بسازیم یا استفاده کنیم؟
| گزینه | چه چیزی را میکاهد؟ | چه چیزی باقی میماند؟ |
|---|---|---|
| Do nothing | AI-specific risk/cost | ضرر فرایند فعلی |
| Fix policy/process | اتوماسیون مشکل تعریفنشده | اجرای انسانی/عملیاتی |
| Rule/checklist | opacity/variability | Rule bias/maintenance |
| Decision support | autonomous authority | automation bias/workload |
| Triage/queue | scope تصمیم مدل | delay/priority harm |
| Limited pilot | blast radius | consent/selection/rollback |
| Automated decision | throughput/toil | بالاترین نیاز به validity/appeal/remedy |
| Prohibit/stop | unacceptable/unmanageable harm | جایگزین و transition |
Accuracy بهتر از انسان، اگر واقعاً با Design معتبر نشان داده شود، هنوز ضرورت AI یا خودکارسازی را ثابت نمیکند. سؤال مقایسهای است: کدام گزینه برای چه جمعیت و harm، با چه هزینه، اختیار، قابلیت اعتراض و اثر توزیعی بهتر است؟ Baseline انسانی نیز بیطرف یا بیخطا فرض نمیشود؛ باید همانقدر دقیق تعریف شود.
Stakeholder و Power map؛ فقط «کاربر» نداریم
Stakeholder / community / representative
Direct user, subject, bystander or indirectly affected
Benefit promised / burden imposed / harm pathway
Right/interest and decision dependency
Power to consent, refuse, opt out or appeal
Access to information and explanation
Ability to absorb delay/error/cost
Language, disability, connectivity and access needs
Representation in data/design/test/governance
Conflict of interest / retaliation / coercion risk
Contact, engagement method and compensation
Disagreement / unresolved concern / owner / review date
خریدار سیستم، operator، فرد subject، خانواده، کارمند، جامعهٔ محلی، Vendor، Regulator و تیم Operations ممکن است هدفهای متضاد داشته باشند. نظرسنجی چند کاربر نمایندهٔ Public interest نیست. مشارکت باید زودهنگام، قابلاثر، دسترسپذیر و امن باشد؛ «نظرخواهی» بعد از تصمیم قطعی یا بدون امکان تغییر، Participation معنادار نیست.
Harm map؛ از Error تا اثر توزیعشده
| Harm lens | نمونهٔ مسیر | Evidence/Control |
|---|---|---|
| Allocation | وام/شغل/خدمت/صف ناعادلانه | outcome slices + appeal/remedy |
| Quality of service | خطای بیشتر برای زبان/دستگاه خاص | disaggregated reliability |
| Representation | تحقیر، کلیشه یا حذف | community review + policy |
| Privacy/autonomy | جمعآوری/استنتاج/دستکاری بدون اختیار | data flow/minimization/consent boundary |
| Safety/security | آسیب جسمی، مالی یا سوءاستفاده | hazard/threat/control/incident |
| Procedural | دلیل/اعتراض/اصلاح در دسترس نیست | notice/explanation/appeal SLA |
| Labour | نظارت، deskilling، workload یا رتبهبندی | worker engagement/non-use/work design |
| Collective/systemic | feedback loop، تمرکز قدرت، chilling effect | longitudinal/external review/stop |
| Environment/access | مصرف منابع یا شکاف اتصال/هزینه | resource/access/alternative evidence |
Severity×Likelihood عددی فقط وقتی معنا دارد که تعریف، Evidence و Authority داشته باشد؛ Harmهای حقوقی/کرامت/تبعیض را بیدلیل با هزینه مالی جمع نزنید. Reversibility، duration، scale، vulnerability، detectability، cumulative effect و امکان جبران را جدا نگه دارید. Unknown را صفر نکنید.
System boundary: مدل فقط یک جزء است
Policy and eligibility definition
Data collection / consent / labeling / historical process
Feature and proxy construction
Model / threshold / calibration / abstention
UI / ranking / explanation / defaults
Human reviewer / workload / authority / incentives
Action / notification / delay / access
Appeal / correction / remedy / escalation
Monitoring / feedback / retraining / vendor change
Governance / audit / publication / retirement
مدل میتواند Metric انتخابی را برابر کند اما UI رتبه را برجسته، Reviewer را تحت فشار و Policy گروهی را حذف کند. Label تاریخی ممکن است نتیجهٔ دسترسی نابرابر باشد. Workflow، انسان، سازمان، Vendor و محیط بخشی از Test object هستند؛ «مدل منصف» عبارت کافی برای «سیستم منصف» نیست.
Bias چیست؟ تفاوت آماری همیشه Harm نیست
Bias میتواند Statistical/systematic error، inductive bias مفید مدل، خطای شناختی یا harmful social bias باشد. تفاوت خروجی میان گروهها Signal بررسی است، نه اثبات خودکار تبعیض یا مجوز حذف تفاوت. NIST SP ۱۲۷۰ دربارهٔ شناسایی و مدیریت Bias در AI بر این نکته تاکید دارد که Bias فقط در Data/algorithm نیست و Context انسانی/سازمانی نیز باید مدیریت شود؛ این چارچوب قانون یا فرمول واحد Fairness نیست.
| منبع | سؤال تست | خطای تشخیص |
|---|---|---|
| Historical | Label/Outcome گذشته چه نابرابری را حمل میکند؟ | قدیمی بودن را تنها علت دانستن |
| Representation | چه جمعیتی کم/غایب/بداندازهگیری شده؟ | برابرکردن Count بدون Population |
| Measurement | Proxy/Instrument برای چه گروهی خطا دارد؟ | Label را Ground truth گرفتن |
| Aggregation | یک مدل/threshold تفاوتهای معنادار را میپوشاند؟ | تفکیک غیرمجاز یا Overfit |
| Evaluation | Benchmark/metric با Use case همراستاست؟ | Leaderboard=real utility |
| Deployment | Context/Operator/User رفتار را چگونه عوض میکند؟ | مدل ثابت=اثر ثابت |
| Feedback | Output چه دادهٔ آیندهای میسازد؟ | Drift را فقط فنی دیدن |
| Organizational | هدف، Incentive، deadline و قدرت چه اثری دارند؟ | ابزار فنی بهعنوان درمان ساختار |
Fairness question را پیش از Metric بنویسید
Decision and positive/negative outcome
Who benefits / who bears which error
Qualification/label meaning and validity
Affected group and why grouping is legitimate
Reference population / time / geography
Access/exposure/eligibility denominator
Relevant error: FP, FN, ranking, calibration, delay, abstention
Fairness concept and metric chosen
Why this concept fits the right/harm/policy
Known incompatible goals and trade-offs
Minimum sample / uncertainty / multiplicity
Intersection and small-group handling
Threshold/control/remedy—not only model optimization
Legal/domain/community owner and dissent
Non-use / expiry / production monitoring
Demographic parity، Equal opportunity، Equalized odds، Predictive parity، Calibration، Individual/Counterfactual fairness سؤالهای یکسانی ندارند و تحت شرایطی با هم ناسازگارند. راهنمای آموزشی Google ML دربارهٔ Counterfactual Fairness نیز صریحاً میگوید معیار واحد جهانی وجود ندارد و بعضی تعریفها با هم ناسازگارند؛ این منبع آموزشی است، نه Policy مناسب استخدام/وام ایران.
Metricهای Fairness با سؤال و خطر خودشان
| Metric/Concept | سؤال سادهشده | Dependency | خطر سوءبرداشت |
|---|---|---|---|
| Selection/Demographic parity | نرخ نتیجه مثبت برابر است؟ | eligible/exposure denominator | Qualification/Harm را نادیده میگیرد |
| Equal opportunity | TPR میان گروهها برابر است؟ | Label مثبت معتبر | FPR و access را نمیبیند |
| Equalized odds | TPR و FPR برابرند؟ | Label و threshold | PPV/calibration متفاوت میماند |
| Predictive parity | PPV نتیجه مثبت برابر است؟ | base rate/label | خطای رد را نمیبیند |
| Calibration | Score مشابه معنای outcome مشابه دارد؟ | time/population/outcome | Decision threshold عادلانه نیست |
| Counterfactual test | با تغییر attribute/representation چه میشود؟ | valid comparable pair/causal assumptions | جهان خلافواقع سادهسازی میشود |
| Individual consistency | افراد مشابه خروجی مشابه دارند؟ | تعریف Similarity | Similarity خودش ارزشبار است |
| Burden/appeal parity | زمان/هزینه/اصلاح برابر است؟ | workflow telemetry | مدل را تنها سطح میبیند |
Gap صفر نیز عدالت را ثابت نمیکند: ممکن است هر دو گروه به یک اندازه بد خدمت بگیرند. Threshold بر مبنای ۸۰% rule یا هر عدد آماده را بدون applicability استفاده نکنید. Absolute rate، denominator، confidence interval/uncertainty، sample، missing group، multiple comparisons و practical harm را کنار Ratio/Gap گزارش دهید.
آزمایش قابلبازتولید: سه Policy، سه پاسخ متفاوت
برای مشاهدهٔ مکانیک Metricها، یک اسکریپت Node.js بدون وابستگی روی Confusion countهای کاملاً ساختگی اجرا شد. هر Policy دو گروه انتزاعی A/B و برای هر گروه فقط هشت مورد دارد؛ هر گروه چهار Label مثبت و چهار منفی دارد. A/B هیچ ویژگی جمعیتشناختی واقعی را نمایندگی نمیکنند.
{"policy":"BASELINE","aggregateAccuracy":81.3,"selectionRateGap":37.5,"truePositiveRateGap":50,"falsePositiveRateGap":25,"byGroup":{"A":{"n":8,"selectionRate":62.5,"truePositiveRate":100,"falsePositiveRate":25,"accuracy":87.5},"B":{"n":8,"selectionRate":25,"truePositiveRate":50,"falsePositiveRate":0,"accuracy":75}}}
{"policy":"SELECTION_PARITY","aggregateAccuracy":62.5,"selectionRateGap":0,"truePositiveRateGap":25,"falsePositiveRateGap":25,"byGroup":{"A":{"n":8,"selectionRate":50,"truePositiveRate":75,"falsePositiveRate":25,"accuracy":75},"B":{"n":8,"selectionRate":50,"truePositiveRate":50,"falsePositiveRate":50,"accuracy":50}}}
{"policy":"OPPORTUNITY_PARITY","aggregateAccuracy":75,"selectionRateGap":25,"truePositiveRateGap":0,"falsePositiveRateGap":50,"byGroup":{"A":{"n":8,"selectionRate":37.5,"truePositiveRate":75,"falsePositiveRate":0,"accuracy":87.5},"B":{"n":8,"selectionRate":62.5,"truePositiveRate":75,"falsePositiveRate":50,"accuracy":62.5}}}
Policy پایه: Accuracy بهتر، شکافهای بزرگ
BASELINE با Accuracy کلی ۸۱٫۳٪ در این جدول بهترین است، اما شکاف Selection برابر ۳۷٫۵، شکاف TPR برابر ۵۰ و شکاف FPR برابر ۲۵ واحد درصد دارد. Aggregate، گروه B و نوع خطای آن را پنهان میکند. هنوز نمیدانیم Label معتبر یا کدام Error زیانبارتر است.
Selection parity: یک Gap صفر، نه عدالت کامل
SELECTION_PARITY نرخ انتخاب هر دو گروه را ۵۰٪ و Gap آن را صفر میکند، اما Accuracy کلی به ۶۲٫۵٪ میرسد و شکاف TPR/FPR هر دو ۲۵ واحد درصد باقی میمانند. این Policy معیار نامگذاریشده را برآورده میکند؛ حقانیت Outcome، کیفیت Label، Harm و سایر معیارها را اثبات نمیکند.
Opportunity parity: TPR برابر، FPR نابرابر
OPPORTUNITY_PARITY شکاف TPR را صفر میکند، اما شکاف Selection به ۲۵ و شکاف FPR به ۵۰ واحد درصد میرسد. اگر False positive اثر سنگینی داشته باشد، این Trade-off مهم است. اسم Policy بهتنهایی نمیگوید برای کدام حق/خطر مناسب است.
محدودیت سخت آزمایش
تمام Countها، گروهها و Policyها توسط نویسنده انتخاب شدهاند. نمونهٔ ۱۶تایی فاقد داده، مدل، انسان، زمان، عدمقطعیت، significance، intersection، missingness، access، qualification validity، base-rate realism، cost، causality و feedback است. خروجی Benchmark، مطالعهٔ Fairness، اثبات ناسازگاری عمومی، دستور Threshold، ابزار تصمیم استخدام/وام یا معیار Performance افراد نیست؛ فقط نشان میدهد بهینهکردن یک تعریف میتواند پاسخ تعریف دیگر را باز بگذارد.
Slice، Intersection و عدمقطعیت
- گروه را بهخاطر سهولت Data انتخاب نکنید؛ رابطهٔ آن با Harm/حق/قانون/کاربرد را ثبت کنید.
- Attribute حساس را حدس یا از Name/Image/Voice استنتاج نکنید؛ مبنای جمعآوری و non-use لازم است.
- Aggregate subgroup میتواند تقاطعها—مثلاً زبان×دستگاه×دسترسی—را پنهان کند.
- Slice ریز، N کم و interval بزرگ میسازد؛ صفر Event را صفر Risk ندانید.
- گزارش چند ده Gap احتمال کشف تصادفی را زیاد میکند؛ plan و multiplicity را پیشاپیش تعریف کنید.
- Missing/Unknown/Prefer-not-to-say را حذف خاموش نکنید و Missingness گروهی را بسنجید.
- خصوصیت گروهی برای Evaluation نباید به Feature تصمیم یا رتبهبندی فرد تبدیل شود.
- نتیجهٔ گروهی را به فرد تعمیم ندهید و فرد/تیم را با Fairness score رتبهبندی نکنید.
Label و Ground truth ممکن است خودِ مسئله باشند
| Label نمونه | چرا Ground truth نیست؟ | آزمون/جایگزین |
|---|---|---|
| استخدام شد | دسترسی/ترجیح/فرایند تاریخی | job-relevant outcome + structured review |
| وام را بازپرداخت کرد | offer/price/shock/selection | policy-aware longitudinal outcome |
| Fraud تایید شد | فقط موارد بررسیشده Label دارند | verification sampling/selection model |
| کلیک کرد | exposure، dark pattern، preference لحظهای | user outcome/guardrail |
| هزینه درمان | دسترسی و قیمت ≠ نیاز | domain-defined need/outcome |
| Rating کاربر | selection/retaliation/culture | multi-source/task evidence |
| Moderator label | instruction/ambiguity/disagreement | guide/blind adjudication/unknown |
Inter-annotator agreement بالا صحت ارزش/واقعیت را تضمین نمیکند؛ همه ممکن است راهنمای بد را یکسان اجرا کنند. Label guide، provenance، disagreement، adjudication، appeals/corrections و drift را نگه دارید. Fine-tuning روی «داده متعادل» تاریخی را خودکار درمان Bias ننامید.
Counterfactual test مفید است، اما Causal proof نیست
تغییر نام، ضمیر یا گروه در رزومه و ثابتگرفتن بقیه میتواند حساسیت مدل را آشکار کند؛ اما «دو فرد یکسان جز جنسیت» همیشه Counterfactual معتبر نیست. نام ممکن است زبان/منطقه را نیز Proxy کند، ویژگیها causal relation داشته باشند و Generator جمله را نامعمول کند. Pair construction، realism، invariance assumptions و human review را ثبت کنید.
Counterfactual Probe
Claim / protected or salient attribute / harm
Original input provenance and permission
Transformation and fields deliberately held constant
Causal/domain justification for comparability
Language/grammar/realism checks
Model/prompt/system/config/seed versions
Expected invariant or bounded relation
Outcome/score/reason/tool-call differences
Multiple variants and order/control conditions
Known proxies and interactions not controlled
Human/domain review / limitations / next test
Prohibition on creating real-person decisions
نتیجهٔ ثابت نیز absence of bias را ثابت نمیکند؛ مدل ممکن است از Proxy دیگری استفاده کند یا Harm گروهی/ساختاری باقی باشد. Counterfactual probe مکمل disaggregated outcomes، data audit و workflow study است.
Transparency، Explainability و Contestability سه هدفاند
| هدف | مخاطب/Task | Evidence | False comfort |
|---|---|---|---|
| Transparency | چه سیستم/داده/مالک/محدودیتی؟ | notice، model/system card، change log | انتشار سند طولانی |
| Interpretability | Output در Context چه معنایی دارد؟ | score/threshold/uncertainty semantics | نمودار زیبا |
| Explainability | چه Evidence/reason برای این خروجی؟ | reason fidelity/stability/comprehension | SHAP=علت |
| Auditability | آیا روند و اثر قابلبازبینی است؟ | provenance/log/version/controls | انباشت همهٔ داده |
| Contestability | فرد چگونه تصمیم را رد/اصلاح کند؟ | appeal path/authority/SLA/remedy | Human review اسمی |
| Accountability | چه کسی پاسخ/تغییر/توقف میدهد؟ | decision rights/action records | «مدل تصمیم گرفت» |
برای عمق XAI به راهنمای هوش مصنوعی قابل توضیح وصل شوید. NISTIR 8312 چهار Lens مفید—وجود explanation، معناداری برای مخاطب، accuracy نسبت به فرایند سیستم و knowledge limits—پیشنهاد میکند. این اصول بهخودیخود الزام حقوقی، روش آزمون کامل یا تضمین Trust نیستند.
Explanation Test Contract
Decision / explanation purpose / audience / action
System/output/model/policy/threshold versions
Source evidence versus generated narrative
Global, local, example, counterfactual or procedural form
Fidelity/accuracy claim and validation method
Stability under irrelevant and relevant changes
Meaningful language / accessibility / literacy / locale
Uncertainty / knowledge limits / missing data
Actionable correction or appeal—not gaming advice
Sensitive/proprietary/security information boundary
Human comprehension and misuse study
Owner / correction / expiry / non-use
LIME/SHAP ممکن است attribution تحت فرض/Background/implementation مشخص بدهند؛ علت، حقانیت Feature، نبود Proxy، صحت Label یا توضیح قابلفهم برای داوطلب را ثابت نمیکنند. توضیح باید با مخاطب—Developer، Reviewer، فرد متاثر، Auditor یا Operator—و Task او سنجیده شود.
Privacy-enhancing با Privacy-safe برابر نیست
| روش | چه کمکی میکند؟ | چه چیزی را تضمین نمیکند؟ |
|---|---|---|
| Synthetic data | کاهش استفاده مستقیم از بعضی Recordهای واقعی | عدم بازسازی/نشت/سوگیری/نمایندگی |
| Pseudonymization | جداسازی شناسه مستقیم | ناشناسبودن یا عدم linkability |
| Anonymization claim | هدف کاهش identifiability | مقاومت در هر Auxiliary data/context |
| Differential privacy | ضمانت ریاضی تعریفشده تحت mechanism/ε/δ/composition | Privacy کل Pipeline یا Utility/Fairness |
| Federated learning | Data خام ممکن است محلی بماند | عدم نشت gradient/update، secure aggregation یا consent |
| Encryption | حفاظت در Transit/At rest طبق پیادهسازی | مصرف نامجاز پس از decrypt |
| Access control | محدودکردن Actor/Action | Purpose limitation/retention correctness |
| Deletion | حذف Artifactهای تعریفشده | Unlearning کامل مدل مگر سنجیده شود |
داده مصنوعی را «از نظر آماری شبیه واقعی و بدون اطلاعات افراد» فرض نکنید؛ generator ممکن است Recordهای نادر را حفظ کند یا Harm تاریخی را تکثیر کند. Membership/attribute inference، nearest-neighbour/duplicate، canary، downstream utility، slice fidelity، provenance و licensing را در Threat model مناسب بررسی کنید. راهنمای داده مصنوعی/واقعی و TDM در مدیریت داده تست مالک جزئیات عملی است.
Human oversight را مثل Control واقعی تست کنید
Human Oversight Contract
Decision and harm requiring oversight
Reviewer role / authority / independence / competence
Information shown and intentionally hidden
Time, queue, workload, fatigue and accessibility
Model output timing: before, after or blinded comparison
Override / abstain / escalate / stop permissions
Reason/evidence required—not checkbox rationale
Disagreement and second-review rules
Automation/default/order/anchoring tests
Retaliation/conflict/incentive protections
Outcome feedback and correction loop
Override/appeal quality metrics and non-use
Backup / outage / review SLA / expiry
«Human in the loop» اگر Reviewer وقت، اختیار، اطلاعات یا مسیر Escalation ندارد، Control نیست. نرخ Override کم ممکن است نشاندهندهٔ مدل خوب، Automation bias، فشار KPI یا Override دشوار باشد. نرخ زیاد نیز ضعف مدل یا اختلاف Policy را ثابت نمیکند. تصمیمها را با Blinded/ordered presentation و qualitative evidence بررسی کنید و Reviewer را با agreement-to-model رتبهبندی نکنید.
Appeal، Correction و Remedy را E2E تست کنید
| مرحله | سؤال تست | Evidence |
|---|---|---|
| Notice | فرد میفهمد AI/Decision/اثر چیست؟ | locale/accessibility/comprehension |
| Access | کانال اعتراض پیدا و قابلاستفاده است؟ | unassisted task success |
| Identity/data | اصلاح داده بدون افشای اضافی ممکن است؟ | secure correction flow |
| Review | Reviewer مستقل و صاحب اختیار است؟ | authority/workload/trace |
| Evidence | فرد میتواند دلیل/مدرک مرتبط بدهد؟ | submission/accessibility/receipt |
| Timeline | تاخیر خودش Harm میسازد؟ | distribution/SLA/urgent route |
| Outcome | دلیل و اقدام قابلفهم است؟ | decision record |
| Correction | Data/model/downstream systems اصلاح میشوند؟ | propagation/replay |
| Remedy | اثر گذشته چگونه جبران میشود؟ | owner/action/closure |
| Learning | خطای تکراری به change میرسد؟ | trend/root cause/control |
قرار دادن یک ایمیل عمومی «حق اعتراض» قابلاجرا نیست. مسیر را با زبان فارسی طبیعی، RTL، موبایل، Screen reader، اتصال ضعیف، مدرک ناقص، deadline نزدیک و کاربر فاقد مهارت فنی آزمایش کنید. Appeal success rate نیز نباید هدف کمینهسازی یا امتیاز Reviewer شود.
Ethical Red Teaming: Charter، ایمنی و Closure
Responsible AI Red Team Charter
System/use/decision/harm scope and explicit non-scope
Authorization / environment / accounts / data / safe harbour
Stakeholders and community/domain input
Threat/harm hypotheses—not only prohibited words
Protected/PII/sensitive content handling
Allowed probes / rate / cost / physical/social boundaries
No real-person decision or stigmatizing dataset creation
Oracle / severity / evidence / uncertainty
Stop conditions / incident escalation / responder
Finding ownership / remediation / retest / residual risk
Disclosure / publication / redaction / retention
Participant wellbeing / compensation / support
Expiry and independent review
Red Team نباید با «تلاش برای شکستن اخلاق مدل» بیمرز شود. تولید محتوای آزاردهنده، جعل هویت، تست روی فرد واقعی یا جمعآوری دادهٔ حساس میتواند خودش Harm بسازد. Findings بدون owner/repair/retest فقط نمایش ریسکاند. تنوع تیم مفید است اما بهتنهایی نمایندگی جامعه یا بیسوگیری را تضمین نمیکند.
امنیت و Robustness بخشی از اخلاقاند، نه کل آن
| حمله/Failure | Harm link | کنترل/آزمون |
|---|---|---|
| Evasion/adversarial input | رد/پذیرش یا safety غلط | threat-bounded perturbation |
| Poisoning/backdoor | هدفگیری گروه/trigger | provenance/anomaly/canary |
| Prompt injection/tool abuse | افشا/اقدام نامجاز | instruction-data boundary/auth |
| Model extraction/inversion | IP/privacy | rate/access/privacy testing |
| Availability/cost attack | قطع خدمت برای گروه وابسته | quota/fallback/capacity |
| Unsafe fallback | Policy یا Human overload | failure-mode exercise |
| Vendor/model drift | تغییر silent در outcome | version/shadow/regression/rollback |
یک مدل Robust ممکن است Policy ناعادلانه را بسیار پایدار اجرا کند؛ یک مدل Fairness-optimized نیز ممکن است Secret نشت دهد. Threat/Harm/Controlها را به هم متصل کنید ولی یک محور را جای دیگری ننشانید. حمله را فقط با مجوز، محیط ایزوله و دادهٔ امن اجرا کنید.
Vendor و مدل بسته: «نمیدانیم» را رسمی کنید
AI Supplier Evidence Request
Intended/prohibited use and customer responsibility
System/model/provider/subprocessor/version/change policy
Training/evaluation data provenance and limitations
Population/geography/language/accessibility evidence
Label/benchmark/metric/slice/uncertainty definitions
Known failures/incidents/abuse and residual risks
Privacy/security/retention/training use/data region
Explanation/log/audit/appeal/correction capabilities
Human oversight and operational requirements
Monitoring/drift notification/rollback/service continuity
Independent assessment scope and report access
Export/portability/termination/deletion/model retirement
Contractual remedies, support and evidence expiry
نبود دسترسی به Train data یا weights مانع همهٔ ارزیابی نیست؛ Black-box outcome، workflow، appeal، privacy contract و operational behavior قابلبررسیاند. اما Evidence gap را با Logo، گواهی مبهم یا «proprietary» پر نکنید. Gap بحرانی میتواند نتیجهٔ Defer/Limit/Stop باشد.
سناریوی ایرانی: غربال رزومه بدون تصمیم خودکار
یک شرکت خیالی ایرانی میخواهد ابزار Vendor برای رتبهبندی رزومهٔ QA بخرد. هدف اعلامی کاهش زمان Triage است؛ استخدام/رد نهایی باید انسانی بماند. هیچ داده یا آمار این سناریو واقعی نیست و مقاله قانون کار، ضدتبعیض یا مشاورهٔ حقوقی ایران ارائه نمیکند.
CV Triage Pilot — fictional
Decision: prioritize review queue, never auto-reject
No-AI baseline: structured rubric + randomized/blinded review sample
Population: consented fictional/synthetic Persian CVs
Job evidence: role-relevant work sample and explicit criteria
Prohibited features/inference: photo, age, gender, ethnicity,
religion, health, marital status, pregnancy, salary history,
personality/emotion and inferred protected traits
Group evaluation: only approved, consented, purpose-limited attributes
Critical harms: missed qualified candidate, disclosure, inaccessible appeal,
reviewer anchoring, proxy exclusion, vendor retention
Reviewer: score hidden in an independent control arm where feasible
Output: priority suggestion + evidence uncertainty; no candidate ranking KPI
Appeal/correction: accessible Persian route with authorized independent review
Data: no real candidate in development; retention/deletion/vendor use tested
Gate: benefit versus baseline + harm guardrails + rollback + expiry
Problem و Alternative را قبل از Vendor بسنجید
ممکن است علت Queue، شرح شغل مبهم، Rubric ناسازگار، کمبود Reviewer یا کانالهای جذب نابرابر باشد. گزینههای اصلاح JD، Rubric ساختاریافته، Work sample، ظرفیت Review و random sampling را با ابزار AI مقایسه کنید. «کاهش زمان» بدون کیفیت، missed candidate، workload و appeal cost Benefit کافی نیست.
Data و Proxy را کنترل کنید
نام دانشگاه، فاصلهٔ شغلی، محل سکونت، زبان، قالب CV و سابقهٔ شرکت میتوانند Proxy فرصت/دسترسی باشند؛ حذف Feature حساس Proxy را حذف نمیکند. عکس، تاریخ تولد و اطلاعات غیرمرتبط را پیش از Vendor کمینه کنید. دادهٔ واقعی داوطلب برای PoC، Prompt یا Annotation عمومی مجاز فرض نشود.
Reviewer، Ranking و Appeal را تست کنید
آزمون کنترلشدهٔ کوچک میتواند اثر نمایش Score قبل/بعد از Rubric را بر تصمیم Reviewer بررسی کند، بدون رتبهبندی خود Reviewer. Candidate نباید بهخاطر Score پایین خودکار حذف شود. Notice باید نقش ابزار و دادهٔ قابلاصلاح را روشن کند و اعتراض به Reviewer مستقل، نتیجهٔ ثبتشده و اصلاح downstream برسد.
مرز داده، زبان و ایران
فارسی/انگلیسی، Unicode/نیمفاصله، RTL، اعداد، فایل PDF/تصویر، اینترنت ضعیف و Screen reader بخشی از access/qualityاند. Region/VPN، تحریم، پرداخت ارزی، Vendor training use، data residency، subprocessor، account closure و export/deletion باید در Contract باشند. Applicability قانونی/کارگری/حریم خصوصی و مبنای Attribute گروهی فقط با مسئول محلی تعیین میشود.
تعارض Privacy و Fairness را پنهان نکنید
برای کشف Gap ممکن است Attribute حساس لازم شود؛ جمعنکردن آن نیز Blind spot میسازد، اما جمعآوری بیهدف Harm حریم خصوصی دارد. راهحل خودکار نیست: Purpose limitation، رضایت/مبنای مجاز، voluntary/unknown، جداسازی Evaluation از Decision، access محدود، aggregation، minimum reporting size، retention، deletion و prohibition on individual use را با Privacy/Legal/community owner طراحی کنید.
| گزینه | Benefit | Risk | Evidence لازم |
|---|---|---|---|
| عدم جمعآوری | کمینهسازی | عدم مشاهده Harm گروهی | alternative audit/gap |
| Self-report جداگانه | گروه تعریفشده توسط فرد | consent/coercion/missingness | purpose/non-use/access |
| Trusted third party | separation | vendor/linkage/governance | contract/audit/delete |
| Privacy-preserving aggregate | کاهش exposure | noise/small-group utility | mechanism/budget/uncertainty |
| Inferred attribute | داده ظاهراً کامل | misclassification/stigma/privacy | اغلب prohibit یا authority بسیار قوی |
منابع جهانی را با Applicability محدود استفاده کنید
توصیهنامهٔ اخلاق هوش مصنوعی UNESCO ارزشها، حقوق بشر، مشارکت، ارزیابی اثر، نظارت چرخهٔ عمر و امکان نپذیرفتن بعضی کاربردها را در سطح سیاستی مطرح میکند. این Recommendation راهنمای جهانی برای دولتها و Actorهاست، نه Test standard اجرایی، گواهی محصول یا قانون خودکار در ایران. از آن برای کشف سؤال و Stakeholder استفاده کنید؛ Applicability و Control محلی را جدا بسازید.
چارچوبهای دیگر نیز Glossary، Lens و Artifact میدهند، نه پاسخ اخلاقی نهایی. نسخه، حوزه، داوطلبانه/الزامی بودن، مخاطب و Gap را ثبت کنید. ادعای «مطابق NIST/UNESCO/OECD» بدون Scope، Mapping، Evidence و Review دقیق، اعتبار نمیسازد.
Production impact با Offline score تمام نمیشود
| Production signal | چه فرضیهای میسازد؟ | Countermetric/حد |
|---|---|---|
| Outcome/error by approved slice | Gap یا drift احتمالی | mix/label delay/uncertainty |
| Abstain/fallback rate | دانش/پوشش ناکافی | بار انسانی و access delay |
| Override/disagreement | مدل/Policy/workflow mismatch | automation bias/incentive |
| Appeal/correction | داده/تصمیم contestable نیست | دسترسی نابرابر به appeal |
| Time-to-decision/remedy | Burden توزیعشده | complexity/urgency mix |
| Incident/near miss | control/harm pathway | underreporting/retaliation |
| Access/drop-off | شکاف زبان/دستگاه/هزینه | channel/population shift |
| Resource use | هزینه/محیط/availability | utility and workload |
| Vendor/model change | outcome shift | همبستگی، نه علیت |
Monitoring نباید Surveillance جدید بسازد. هر Signal باید Purpose، minimum data، access، retention، denominator، missingness، alert، owner، investigation و non-use داشته باشد. Outcome دیررس و appeal self-selection میتوانند Gap را پنهان کنند. Production experiment روی تصمیم پرخطر بدون رضایت/Authority/Guardrail قابلقبول فرض نشود.
Feedback loop و performative effect را تست کنید
- Ranking چه چیزهایی را بیشتر دیده/بررسی/Label میکند و چه چیزهایی ناپدید میشوند؟
- افراد چگونه رفتار خود را برای Score تغییر میدهند و چه کسی توان بازیکردن ندارد؟
- Reviewer از خروجی مدل چه Label تازهای میسازد و آیا Circularity رخ میدهد؟
- Rejectشدگان Outcome بعدی ندارند؛ نبود Label به معنی درستبودن رد نیست.
- Policy/قیمت/دسترسی چگونه Base rate و Population آینده را تغییر میدهد؟
- Complaint کم ممکن است ناشی از ناآگاهی، ترس، هزینه یا نبود کانال باشد.
- Mitigation امروز ممکن است Harm را به زمان/کانال/گروه دیگری منتقل کند.
- Retraining باید Appeal correction و data lineage را بدون بازتولید Harm مدیریت کند.
Shadow/Canary میتواند blast radius را محدود کند اما Fairness/Ethics را خودکار نمیکند. Control group، withholding benefit و exposure به Harm نیازمند طراحی و Authority اخلاقی/حقوقی است. برای هر آزمایش، stop condition و remedy کسانی را که آسیب دیدهاند پیشاپیش تعیین کنید.
Change Impact: هر تغییر میتواند Claim را منقضی کند
Responsible AI Change Record
Change: model/data/prompt/tool/threshold/policy/UI/workflow/vendor
Reason / owner / approval / effective time
Affected use, population, stakeholder and harm claims
Compatibility and historical-comparison limits
New/removed data and consent/retention implications
Offline/slice/counterfactual/explanation/security evidence
Human-workflow, accessibility and appeal regression
Shadow/canary scope and ethical authority
Metric/threshold changes and rationale
Known unknowns / dissent / residual risk
Rollback/stop/remedy/communication
Post-change monitor / expiry / independent review
تعویض Prompt یا Threshold فقط «تنظیم کوچک» نیست؛ میتواند Selection، explanation، workload و appeal را عوض کند. Vendor ممکن است Model را بدون Version شفاف بهروزرسانی کند. اگر identity و change notice ندارید، Evidence قبلی قابلنسبتدادن نیست و Risk owner باید تصمیم محدودسازی/توقف بگیرد.
Evidence Pack و Decision Record
Responsible AI Evidence Pack
Decision/use/non-goal/no-AI alternative
System/workflow/data/model/vendor/version boundary
Stakeholders/right/harm/benefit/power map
Applicable law/policy/standard and owner
Claims, metrics, formulas, thresholds and rationale
Population/slices/intersections/sample/uncertainty/missingness
Label/proxy/data provenance/consent/access/retention
Aggregate and disaggregated results + countermetrics
Explanation/human oversight/accessibility/usability evidence
Privacy/security/safety/environment/labour evidence
Appeal/correction/remedy/incident test results
Independent review, stakeholder input and unresolved dissent
Residual risks, evidence gaps and prohibited use
Controls/owners/runbook/rollback/stop conditions
Decision: Adopt / Adapt / Limit / Defer / Stop
Authority/signatures/date/expiry/monitor/review/public summary
Evidence Pack برای Accountability است، نه انتقال مسئولیت به سند. Data/Model card، Impact assessment، Risk register و Test report را میتوان به این Pack لینک کرد؛ نسخههای متناقض را یک «Single source» ادعایی پنهان نکند. اسرار و دادهٔ شخصی را با دسترسی/Redaction حفظ کنید، اما Public-facing transparency مناسب را نیز تعریف کنید.
Decision Gate: Hard stop را Average جبران نمیکند
| Gate | سؤال | Stop/Limit نمونه | Authority |
|---|---|---|---|
| Legitimacy | Use لازم/متناسب/مجاز است؟ | کاربرد ممنوع/بدون مبنا | Legal/Policy/Executive |
| Stakeholder | اثر و صداهای غایب فهمیده شده؟ | Harm پرخطر ناشناخته | Impact owner/community mechanism |
| Data | provenance/label/privacy معتبر است؟ | داده نامجاز/label غیرقابلدفاع | Data/Privacy/Domain |
| Fairness | Claim و Trade-off قابلدفاعاند؟ | critical gap/no remedy | Domain/Risk/Legal |
| Human workflow | Authority/time/override واقعی است؟ | rubber-stamp review | Operations/People/Product |
| Contestability | notice/appeal/correction/remedy کار میکند؟ | تصمیم پراثر بیاعتراض | Service/Legal |
| Operations | monitor/incident/rollback/exit وجود دارد؟ | نسخه/owner نامعلوم | Operations/Risk |
| Evidence | Gap/uncertainty در حد تصمیم است؟ | inconclusive critical claim | Decision owner |
Accuracy، ROI یا زمان کمتر نمیتواند دادهٔ نامجاز، کاربرد نامتناسب یا حق اعتراض غایب را جبران کند. راهنمای عمومی تصمیم انتشار و کیفیت بهاندازهٔ کافی خوب منطق Evidence/Unknown/Authority را توضیح میدهد؛ در AI پراثر، Risk acceptance باید به صاحب اختیار مشخص برسد و QA نباید مسئولیت حقوقی/اخلاقی خیالی بپذیرد.
Governance و استقلال بررسی
| نقش | مسئولیت | نباید |
|---|---|---|
| Product/use owner | benefit/use/non-goal | تنها risk acceptance همهٔ حقوق |
| Model/Data owner | provenance/validity/version | خودش تنها Auditor باشد |
| QA/TEVV | Claim/evidence/limits/reproducibility | اخلاقی اعلامکردن محصول |
| Domain expert | label/outcome/harm/standard | Metric را بدون stakeholder تعیین کند |
| Privacy/Security/Safety | specific risk/control/incident | یک Lens را کل Ethics بداند |
| Legal/Compliance | applicability/obligation/process | اخلاق را به compliance تقلیل دهد |
| Affected stakeholder mechanism | lived impact/needs/dissent | تزئینی یا بدون قدرت باشد |
| Independent review | conflict/challenge/assurance | به Vendor evidence محدود شود |
| Decision authority | Adopt/Limit/Stop/remedy | پشت «AI گفت» پنهان شود |
کمیتهٔ اخلاق بدون Mandate، بودجه، دسترسی، escalation و اختیار Stop به Bottleneck یا تشریفات تبدیل میشود. تعارض منافع، dissent، whistleblowing/retaliation، quorum، urgent decision، record و sunset را تعریف کنید. Reviewer مستقل به معنی بیخطا یا بیسوگیری نیست؛ Scope و Evidence او نیز قابلبازبینی است.
Metricهای سالم برای برنامهٔ Responsible AI
| Signal | تعریف عملی | Countermetric/Non-use |
|---|---|---|
| Claim coverage | critical claims با owner/evidence/expiry | تعداد سند |
| Evidence-gap closure | resolve/limit/accept/stop با authority | اجبار Unknown به Pass |
| Harm-control linkage | critical harms با preventive/detective/remedy control | risk count |
| Slice reliability | versioned eligible slices با uncertainty | چریپیک گروه |
| Appeal accessibility | unassisted reachable/comprehensible route | کمینهکردن appeal rate |
| Correction propagation | اصلاح به systems/outcomes لازم میرسد | ticket closure |
| Override quality | sampled rationale/outcome review | agreement-to-model |
| Incident/remedy time | distribution by harm/state | فشار برای عدم گزارش |
| Change reassessment | material changes با impact review | review count |
| Retirement/exit readiness | fallback/export/delete/owner drill | Vendor permanence |
تعداد Bias found، Fairness score واحد، Ethics checklist completion، Red-team prompts، SHAP plots، complaints، appeals، overrides، blocked releases یا trainings برگزارشده را KPI فرد/تیم نکنید. این اعداد قابلبازیاند و گزارش ریسک را سرکوب میکنند. Outcome باید با denominator، quality و اثر ناخواسته خوانده شود.
AI برای ارزیابی اخلاق AI؛ حلقهٔ بسته نسازید
- LLM میتواند Hypothesis، دستهبندی اولیه یا گزارش Draft بدهد؛ تصمیم اخلاقی/حقوقی نمیدهد.
- یک مدل را Judge همان Provider/خانواده نکنید بدون common-mode و conflict analysis.
- Sentiment، emotion، toxicity و bias classifier خودشان Population/label/error/Harm دارند.
- خلاصهٔ شکایت نباید صدای اقلیت، uncertainty یا dissent را حذف کند.
- AI نباید از متن/صدا/چهره attribute حساس، صداقت، شخصیت یا قابلیت شغلی استنتاج کند.
- Prompt و Output میتوانند PII/Secret/harassing content داشته باشند؛ دسترسی و retention لازم است.
- Human review باید اختیار و Evidence داشته باشد؛ تایید خروجی Judge همان Oversight نیست.
- نسخه/Prompt/temperature/tool/evaluation set و correction trail را ثبت کنید.
برنامهٔ ۳۰روزهٔ Pilot ارزیابی اثر
| بازه | کار | خروجی |
|---|---|---|
| روز ۱–۵ | Use/No-AI/Stakeholder/Authority map | scope + stop candidates |
| روز ۶–۱۰ | Harm/right/power/workflow mapping | critical Ethical Claim Contracts |
| روز ۱۱–۱۵ | data/label/proxy/slice/metric audit | evidence plan + gaps |
| روز ۱۶–۲۰ | model/workflow/explanation/oversight tests | disaggregated Evidence Pack |
| روز ۲۱–۲۵ | appeal/privacy/security/accessibility tabletop | failure/remedy/runbook findings |
| روز ۲۶–۳۰ | independent/stakeholder Evidence review | Adopt/Adapt/Limit/Defer/Stop + expiry |
در ۳۰ روز «اخلاقی بودن» ثابت نمیشود. Pilot باید یک Use محدود، دادهٔ امن، بدون تصمیم واقعی پراثر و با امکان Stop داشته باشد. اگر stakeholder access، مبنای داده، Label معتبر یا Appeal وجود ندارد، خروجی ارزشمند میتواند Defer/Stop و اصلاح مسئله باشد.
۲۰ ضدالگوی تست اخلاقی AI
- «AI اخلاقی» بهعنوان Feature یا Badge.
- شروع با ابزار Fairness پیش از Harm question.
- Accuracy کلی بهعنوان خیر عمومی.
- Gap صفر بهعنوان عدالت.
- Threshold آماده بدون Context/Applicability.
- Label تاریخی بهعنوان حقیقت بیطرف.
- حذف Feature حساس بهعنوان حذف Proxy.
- استنتاج attribute حساس از نام/صدا/تصویر.
- Slice کوچک بدون uncertainty/Unknown.
- Counterfactual نام بهعنوان Causal proof.
- SHAP/LIME بهعنوان علت یا حق اعتراض.
- Synthetic data بهعنوان خصوصی/بیسوگیری.
- Federated/DP بهعنوان Privacy کل سیستم.
- Human-in-loop بدون وقت/اختیار/استقلال.
- ایمیل عمومی بهعنوان Remedy.
- Red Team بدون مجوز/ایمنی/closure.
- Vendor certificate بهجای Evidence.
- Compliance بهعنوان سقف Ethics.
- Fairness/complaint/override score برای افراد.
- Release بدون monitoring/rollback/stop/remedy.
چکلیست ۲۰نقطهای تصمیم
- Use، Decision، Benefit و non-goal صریحاند.
- No-AI و گزینهٔ کمآسیبتر مقایسه شدهاند.
- Stakeholder/subject/bystander و Power map وجود دارد.
- Right/Harm/Distribution و افراد غایب ثبتاند.
- Applicability owner و محدودیت حقوقی روشن است.
- System/workflow/human/vendor boundary کامل است.
- Critical claimها falsifiable و versioned هستند.
- Data/label/proxy/provenance/consent معتبرند.
- Population/slice/intersection/missingness تعریف شدهاند.
- Metric/denominator/threshold/rationale/countermetric ثبتاند.
- Uncertainty/multiplicity/Unknown/Inconclusive حفظ میشوند.
- Fairness trade-off و dissent مستند است.
- Explanation برای audience/task/fidelity تست شده است.
- Human oversight اختیار/وقت/override/escalation دارد.
- Privacy/security/safety/accessibility/labour بررسی شدهاند.
- Notice/appeal/correction/remedy E2E کار میکنند.
- Red Team مجاز/ایمن و finding closureدار است.
- Vendor evidence/change/exit/deletion کافی است.
- Monitoring/incident/rollback/retirement تمرین شدهاند.
- Decision authority، residual risk و expiry ثبت شدهاند.
جمعبندی: از اصل اخلاقی تا Control قابلبازبینی
تست اخلاقی AI انتخاب میان «اخلاق» و «سرعت» نیست؛ روشنکردن این است که چه Useای مشروع است، چه کسی Benefit/Harm میبیند، کدام ادعا با چه Evidence پشتیبانی میشود، چه Unknownی باقی است و چه کسی اختیار Limit/Stop و Remedy دارد. ابزار، Metric و Explanation به این تصمیم کمک میکنند؛ جای آن را نمیگیرند.
از مدل شروع نکنید: مسئله و Alternative، Stakeholder و Power، حق و Harm را بنویسید. سپس Data/Label/Workflow را همراه مدل تست کنید، Fairness را با Context انتخاب کنید، Human oversight و Appeal را واقعی بسازید و Change/Production را زیر Monitoring پاسخگو نگه دارید. نتیجه ممکن است Release، محدودسازی، بازطراحی یا Stop باشد—هر چهار میتوانند تصمیم حرفهای باشند.
پرسشهای متداول دربارهٔ تست اخلاقی هوش مصنوعی
آیا تست میتواند ثابت کند یک سیستم AI اخلاقی است؟
خیر. Test فقط Claim محدود را در Context، Population، Data، Metric و زمان مشخص بررسی میکند. اخلاق شامل حق، قدرت، تناسب استفاده، اثر توزیعی، مشارکت، Trade-off و جبران نیز هست. نتیجه باید Evidence، Unknown، residual risk، authority و expiry داشته باشد؛ Badge «Ethical AI» تولید نکند.
بهترین معیار Fairness برای مدل کدام است؟
بهترین معیار جهانی وجود ندارد. ابتدا outcome، qualification/label، گروه، denominator، خطای زیانبار و حق/Policy را تعریف کنید. Demographic parity، Equal opportunity، Equalized odds، calibration و Counterfactual fairness سؤالهای متفاوت و گاهی ناسازگار دارند؛ Metric را با Domain/Legal/Stakeholder owner و Trade-off صریح انتخاب کنید.
آیا SHAP یا LIME سوگیری و دلیل واقعی تصمیم را نشان میدهند؟
آنها میتوانند attribution مدل را تحت فرض، Background data و پیادهسازی مشخص توضیح دهند؛ الزاماً علت جهان واقعی، حقانیت Feature، نبود Proxy، صحت Label یا explanation معنادار برای فرد متاثر نیستند. Fidelity، stability، audience comprehension، knowledge limits و مسیر Appeal را جدا تست کنید.
آیا داده مصنوعی و Federated Learning حریم خصوصی را تضمین میکنند؟
خیر. دادهٔ مصنوعی ممکن است Record حفظ یا Bias را بازتولید کند؛ Federated Learning نیز update/gradient، metadata و endpoint risk دارد. Differential Privacy فقط تحت mechanism، بودجه و composition مشخص ضمانت تعریفشده میدهد. Data flow، consent/purpose، inference threat، access، retention، deletion و Vendor را E2E بررسی کنید.
مسئول خطای یک سیستم هوش مصنوعی چه کسی است؟
پاسخ عمومی و بدون حوزهٔ قضایی وجود ندارد. نقش توسعهدهنده، Provider، سازمان deployکننده، operator، data controller و Decision owner به Contract، کنترل واقعی، کاربرد و قانون وابسته است. از ابتدا decision rights، incident، appeal، remedy و record را تعریف و برای مسئولیت حقوقی از مشاور واجدصلاحیت همان حوزه استفاده کنید.

