본 연구는 로봇 수술 훈련 과정에서 전공과 간 역량 평정을 위한 GEARS(Global Evaluative Assessment of Robotic Skills) 평가 체계를 기반으로 한 무작위, 이중 맹검 평가 프로토콜의 차별적 타당성을 평가하는 것을 목적으로 하였다. 단일 로봇 수술 훈련 센터에서 전향적, 무작위, 이중 맹검 평가 프로토콜을 시행하였다. 로봇 수술 경험이 전무한 외과(17명), 비뇨기과(16명), 산부인과(16명) 전공의 49명이 3주간의 훈련 프로그램(집약적 시뮬레이터(dV-Trainer) 및 돼지모델 술기 훈련 7일, 임상 참관 2주)을 이수하였다. 모든 수술 영상은 익명화되어 각 세션마다 12인 전문가 패널 중 무작위로 선정된 7인의 평가자에게 배정되었다. 점수 산출의 정밀도 보정과 평가자 편향 탐지를 위해 전문가가 집약적으로 제작한 영상 17건이 내부 대조군으로 무작위 삽입되었다. 타당도 및 시나리오 간 일관성 평가는 요인 분석, Cronbach's α, Bland-Altman 기법을 활용하였다. 무작위 이중 맹검 설계 하에서의 GEARS 기반 평가는 우수한 타당도(KMO = 0.836, 누적 분산 85%)와 신뢰도(Cronbach's α = 0.765)를 보여주었고, 시뮬레이터 및 생체 조직 수술 모두에서 연수생과 전문가 간 구분 능력이 확실하였다(p < 0.05). Mscore-Sim은 GEARS 각 영역 점수와 유의미한 상관(R²=0.563)을 보였으며, Bland-Altman의 일치 한계(-2.1~3.8)는 평가 모드 간 점수 일관성을 검증하였다. 하위군 분석에서 본 시스템은 전문과(Δ < 0.4), 훈련 로봇 기종(Δ < 0.2), 성별(p > 0.05) 모두에서 점수의 안정성을 시사하였다. 젊은 연수생과 비교하여 연차가 높은 연수생도 생체 조직 술기에서는 유의한 차이를 보이지 않아, 경험에 따른 보완 효과를 시사하였다. 본 평가는 전문과를 초월해 연수생의 술기 능력을 객관적으로 구별할 수 있었으며, 이질적인 로봇 수술 훈련에서의 표준화된 평가 도구로서 잠재력을 보였다.