Research
Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings
The Neural Concept Verifier (NCV) framework combines Prover-Verifier Games (PVGs) with expressive concept encodings to enhance verifiability in high-dimensional nonlinear classification tasks. By utilizing minimally supervised concept discovery models, NCV extracts interpretable concept encodings from complex inputs and employs a nonlinear predictor for decision-making, outperforming traditional concept-based models and pixel-based PVG classifiers in evaluations. This approach addresses the challenge of verifiability in AI systems, particularly in mitigating shortcut behavior, making it significant for practitioners focused on building interpretable and reliable AI models.
verifiabilityconcept encodingsclassification