Unverified paper record
Vision Transformer-Capsule Network for Orange Quality Inspection: Ripeness and Black Spot Disease Detection
Applied Fruit Science · 1 Aug 2025
Abstract
The accurate classification of orange fruit ripeness and early detection of citrus black spot disease are crucial for optimizing harvest timing, ensuring post-harvest quality, and minimizing economic losses. Traditional manual inspection methods are subjective and inconsistent, necessitating automated deep learning techniques. This study proposes a ViT-CapsNet hybrid model, integrating Vision Transformers (ViT) for global feature extraction with Capsule Networks (CapsNet) for spatial hierarchy preservation, leading to superior classification accuracy, segmentation performance, and robustness. The dataset comprises 400 images Unripe (100), Half-Ripe (100), Ripe (100), and Infected (100) sourced from Hugging Face. Data augmentation, including rotation, brightness adjustment, flipping, and CutMix, expanded the dataset to 1200 images, improving generalization. The ViT-CapsNet model achieves 95.37% training accuracy and 96.12% validation accuracy, outperforming ViT-only (88.45%), CapsNet-only (86.39%), CNN (89.72%), and ViT-CNN hybrid (90.81%). The F1-score per class is Unripe: 0.88, Half-Ripe: 0.85, Ripe: 0.94, Infected: 0.92. The Intersection over Union (IoU) score (0.70) and dice coefficient (0.82) surpass CNN’s 0.65 and 0.78, respectively. The precision-recall under the curve (AUC) is 0.93, exceeding ResNet-50 (0.86), MobileNetV2 (0.84), and CNN (0.88). The model maintains 94.21% accuracy under normal conditions, dropping to 85.37% (Gaussian blur), 80.23% (JPEG compression), and 78.64% (occlusions). The out-of-distribution (OOD) detection score is 0.84, and inference time is 0.05 s. Training used AdamW optimizer (learning rate: 0.0001, batch size: 32, 60 epochs), achieving 0.301 validation loss. The proposed ViT-CapsNet model is a scalable and efficient solution for real-time agricultural automation.
Plant phenotyping relevance
オレンジ果実の熟度および黒点病状態を画像から推定する深層学習手法を開発し、複数モデルとの精度比較、頑健性、OOD性能、推論時間を評価しており、植物状態の取得・判定法が中心である。
abstractThis study proposes a ViT-CapsNet hybrid model, integrating Vision Transformers (ViT) for global feature extraction with Capsule Networks (CapsNet) for spatial hierarchy preservation, leading to superior classification accuracy, segmentation performance, and robustness.
abstractThe ViT-CapsNet model achieves 95.37% training accuracy and 96.12% validation accuracy, outperforming ViT-only (88.45%), CapsNet-only (86.39%), CNN (89.72%), and ViT-CNN hybrid (90.81%).
Code and data availability
公開状態または取得可能な本文経路を確認できませんでした。
No evidence-backed public reproduction asset is currently recorded.
This is an automatically classified, unverified record. Curator approval is required before any resource enters the Catalog.