Speech-conditioned grasping reduces interaction latency

Speech2Grasp adapts text-conditioned grasp detection directly to spoken commands and reports lower latency than cascaded speech recognition.

Direct multimodal control can improve responsiveness but increases requirements for synchronized audio, vision, and manipulation pipelines.