Multimodal AI Systems Architect (AI Engineering)

Hyphen Connect Limited

  • San Francisco, California
  • 30+ days ago

    Highlights

    This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative. We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models.

    Numbers & Facts

    LocationSan Francisco, California

    Description

    We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.

    Responsibilities:

    • Integrate vision encoders and audio-native models into core agent reasoning loops.
    • Optimize streaming latency for voice-to-voice AI interactions.
    • Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.

    Qualifications:

    • Experience with Whisper, CLIP, and multimodal LLM integration.
    • Knowledge of streaming architectures and WebRTC.
    • Expertise in cross-modal alignment.

    Similar Jobs

    See more jobs