We are hiring AI Data Annotation Specialists for an exciting project involving advanced video and audio understanding for next-generation multimodal AI models.
You will play a critical role in annotating, evaluating, and improving high-quality training data that powers AI systems in action recognition, reasoning, audio-visual synchronization, and more.
Key Responsibilities
- Perform detailed video analysis and annotation including action anticipation, temporal ordering, counting & tracking, and high-density movement retrieval.
- Conduct audio-visual evaluation, speech-action alignment, sound source identification, and paralinguistic analysis.
- Write high-quality prompts and event descriptions with precise constraints.
- Perform Bounding Box annotation and quality evaluation.
- Carry out Optical Character Recognition (OCR) in videos.
- Evaluate AI model responses using weighted criteria and write professional rationales.
- Correct audio transcripts and provide detailed reasoning.
- Maintain exceptional attention to detail and consistency across complex tasks.
Required Skills & Qualifications
- Robust experience in Video Annotation, Audio Annotation, or Multimodal Data Labeling.
- Excellent contextual comprehension and fine-grained attention to detail.
- Proven ability in Prompt Writing, event description, and constraint design.
- Good understanding of Reasoning & Intent Understanding, Temporal Ordering, and Action Analysis.
- High proficiency in English (both written and spoken) for professional rationale writing.
- Experience with annotation tools (Labelbox, CVAT, etc.) is a plus.
Assessment Process
Shortlisted candidates will be required to complete a 2-hour online assessment (75% passing criteria) covering video understanding, audio analysis, prompt writing, and quality evaluation. Use of any AI tools during the assessment will lead to disqualification.