for next-generation multimodal AI models.You will play a critical role in annotating, evaluating, and improving high-quality training data that powers AI systems in action recognition, reasoning, audio-visual synchronization, and more.Key ResponsibilitiesPerform detailed
video analysis
and annotation including action anticipation, temporal ordering, counting & tracking, and high-density movement retrieval.Conduct
audio-visual evaluation
, speech-action alignment, sound source identification, and paralinguistic analysis.Write high-quality
prompts
and event descriptions with precise constraints.Perform
Bounding Box
annotation and quality evaluation.Carry out
Optical Character Recognition (OCR)
in videos.Evaluate AI model responses using weighted criteria and write professional rationales.Correct audio transcripts and provide detailed reasoning.Maintain exceptional attention to detail and consistency across complex tasks.Required Skills & QualificationsStrong experience in
Video Annotation
,
Audio Annotation
, or
Multimodal Data Labeling
.Excellent
contextual comprehension
and fine-grained attention to detail.Proven ability in
Prompt Writing
, event description, and constraint design.Good understanding of
Reasoning & Intent Understanding
, Temporal Ordering, and Action Analysis.High proficiency in
English
(both written and spoken) for qualified rationale writing.Experience with annotation tools (Labelbox, CVAT, etc.) is a plus.Assessment ProcessShortlisted candidates will be required to complete a
2-hour online assessment
(75% passing criteria) covering video understanding, audio analysis, prompt writing, and quality evaluation. Use of any AI tools during the assessment will lead to disqualification.Hiring ProcessTechnical AssessmentPearson AssessmentHR Screening
📌 Analyst (Mumbai)
🏢 Innodata
📍 Mumbai
Reply to this offer
Impress this employer describing Your skills and abilities, fill out the form below and leave Your personal touch in the presentation letter.