AI Jobs Map

avatarin · Tokyo, Japan

【Speech AI】Machine Learning Engineer

mid_levelfull timePosted 3 days ago
Apply on LinkedInOpens the original posting. AI Jobs Map never asks for your details.

Stack mentioned

machine-learningragpythonc++gitdocker

■ avatarin株式会社について

avatarin株式会社は、「誰もが瞬時かつ持続的に遠隔地へ移動できる世界」を実現するため、2020年にANAホールディングス株式会社からスピンオフして設立されたスタートアップです。AIとロボティクスを融合し、人の"存在"や"スキル"をリアルタイムに遠隔地へ届けるコア技術を開発しています。

大規模な事業を運営する企業では、業務システムやオペレーションが複雑に分断され、顧客接点も業務接点もバラバラに存在しています。avatarinは、企業内に散在する知識とワークフローを統合し、PC・スマートフォン・固定電話・ロボット・スタンション・卓上端末など、あらゆる接点をOne Intelligence——単一のAI基盤——でつなぎ変えていきます。

これにより、お客様とスタッフにこれまでにない課題解決体験を生み出し、世界最大の人助けネットワークの実現を加速します。現在は航空領域で培った高度なオペレーション知見を起点に、リテール・行政など幅広い領域へ展開を進めています。

■ 募集職種概要(Job Description)

avatarinの「AI & Robotics」チームのAIエンジニアとして、フラッグシップロボット「newme」に新たなSpeech AI機能を追加する開発を担当していただきます。

AI & Roboticsチームは、ビジネスパートナーのサービス効率向上に向けたソリューション開発に取り組んでいます。プロジェクトでは、従来型およびディープラーニングを用いたコンピュータビジョン、音声認識(ASR)、音声合成(TTS)、RAG(Retrieval Augmented Generation)などの技術を活用します。

Speech AIの専門家として、音声認識(ASR)、発話区間検出(VAD)、言語判定、感情認識、話者ダイアライゼーション、音声ノイズ除去・クリーニングなど、音声系タスク全般に携わっていただきます。AI関連のコードベースは主にPythonで書かれていますが、newme(Jetsonボード)上で動作するプログラムは統合のしやすさからC++で実装されており、両言語での開発が求められます。

■ 業務内容(Responsibilities)

1.Speech AI基盤の設計・開発

- 音声認識(ASR)・発話区間検出(VAD)・言語判定・感情認識・話者ダイアライゼーション・音声ノイズ除去を統合したSpeech AIパイプラインの設計・実装

- ANAトップタレントの接客データを活用した「Omotenashi AI」の音声モデル開発・チューニング

2.プロダクトへの社会実装

- 数千台規模のnewme(Jetsonボード)へ安定的にデプロイ可能な、高性能かつ軽量な音声AIモジュールの設計・実装(Python / C++)

- 航空・リテール・行政など多領域の現場環境(騒音・多言語・多話者)に合わせた音声処理の最適化

3.R&D・技術探索

- Speech AI分野における最新論文・技術動向の調査と、プロダクトへの応用検討

- 自社AIデータセンター(NVIDIA B300等)を活用した大規模音声モデルの実験・評価

- マルチモーダルAI(音声×映像×テキスト)の研究開発と新機能プロトタイピング

4.チーム連携・品質向上

- AI & Roboticsチーム内でのコードレビュー、技術共有、アーキテクチャ議論への参加

- Human in Command(HIC)思想に基づく、人間主導のAI設計・安全性検証

■ 必須スキル(Must-have skills)

1.プログラミング・開発基盤

- Pythonを用いたデータ処理・モデル開発の実務経験

- Gitによるバージョン管理、Docker / Podman 等を用いたコンテナベースの開発・デプロイ経験

2.Speech AI・音声処理

- 音声信号処理の基礎知識(スペクトログラム、MFCC、フーリエ変換など)

- 以下の音声系タスクのうち、1つ以上の実務または研究経験:

- 音声認識(ASR)

- 発話区間検出(VAD)

- 話者ダイアライゼーション

- 感情認識

- 音声ノイズ除去

3.機械学習・ディープラーニング

- 深層学習の基礎知識(CNN / RNN / Transformer アーキテクチャの理解)

- 音声系モデルの学習・評価・推論パイプライン構築の経験

4.言語

- 日本語ネイティブレベル

- 英語(日常会話レベル)

■ チームカルチャー

- 協調性・コミュニケーション力が高く、学習意欲のある方

- 自律的かつクロスファンクショナルなチームで、価値あるチームメンバーとして働ける方

- 常に学び、実験し、改善を繰り返すスピード感のある環境を楽しめる方

- エンジニアリングマインドを持ち、パフォーマンスと堅牢性にこだわれる方

- 前向きで主体的に行動できる姿勢

- 開発に関わるコミュニケーションは日頃英語で行う

■ 選考プロセス(Selection Processes)

- 性格検査(25min)

- オンラインスキルテスト(90min)

- 1次面接 with 採用担当(45min)

- テクニカル面接 with マネージャー (90min)

- 最終面接 with 役員 (60min)

■ 勤務条件(Working Conditions)

- フレックスタイム制:1日8時間・週5日勤務(7:00〜22:00の間)

- 週2日のリモートワーク可(パフォーマンスにより最大週4日まで拡張可)

- 連続休暇制度(最大1か月取得可能)

- 月次/四半期ごとの会社主催チームランチ・ディナー

- 全社レクリエーションイベント(ランチ会、BBQ、合宿など)

- 技術チームは完全英語環境

■ 福利厚生(avatarin benefit program)

- 年次有給休暇:15日(最大2年まで繰越可)

- 通勤手当(自宅最寄駅~会社まで)

- 住宅手当:月3万円(会社から5km圏内)

- 子ども手当:月1万円/人(最大2人・14歳まで)

- 学習・自己研鑽支援制度:年3万円まで(キャリア成長に関連するものに限る)

- 深夜勤務手当(22時以降)

- 各種社会保険完備(健康・年金・雇用保険:従業員50%/会社50%負担)

- 産前産後休暇・育児休暇(入社1年後より最大1年間)

More jobs at avatarin