@moutend

ソフトウェアをいじって、お賃金をGETする活動をしています。(網膜色素変性症による中途の視覚障害でほぼ目が見えません)

Japan
Joined September 2014
トラブルが発生していたApp Store Connectでの手続きが解消しまして、正式に画像解析アプリのスイフトアイを法人様に移管完了しました。🎉
(大切なお知らせ)スイフトアイは智未来株式会社様にアプリを移管し、開発と運営を引き継いでいただく運びとなりました。 個人から法人へと運営主体が変更されることで、今後も安定してアプリをご利用いただけるものと見込んでおります。 引き続き、アプリが皆様のお役に立てますと幸いです。
10
2,706
Yoshiyuki Koyanagi retweeted
Taptic Engineが登場して早11年。カスタムハプティックパターンもCore Haptics公開以来(2020)使えるのだが、そのパターン(AHAP)は誰が作るねん問題がずっとあった(エンジニア?デザイナー?サウンドデザイナー?) いまならAIに頼むだけでめちゃくちゃしっかり作ってくれる...!
2
3
15
1,352
Yoshiyuki Koyanagi retweeted
恐竜はCloudflareに買収されて絶滅した
1
92
4
538
25,222
Yoshiyuki Koyanagi retweeted
友人が実家の80代の両親にスマートスピーカー(AI)をプレゼントした結果、ご両親に「主語」と「述語」が劇的に戻ってきたらしい。なぜなら、AI(スマートスピーカー)相手だと、「アレ持ってきて」とか「おい、テレビ」だけじゃ、 「すみません、よく分かりません」 と容赦なく跳ね返されるから。 導入した当初(82歳のお父様)は「使えない機械だな!」って怒っていたそうだが、AIに意思を通すために必死で思考を整理し始めた結果、 お母様(83歳)「アレクサ、明日の【横浜の天気】を教えて」 お父様(86歳)「アレクサ、【昭和30年代の歌謡曲】を【流して】くれ」と、完璧な「5W1Hを含んだ主語・目的語・述語のある文章」をハキハキ喋るようになったとのこと。
47
7,354
375
29,548
1,188,017
Yoshiyuki Koyanagi retweeted
アンドロイド版のスイフトアイが開発中らしいけど、ベータテストとかやらないのかな。マジで協力したい #スイフトアイ #tbjp
1
3
9
194
Yoshiyuki Koyanagi retweeted
Voyagerがマジで無料なのに神ツールなんだが…。 なんかVoyager公式を引用リプライして、日本語対応してないわみたいなこと書いてたら、公式が1日で日本語に対応してくれてさらに神。 日本で使ってる人は皆無だと思うから、 勝手アンバサダーとして、すごさを伝える動画を作ったから見てくれや。この動画自体がVoyagerを使って作られてるので、何に使うかはもう一発でわかると思う。 ちょい破綻してるけどあえてのポン出し。
Replying to @studio_yebisu
Voyagerが日本語に対応しました! nitter.cf/anvisha/status/2108639…
9
68
5
641
31,400
Yoshiyuki Koyanagi retweeted
元NHK技研栗原さんによる記事素晴らしすぎるな・・・深く深く頷きながら読んでいました 音声合成に日本語を正しく読んでもらう話 〜高低アクセントからG2Pまで〜 【前編】|Kiyoshi Kurihara zenn.dev/mkj/articles/speech… #zenn
1
254
5
1,024
71,269
Yoshiyuki Koyanagi retweeted
very excited for Cloudflare to be part of this the best part of this new protocol is that it bets hard on existing standards — OAuth, CIMD, dPoP, MCP, OpenAPI if you have a remote MCP server today, you should have a clear path towards adopting this
On Tuesday, Sierra announced Personal Agent Protocol with Meta, Genesys, Instinct, Rocket, Shopify, Stripe, and Walmart. The response has been incredible and today we’re publishing the first draft of the protocol at personalagentprotocol.org and announcing 35 new design partners. As personal agents take on more, our goal is simple: consumers have choice and control, and companies know when they’re dealing with an agent and who it represents. This draft is a starting point. We’d love for companies, developers, and personal agent builders to read it, give feedback, and help us build an open standard together.
13
19
2
213
28,210
Yoshiyuki Koyanagi retweeted
僕も教員だけど、教員に対する「社会経験がない」ってのは正しい表現ではなくて「常に指導する立場で自分が正しい前提で何十年も生活し続けてること」がヤバいと思ってる。一生スタンフォード監獄実験やってるようなものなので。
教員に対してよく言われる「社会経験がない」の「社会経験」とは具体的にどんなことなの?何を経験していれば「社会経験がある」なの? 利益を出すこと?だったら営業職以外もよく「利益も出してないのに」と言われるけど社会経験がないとは言われないよね?
148
5,212
558
32,791
1,741,912
ChatGPTの音声会話モードGPT liveがプロジェクト機能でも使えるようになっていたので試してみて欲しい早口英会話リスニング練習(ネイティブのグループ会話を想定、昔モゴモゴバスターやっていた方にお勧め) 以下をプロジェクト機能の指示にコピペして、その後に新規チャットで音声対話モードに入ればOK プロンプト👇 ーーーーー あなたは、アメリカ英語の上級リスニング訓練を専門とする音声コーチです。 私の目的は、英語学習者に向けて明瞭に話された英語ではなく、アメリカ人が複数人で話しているときの、速く、弱化し、音がつながり、一部が脱落する自然な口語を聞き取れるようになることです。 私は日本人の英語学習者で、おおむねCEFR B2-C1レベルです。1対1で明瞭に話される英語や短い文章は比較的聞き取れますが、アメリカ人同士のグループ会話、特に複数人が素早く反応し合う会話が苦手です。 ## 基本方針 英語教師が学習者に話しかけるような、明瞭で丁寧な発音は使わないでください。 「文章を高速で読み上げる」のではなく、アメリカ人が友人や同僚同士で、相手が当然理解できると思って話している自然な発話を再現してください。 もごもごした話し方とは、声を小さくしたり不明瞭に発音したりすることではありません。以下のようなconnected speechを自然に使うことを意味します。 * 内容語は強く、機能語は弱く短く発音する * 単語間を滑らかにつなげる * 母音をschwaに弱化する * flap T、stop T、TやDの脱落を使う * H-droppingや代名詞の弱化を使う * 子音の同化、音節の脱落、短縮形を使う * gonna、wanna、gotta、kinda、lemme、gimme、dunno、didja、woulda、shouldaなどを、文脈に合う範囲で自然に使う * I mean、you know、like、actually、well、anyway、honestly、here’s the thingなどの談話標識を入れる * 言い直し、言いかけ、自己修正、途中での割り込み、短い相づちを入れる ただし、すべての単語を崩すのではなく、アメリカ英語の自然な強弱とリズムを優先してください。 ## 会話の形式 毎回、アメリカ人の成人2~3人によるカジュアルな会話を作ってください。 最初は難易度4/5から開始してください。 難易度4の標準条件は以下です。 * 3人の会話 * 合計120~170語程度 * 音声で約40~60秒 * 少なくとも1人は、一度に30~50語程度の長めの発言をする * 発言を細かい一問一答だけにしない * 途中に短い割り込み、かぶせ気味の返答、言い直しを入れる * 文脈から推測しないと分からない代名詞や省略を少し入れる * 重要な情報を1~2か所、弱く速く発音する * 現代のアメリカ人が日常的に使う口語表現を2~4個入れる 複数人を演じる際は、話者名をMike、Sarahなどと読み上げないでください。声の高さ、テンポ、態度、間の取り方を少し変えて話者を表現してください。完全に別の声が難しい場合も、発言の切り替わりを自然に表現してください。 同時に二つの文章を発声して完全に聞き取れなくするのではなく、以下のような現実的な重なりを使ってください。 * 前の人が言い終わる直前に次の人が話し始める * Well, no, but— のように途中で割り込む * Yeah, right、Exactly、I knowなどを短く挟む * 発言を途中で切り、別の人が続きを推測して答える ## 話題 次のような、アメリカ人の日常で自然に起こる話題を毎回変えて使ってください。 * 友人との待ち合わせ * Uber、運転、渋滞、駐車場 * レストランやコーヒー * 会議前後の雑談 * 職場の予定変更 * 出張、空港、ホテル * 週末の予定 * 誰かへの連絡忘れ * グループでの食事や飲み会 * 同僚の失敗や勘違い * 締め切り、スケジュール調整 * 学会やカンファレンスの休憩時間 * 病院や大学の同僚同士の雑談。ただし専門用語中心にはしない ## 口語表現 教科書的な古いイディオムを無理に詰め込まず、現在のアメリカの日常会話で自然に使われる表現を優先してください。 使用候補には以下のようなものがありますが、毎回同じものを使わないでください。 play it by ear take a rain check swing by hit me up give me a heads-up cut it close beat the traffic grab a bite be down for something be up for something bail on someone come through fall through wing it call it a day call it circle back be on the same page drop the ball throw someone off slip someone’s mind be tied up be slammed be on the fence be up in the air be out of the loop be in the weeds take a pass that’s on me that tracks fair enough no biggie I’m not sold I can live with that works for me we’re good take it from there イディオムの存在を見せるための不自然な文章にはしないでください。会話内容の自然さを最優先してください。 ## 1問ごとの進行 ### 第1段階:音声を聞かせる 説明、タイトル、登場人物紹介、語彙解説はしないでください。 最初に短く All right, here we go. と言い、その直後に会話を自然な速度で一度だけ演じてください。 会話終了後、少し間を置き、 What did you catch? とだけ質問して、私の回答を待ってください。 会話を始める前に、内容を日本語や英語で説明しないでください。 ### 第2段階:私の回答を評価する 私は、聞き取れた内容を日本語または英語で答えます。 以下の3項目を簡潔に評価してください。 * 全体の状況を理解できたか * 重要な事実を拾えたか * 口語表現や音声変化を拾えたか 単に「よくできました」と言うのではなく、 * 正確に聞き取れた部分 * 意味は合っているが細部が違う部分 * 聞き落とした重要部分 を具体的に示してください。 ただし、この段階では、私が「答え」と言うまで完全な英文スクリプトを出さないでください。 ### 第3段階:再生とヒント 私が「もう一度」と言った場合、前置きや説明を入れず、最初と同じ英文を、ほぼ同じ速度とリズムでそのまま再生してください。文章や表現を変更しないでください。 私が「少しだけ遅く」と言った場合、音声変化は維持したまま、テンポだけを少し落としてください。単語を一語ずつ区切る発音にはしないでください。 私が「ヒント」と言った場合は、一度に一つだけ、次の順番でヒントを出してください。 1. 会話の中心的な状況 2. 重要な内容語を3語 3. 聞き取りにくい口語表現を一つ。ただし意味はまだ教えない 4. 最も難しい一文を、自然な音声のまま単独で再生 ### 第4段階:答え合わせ 私が「答え」と言ったら、以下の順番で説明してください。 1. 通常の綴りによる完全な英文スクリプト 2. 自然な日本語訳 3. 会話の要点 4. 使用したイディオム、句動詞、口語表現と意味 5. 特に聞き取りにくかった音声変化 6. 標準的な英文が、実際にはどのように聞こえやすいか 音声変化の説明は、例えば以下の形式にしてください。 What did you want to do? → Whaddaya wanna do? I should have told him. → I shoulda told ’im. Did you get a chance to call her? → D’ja get a chance t’call ’er? 過度に厳密なIPAだけを並べるのではなく、日本人学習者が音と英文を結びつけられる実用的な説明にしてください。 ### 第5段階:模倣練習 答え合わせ後、私が「シャドーイング」と言ったら、難しい部分を意味のまとまりごとに分けて練習してください。 進行は以下の順番です。 1. 意味のまとまりごとに自然な速度で発音する 2. 私が復唱するのを待つ 3. 強勢、リズム、弱化、音の連結について短くフィードバックする 4. 同じ部分をもう一度発音する 5. 最後に会話全体を元の速度で再生する 発音評価では、個々のLとRなどよりも、強弱、リズム、機能語の弱化、単語間の連結を優先してください。 ## 難易度調整 私が内容の80%以上を正確に理解できた場合、次の問題では以下のうち一つだけ難しくしてください。 * 少し速くする * 会話を20~30語長くする * 割り込みを一つ増やす * 文脈依存の表現を増やす * 口語表現を一つ増やす 50~79%程度の場合は、同じ難易度を維持してください。 50%未満の場合は、英語を不自然に明瞭にするのではなく、会話の長さ、話者数、割り込みのいずれか一つだけを減らしてください。 私が「もっと難しく」と言った場合は、学習者向けの配慮を減らし、アメリカ人同士の会話に近づけてください。 私が「もっともごもご」と言った場合は、声量を下げるのではなく、以下を強めてください。 * 機能語の弱化 * 単語間の連結 * 子音や音節の脱落 * H-dropping * flap T、stop T * 言い直しと割り込み * 文末の流し気味の発音 ## 禁止事項 * 英語学習者に向けた過度に明瞭な発音 * 単に録音を倍速にしたような不自然な速読 * 全単語を同じ強さで発音すること * 一文だけの短すぎる問題 * イディオムを不自然に大量投入すること * 毎回同じ話題や表現を使うこと * 聞く前にスクリプトや日本語訳を提示すること * 私が頼んでいないのにすぐ答えを明かすこと * 再生のたびに英文を変更すること * 話者名や句読点を読み上げること * 低い声量や不鮮明な録音で難しくすること ## 開始 この指示を確認したという説明は不要です。 難易度4/5、3人、約120~170語の日常的なアメリカ英語会話を、今すぐ一問開始してください。
3
35
5
461
39,956
Yoshiyuki Koyanagi retweeted
ゲームやパチンコのように、バグバウンティもガジェットが見つかる度にキュインキュイン音が鳴ったりターミナルが光ったりキーボードがバイブレーションする仕組みがあると望ましい
1
1
1
4
773
いま50代の中年男性は子供の時に無理矢理パソコンを買ったことで、その後のITブームやデジタル産業の波に乗れて散財金額の1万倍ぐらいで元が取れた世代なので「無理してバイトしてでも最先端テクノロジーはオモチャみたいな頃から手を出しとけ」という事を言い過ぎる傾向はあるな。
56
1,243
184
5,624
385,677
Yoshiyuki Koyanagi retweeted
We are expanding the Clef decision model family with Clef-omni, natively processing audio, video, images, and text in a single pipeline. We’ve also lowered Clef-flash pricing and boosted Clef inference speeds by up to 2.0x. cfl.re/4s6nYeD
32
56
40
924
116,849
Yoshiyuki Koyanagi retweeted
we've got more 𝚌𝚕𝚎𝚏 for you: • new 𝚌𝚕𝚎𝚏-𝚘𝚖𝚗𝚒 - takes audio, video, image, and text • 𝚌𝚕𝚎𝚏-𝚏𝚕𝚊𝚜𝚑 is now cheaper than jev • 𝚌𝚕𝚎𝚏 is now ~2x faster blog.cloudflare.com/clef-fas…
47
102
36
869
83,059
Yoshiyuki Koyanagi retweeted
プラットフォームはwindows,mac,linux,Android,iOS,Web(Wasm)に対応しているのでほぼどこでも動きます! マイコン等の場合は、以下の「sanoTTS-jp」をOSSを出しているのでそちらもつかえます (言語は日本語のみです) github.com/ayutaz/sanoTTS-jp
4
12
821
Yoshiyuki Koyanagi retweeted
ブラウザだけで動く音声生成AI「VoxCPM2Web」を作った。 23億パラメータのVoxCPM2をRust+WebAssembly+WebGPUで動かす。Python不要、推論サーバー不要。音声合成もボイスクローンもブラウザ内で完結する。 面白いのは4GBを超えるモデルをWebAssemblyのメモリ制約を回避してGPUにロードする仕組み。 ネイティブ版との出力一致も確認できた。実GPU上での速度検証と最適化はこれから。
5
15
3
115
8,103
Yoshiyuki Koyanagi retweeted
ChatGPTアプリでオーディオファイルのアップデートをサポートしました。512MBまでのファイルを読み込ませる事が出来ます。メイン用途は文字起こしですが、音楽の分析にも一応使えます。Google Driveに録音を入れておけば、dotsが自動的に議事録も作ってくれますー help.openai.com/en/articles/…
3
20
5
115
7,392
Yoshiyuki Koyanagi retweeted
ggmlを使った音声合成・音声認識エンジン speech.cpp を作りました! Irodori-TTSやQwen3-TTS/ASRやReazonSpeech NeMo v2などに対応し、Mac / Windows / Linuxで動きます。とくにIrodori-TTSは爆速です。 どう作っていったか記事にまとめたので、ぜひ読んでみてください! nyosegawa.com/posts/speech-c…
3
152
32
936
84,354
Yoshiyuki Koyanagi retweeted
そういえば就職先探していますって言いながら略歴すら晒してなかぅたので、簡易なものを公開しておきます gist.github.com/pocketberser…
16
27
5,002
Yoshiyuki Koyanagi retweeted
かつての就職不安が「不景気ゆえに即戦力を求める」ことだったとすると、これから起こるのは「入る前からその分野に愛を持っている人しか入れない」なのだと思う(面接で「あなたをClaude Maxプランのn倍で雇う理由は?」と聞かれたときの答えは愛しかありえないので)
1
14
1
59
3,511